一句话摘要:三份独立研究共同指向同一个负面结论——在一个数据集上成立的结论换到另一个任务就失效:Janus 发现路由阈值、准确率差符号与”路由是否划算”三个参数全都不迁移;jev-orderby-bench 发现主题归属通过而商品相关性 6 项检验 4 项不通过,且请求形状(批量)会改变结果;jev-calibration-audit 发现拿掉”unknown”选项会迫使模型对无解题目硬答。

Jev 独立评测:Janus · jev-orderby-bench · jev-calibration-audit

来源:processed/jev-原始资料/社区精选/awesome-typesafe.md 内三条独立评测条目的逐条摘要。三项研究均针对 jev-1.13.0。


一、Janus:阈值不可迁移(Routing threshold does not transfer)

项目:github.com/FirasSX914/Janus(pip install janus-decide)

关键要点

  • 做法:对 Jev 做独立校准测量,数据集是 Banking77(银行意图分类)与 Web of Science(学科分类)两个有标注集;并测一条 Jev → 前沿模型(Frontier Model)级联(Cascade) 的路线,按实测词元逐行定价。
  • 工具化:现已打包为可安装工具(pip install janus-decide),功能是在你自己的数据上测量一个阈值;它默认不附带任何阈值(ships none by default)。这直接对应 置信度门控 与 模型路由 的落地前提:阈值必须在本地标定。
  • 方法学严谨性:协议在任何结果产出之前就已冻结(protocol was frozen before any result),原始 JSONL 与图表已提交到仓库,可复盘。
  • 核心负面结论:没有任何路由参数在两个数据集之间迁移。 具体三项全变:
    1. 最优阈值变了(optimal threshold);
    2. 两个模型之间准确率差的符号变了(the sign of the accuracy gap between the two models)——即在数据集 A 上 Jev 更准,在数据集 B 上可能反过来;
    3. “路由是否划算”的结论变了(whether routing paid for itself)——级联是否省钱不再成立。
  • 作者因此不提供默认阈值:既然参数不可迁移,给出一个”默认阈值”就是误导。
  • 作者自陈的数据局限:Web of Science 的标签来自出版物元数据(Publication Metadata)而非逐文档标注,所以该数据集上测到的误差有一部分其实是标签本身的歧义(label ambiguity),不能全部算到模型头上。

对使用者的含义

  • 用别人的阈值等于用一个在别人数据集上拟合的数字;换工作负载必须重新测量。这与官方”先用保守阈值、用自己的数据测”的说法一致,但 Janus 给了更硬的证据:连”用 Jev 是否省钱”这个方向性结论都能翻转。
  • 相关概念:评测污染(评估条件与部署条件不一致时指标失效)、模型与框架分责(阈值属于框架侧策略,不属于模型)。

二、jev-orderby-bench:把排序当排序来测

项目:github.com/yodablocks/jev-orderby-bench

关键要点

  • 研究问题:对 Jev 概率做 ORDER BY 是否站得住脚(即”分类准确率高”是否等于”拿它的概率排序就有用”)。这是 重排序 场景的直接前置检验。
  • 预注册门槛(Pre-registered Gate):在跑之前就定好要检验的条件——
    1. 成对逆序(Pairwise Inversion);
    2. Score 的序数性(Score Ordinality) 对上一个分级目标;
    3. 校准(Calibration);
    4. 否定不变式(Negation Invariant);
    5. 复述不变式(Paraphrase Invariant);
    6. (共六项条件,见下结果)。
  • 结果一:20 Newsgroups(新闻组主题归属)——通过。 jev-1.13.0 在主题归属任务上通过了检验。
  • 结果二:Amazon ESCI(人工分级的商品相关性)——六项条件中四项不通过。 即在同一模型、同一版本下,换到商品相关性排序任务就垮了。
  • 结果三:请求形状会改变数字(请求形状 = Request Shape)。 DuckDB 相关集成的请求形状被证明会改变结果:把 40 行打包成一次批量请求(batched state),会失败于”每行一次请求”能通过的排序门槛。结论很尖锐:同样的数据,问法一变,结论可能就变。
  • 结果四:两位小数导致并列,LIMIT k 会切在并列内部。 输出只保留两位小数,导致 360 行中有 53 行在顶部并列,此时 LIMIT k 是在一组并列里随机切。
  • 规模与可复现性:一个随机种子(one seed)、30 条 ESCI 查询;聚合结果已提交;语料与缓存响应在本地重新生成,成本约一美分。

对使用者的含义

  • 分类准确率不能替代排序质量:分类看的是单点判定,排序看的是成对次序,两者是不同指标。
  • 批量提问会污染排序:把多行塞进一次请求虽然省钱,但会改变每行的概率,从而破坏排序门槛——省钱与保真之间存在取舍。
  • 输出精度是排序系统的一部分:两位小数的离散化会造成大量并列,直接破坏 top-k 的选择。
  • 相关概念:上下文腐坏(把不相关内容混入同一状态会拉低判断)、工具调用(把排序判断交给模型时,接口形状决定结果)。

三、jev-calibration-audit:弃权选项(Abstention Option)的重要性

项目:github.com/jujumilk3/jev-calibration-audit,针对 jev-1.13.0 的独立审计。

关键要点

  • 可复现性:提供可复现代码与逐调用(per-call)JSONL。
  • 测试的四个维度:
    1. 弃权选项(Abstention Options)——是否给模型”其他/不确定”的出口;
    2. 匹配的韩语与英语条目(matched Korean and English items)——跨语言比对;
    3. 问题形状干扰(Question-shape Interference)——不同问法之间的相互影响;
    4. 选项顺序(Option Order)——选项排列位置是否影响结果。
  • 核心强结论(弃权实验):在 KoBBQ 数据集上,如果移除”unknown”这个 Choice 选项,就会迫使模型对本来无法回答(unanswerable)的条目硬选一个答案。
  • 作者明确的限定:这个强弃权结论是在 KoBBQ 数据集上的发现,不是普适的校准保证(“its strong abstention finding is on the KoBBQ dataset, not a universal calibration guarantee”)。

对使用者的含义

  • 设计选项时要为歧义留出口:任务允许模糊时,应包含”无匹配 / 其他 / 转人工”选项,否则模型会在无解题上编出一个答案。
  • 这与 awesome-typesafe 清单 “Before you trust a decision” 的第 1 条完全对应:“Give uncertain cases somewhere to go.”(给不确定的案例留出出口。)
  • 相关概念:模型与框架分责(选项集与回退路径属于应用侧设计)。

四、三份研究放在一起:共同的元结论

研究通过的部分失败/失效的部分直接原因
Janus校准可被测、级联可逐行定价阈值、准确率差符号、路由是否省钱全部不迁移数据集不同 → 参数不可迁移
jev-orderby-bench20 Newsgroups 主题归属Amazon ESCI 6 项中 4 项不通过;40 行批量使排序门槛失败任务不同 / 请求形状不同
jev-calibration-audit可复现的逐调用审计拿掉 “unknown” 后无解题目被硬答选项集设计缺陷
  • 共同结论:“Jev 在某个任务上有一项好结果”不能外推。数据集、任务类型、请求形状、选项集设计,任何一项变化都可能让结论翻转。
  • 清单对此的总括:“Treat their results as test designs for your workload, not universal guarantees.”(把结果当作你自身负载的测试设计,而非普适保证。)

重要引用

“The protocol was frozen before any result and the raw JSONL and figures are committed, and no routing parameter transferred between the two datasets, as the optimal threshold, the sign of the accuracy gap between the two models, and whether routing paid for itself all changed.” 译文:协议在任何结果之前就已冻结,原始 JSONL 与图表已提交;没有任何路由参数在两个数据集之间迁移——最优阈值、两模型准确率差的符号、以及路由是否划算,全都变了。

“The Web of Science labels come from publication metadata rather than per-document annotation, so part of the error measured there is label ambiguity.” 译文:Web of Science 的标签来自出版物元数据而非逐文档标注,因此在那里测得的误差有一部分是标签歧义。

“jev-1.13.0 passes on 20 Newsgroups topic membership and fails four of six conditions on Amazon ESCI human-graded product relevance, the DuckDB integrations’ request shapes are shown to change the numbers (a 40-row batched state fails the ranking gate that one row per request passes), and two-decimal output leaves 53 of 360 rows tied at the top so LIMIT k cuts inside a tie.” 译文:jev-1.13.0 在 20 Newsgroups 主题归属上通过,却在 Amazon ESCI 人工分级的商品相关性上六项条件中四项不通过;DuckDB 集成的请求形状被证明会改变数字(40 行批量状态通不过”每行一请求”能通过的排序门槛),且两位小数输出让 360 行里 53 行在顶部并列,于是 LIMIT k 切在并列之中。

“Its strong abstention finding is on the KoBBQ dataset, not a universal calibration guarantee.” 译文:它那个强有力的弃权发现是在 KoBBQ 数据集上得出的,并非普适的校准保证。