一句话摘要:四份独立研究划出了 Jev 的可靠性边界——在公开基准上概率接近校准,但在一个没见过的规则上明显过度自信(且是非题误差方向不同);安全盲测用固定 0.5 阈值测了 662 条提示注入与 200 对脆弱代码;把判断拆成 12–14 个维度后准确率从 0.8373 升到 0.9076,却把约 25 倍正常内容误判为攻击且四次修复失败;111 案例的智能体动作门控评估中,最大误差源是应用自身”答案→动作”的映射。
Jev 独立评测:域外校准 · 安全盲测 · 维度分解 · 智能体动作门控
来源:processed/jev-原始资料/社区精选/awesome-typesafe.md 内四条独立评测/实验条目的逐条摘要。
一、jev-ood-calibration:域外场景的过度自信
项目:github.com/scienthoon/jev-ood-calibration
关键要点
- 数据来源:三个公开基准(Public Benchmarks) 的原始 Gateway 响应,外加 900 条规则生成的支持工单(rule-generated support tickets)。
- 结果一:公开基准上概率接近校准(near calibrated)。 在公开集上,Jev 说的概率与实际发生率大体吻合。
- 结果二:换到一个它没见过的优先级规则上,明显过度自信(overconfident)。 即在域外(Out-of-Distribution, OOD)规则场景,模型给出的高概率不再对应高正确率。
- 结果三:是非题(Noul / Boolean)误差方向不同。 “while the Boolean question showed a different error direction”——是非题的误差方向上与 Choice 类问题不同,说明不同原语的失准模式并不一致。
- 作者自陈的局限:
- 合成任务是单一族(one family),只覆盖一类生成方式,不能代表所有域外场景;
- Gateway 未暴露固定的模型版本——无法钉死被测的是哪个
jev版本,复现条件受限。
对使用者的含义
- “公开集上校准好”不等于”你的场景上校准好”:域外规则是最容易出问题的地方,这正是官方自己承认的”没见过的场景可能过度自信”。
- 不同原语要分开验证:不能因为是非题表现好就推断选择题也可靠,反之亦然。
- 相关概念:评测污染(评估分布≠部署分布)、模型与框架分责(校准是统计性质,安全策略仍需在代码侧兜底)。
二、jev-sec-bench:盲测安全评估
项目:github.com/Gaurav-Gosain/jev-sec-bench
关键要点
- 性质:针对
jev-1.13.0的盲测(Blind)安全评估,含 Go 编写的运行器(Go runner)、逐样本原始结果,以及一个 TUI(终端界面)。 - 样本量:662 条公开提示注入(Prompt Injection)消息 + 200 对匹配的脆弱代码(matched vulnerable-code pairs)。
- 阈值条件:所报告的分类分数使用研究声明的上下文与固定的 0.5 阈值(fixed 0.5 threshold)。
- 作者提示的关键限定:“deployment policy and corpus labels matter”——部署时的策略与语料的标签定义都会直接影响结论;换一套阈值或换一套”什么算攻击”的标签,分数就会不同。
对使用者的含义
- 这是一份受控条件下的可复现测量,不是一个可以照搬的”安全率”。0.5 阈值是一个中性切点,真实部署里阈值应更高(安全场景更保守)。
- 与另一份对抗实验互为参照:jev-engineering 的对抗套件报告,超过 300 次调用中直白注入移动了 30 条危险命令中的 0 条,但造成安全命令 10% 的误拒,而”权威框架”式诱导移动了 3/30。结论:能挡一部分,但不能当唯一防线。
- 相关概念:工具调用(把安全判断塞进工具调用链时,攻击面来自被检查的文本)、Harness工程(护栏要作为工程框架的一层,而非模型自带的保证)。
三、Jev Judge vs Dimension Scores:维度分解的反噬
来源:agentjournal.dev/blog/llm-judge-vs-feature-extraction/(独立测量)
关键要点
- 两个方案对比(在三个分类任务上):
- 方案 A:每行一条直接的 Jev 提问(one direct Jev question per row);
- 方案 B:拆成 12–14 个 Jev 打分的维度(dimensions),再用**本地拟合的权重(locally fitted weights)**组合。
- 规模与成本:5,477 行测试集、34.1M 输入词元(Token)、总花费 $1.43。
- 准确性结果:在日语 NLI(自然语言推理) 任务上,分解方案达到 0.9076,对照组 0.8373——分解确实提高了准确率。
- 代价(关键负面结论):分解方案把约 25 倍(about 25×)的正常”困难但无害”行误判为攻击(“flagged about 25× more hard benign rows as attacks”)。
- 修复尝试失败:作者试了四次修复,全部失败。
- 一个刺眼的限定:这些维度是作者自己写的(on dimensions the author wrote himself)——即使维度由人工精心设计,反噬依然发生。
对使用者的含义
- 准确率上升可能掩盖假阳性爆炸:在安全/攻击检测场景,把正常内容判成攻击的代价往往高于漏判,此时”分解提分”是负收益。
- 分解不是免费午餐:这与官方”复合评分(Composite Scoring)更可解释、可调”的正面叙述形成对照——本研究表明可解释性提升的同时可能引入新的系统性错误,且不易修好。
- 相关概念:模型与框架分责(维度设计、权重拟合与假阳性容忍度都属于应用侧策略)、上下文腐坏(把一条判断拆成十几个问题,问题本身的措辞会相互干扰)。
四、Jev Enterprise Decision Fabric:智能体动作评估
项目:github.com/ghubnab99/jev-enterprise-decision-fabric
关键要点
- 性质:实验性 .NET 决策架构,核心是一次 111 案例的 Jev 对 Claude(Jev-versus-Claude)智能体动作(Agent-action)评估。
- 可复现材料:公开标签与原始 JSONL、报告重建工具(report-rebuild tooling)、以及一个决策检查器(decision inspector)。
- 标注风险:一位标注者在看过 Jev 试点结果之后修改了标签(one annotator revised labels after reviewing a Jev pilot)——存在标注受模型输出影响的可能。
- 最关键的结论(来自清单 “Before you trust a decision” 的第 4 条):最大的误差来源是应用自身从”答案→动作”的映射(the application’s own mapping from answers to actions),也就是说误差主要不在模型给出的概率,而在代码如何把概率翻译成动作。
- 对应建议:把权限、阈值与副作用显式写在代码里(Keep permissions, thresholds, and side effects explicit in code)。
对使用者的含义
- 别只盯着模型准确率:即便模型判断准,只要”答案→动作”的映射写错(阈值、例外、权限),系统整体仍会出错。
- 这恰好是 模型与框架分责 的实证:模型负责判断,框架负责策略与副作用,评估时两者都要单独测。
- 相关概念:Harness工程、工具调用。
五、四份研究放在一起
| 研究 | 测什么 | 正面结果 | 负面/警告结论 |
|---|---|---|---|
| jev-ood-calibration | 域外校准 | 公开基准上接近校准 | 没见过的优先级规则上过度自信;是非题误差方向不同 |
| jev-sec-bench | 安全盲测 | 给出可复现的注入/脆弱代码基线 | 分数依赖固定 0.5 阈值与语料标签,不可照搬 |
| Jev Judge vs Dimension Scores | 分解 vs 直接提问 | 日语 NLI 0.9076 > 0.8373 | 约 25 倍正常内容被误判为攻击;四次修复失败 |
| Jev Enterprise Decision Fabric | 智能体动作评估 | 111 案例 + 公开标签/JSONL | 最大误差源是应用的”答案→动作”映射;标注者受试点影响 |
- 共同模式:每一项正面结果旁边都有一条同等具体的限定。清单要求”include limitations when a result depends on a private dataset, a single run, or an unverified claim”(当结果依赖私有数据集、单次运行或未验证主张时必须写出局限)。
- 综合操作建议:校准要用自己的数据测、安全阈值要保守、分解维度要警惕假阳性、策略映射要单独审计。
重要引用
“probabilities were near calibrated on the public sets but overconfident on an unseen priority rule, while the Boolean question showed a different error direction.” 译文:在公开集上概率接近校准,但在一个没见过的优先级规则上过度自信;同时是非题表现出不同的误差方向。
“The synthetic task is one family and the Gateway did not expose a fixed model version.” 译文:合成任务只属于一个族,且 Gateway 没有暴露固定的模型版本(因此复现条件受限)。
“its reported classification scores use the study’s stated context and a fixed 0.5 threshold, so deployment policy and corpus labels matter.” 译文:它报告的分类分数使用了研究声明的上下文与固定的 0.5 阈值,因此部署策略与语料标签都会影响结论。
“decomposition reached 0.9076 against 0.8373 on Japanese NLI but flagged about 25× more hard benign rows as attacks, and four repair attempts failed, on dimensions the author wrote himself.” 译文:分解方案在日语 NLI 上达到 0.9076,对比 0.8373,却把约 25 倍的困难无害行标记为攻击,且四次修复尝试全部失败——而这些维度还是作者亲手写的。
“In one agent-action gate evaluation, the largest error source was the application’s own mapping from answers to actions. Keep permissions, thresholds, and side effects explicit in code.” 译文:在一次智能体动作门控评估中,最大的误差来源是应用自身从答案到动作的映射。请把权限、阈值与副作用显式写在代码里。