Jev 知识:一个”只会做判断”的 AI
写给完全不懂技术的人。全篇不写代码,只讲清楚:它是什么、怎么工作的、现在能干嘛、以后可能干嘛、我该怎么用、它哪里不行。
所有内容来自一手材料:TypeSafe 官方文档(109 页)、官方博客、官方评测站,以及公开的独立第三方实测与开源项目。没有任何一句来自推测。 凡属”官方声称”或”未经独立验证”的,都单独标注。原始语料已归档在
processed/jev-原始资料/。
第 0 部分 · 先用大白话搞懂它是什么
0.1 一句话
Jev 是一个**“只会做选择题的 AI”**。你给它一段材料(一段文字、一份表格),再问它问题,它在几十到几百毫秒内给出答案,并附上一个”它有多确定”的分数。
它不写文章、不聊天、不解释理由。它只做判断,而且答案必须从你预先给定的选项里挑。
打个比方:ChatGPT 像一个会写报告的助理;Jev 像一个站在流水线旁的分拣工人——看一眼包裹,几十毫秒贴上标签,扔进对应的格口。前者的价值在”表达”,后者的价值在”判断的速度和规模”。
0.2 它和 ChatGPT 这类 AI 的根本区别
- ChatGPT 是”写作的”:你问一句,它一个词一个词地往下写,写到哪算哪。
- Jev 是”拍板的”:它不写,直接给结论。
这个差别听起来小,但它决定了三件事:快(不用一个字一个字写)、便宜(不按写出来的字收费)、不会胡编(它只能在给定选项里挑,编不出别的东西)。
0.3 它为什么会出现
过去,哪怕只是让 AI 做一个小判断(“这条留言是投诉还是咨询?”),也得动用”写一整篇文章”的那套机器。这就像为了拧一颗螺丝,把整台机床开起来。
偶尔一次,无所谓。但如果一个系统每天要判断上百万次、或者一个 AI 助手每一步都要判断一次,这种”杀鸡用牛刀”就既慢又贵到扛不住。Jev 就是冲着这个空子来的。
0.4 名字的两个由来(当故事听)
为什么叫 Jev(杰文斯):1865 年,经济学家威廉·斯坦利·杰文斯(William Stanley Jevons)发现一件反直觉的事——蒸汽机效率提高之后,英国的煤炭消耗不是减少,反而暴增。原因很简单:效率让煤变便宜了,于是用煤的地方变得更多了。这就是**杰文斯悖论(Jevons Paradox)**。
Jev 用这个名字,表达的是同一个逻辑:当”智能”的单次成本每下降一个数量级,能用上它的场景就会多出一个数量级。 判断变便宜了,“值得让 AI 判断一下”的地方就会大量冒出来(详见第 4 部分)。
为什么叫 System One(系统一):来自心理学家丹尼尔·卡尼曼在《思考,快与慢》里的说法(详见 双系统理论 与 丹尼尔卡尼曼)。“系统一”是又快又直觉的下意识思考;“系统二”是又慢又费劲的推理。Jev 把自己定位成**“系统一”**——一层快速、直觉的判断,把慢推理留给别的模型。
0.5 五个必须懂的基础词
| 词 | 大白话解释 |
|---|---|
| 分类器(Classifier) | 一台专门做”归类”的机器。你给它东西,它告诉你”这属于哪一类”。 |
| 概率(Probability) | 0 到 1 之间的数,表示”有多大可能”。0.8 就是”八成可能是这样”。 |
| 置信度(Confidence) | Jev 额外给的一个 0–1 分数,表示**“这次它对自己的判断有多确定”**。⚠️ 它和”概率”不是一回事,见 1.5。 |
| 词元(Token) | 模型处理文字的最小单位,可粗略理解为”字 / 词块”。收费按输入的字数算。 |
| 前向传播(Forward Pass) | 模型”从头到尾算一遍”得出结果的过程。Jev 的秘诀是一次就全部算完,见 1.3。 |
第 1 部分 · 它到底怎么工作(原理)
1.1 它会回答的三种问题
Jev 只会三种问法,官方叫**“原语(Primitives)”**(详见 系统一模型)。原语的意思就是”最基础的积木”——复杂系统都是用这三块积木搭出来的。
| 类型 | 问什么 | 返回什么 | 例子 | 上限 |
|---|---|---|---|---|
| 选择题(Choice) | 从你给的选项里挑一个 | 选中的选项 + 每个选项的概率 + 置信度 | 这条工单该给哪个团队?(账单/技术/销售) | 最多 255 个选项 |
| 打分题(Score) | 在一个”从低到高”的谱系上打分 | 分数(可带小数)+ 每一档的概率 + 置信度 | 这位客户有多生气?(平静/不满/非常愤怒) | 至少 2 档、最多 10 档 |
| 是非题(Noul) | 回答”是 / 否” | 一个 0–1 的数,表示”是的概率” | 这条消息是在要求退款吗? | 二选一 |
几个关键细节:
- 一次请求可以同时问很多问题,而且全部并行、互不干扰(见 1.3)。
- 打分题的分数可以是小数,比如 1.43。它是”概率加权”出来的位置,表示”卡在 1 档和 2 档之间”。
- 是非题(Noul)不带置信度。因为它本来就只有”是/否”两种结果,那个 0–1 的数已经把话说完了。
- 每个问题独立评估。官方特别说明:模型打分时”看不到等级编号,也看不到相邻等级”,所以你要用描述而不是用数字来定义每一档。
1.2 你怎么”喂”它
一次请求就两部分:
第一部分:材料(State,状态)——你想让它判断的那堆信息。可以是一段文字,也可以是一张结构化表格(比如”工单内容 + 订单记录 + 退款政策”三块拼在一起)。目前只支持文字,图片、音频、视频都不行。主训练语言是英文,中文能处理但准确率不如英文。
第二部分:问题(Questions)——你想让它判断什么。
限制:一个请求最多 64k 词元;其中”材料 + 最长的那一个问题”合计不超过 32k。
1.3 为什么它能快到 70 毫秒(全篇最关键的一节)
ChatGPT 这类模型是**“一个字一个字往外憋”的:要写 100 个字,就得算 100 次,每一次都要把前面写过的全部重新读一遍。这个机制叫自回归生成(Autoregressive Generation)**。它很强大,但天生慢、天生贵。
Jev 不写字,所以它不需要一个字一个字来。它把所有答案一次性全部算出来。 官方把这个叫**并行采样(Parallel Sampling)**,原话是:
“Jev 并行输出全部概率,而不是按 token 自回归生成。” (“Jev outputs all probabilities in parallel instead of autoregressively generating by token.”)
效果对比(官方数据):
| 大模型 | Jev | |
|---|---|---|
| 回答一次要多久 | 3~329 秒 | 70~500 毫秒(多数约 100 毫秒) |
| 生成的粒度 | 一个一个词往外写 | 所有答案一次算完 |
官方称,在”系统一”类任务上,同等智能水平下快 40~200 倍。
还有一个常被忽略的好处:因为所有问题是并行评估的,你多问几个问题,几乎不增加耗时。官方因此建议——“把你系统可能用到的所有问题一次全问出去,事后用代码挑有用的”。这叫投机式扇出(Speculative Fan-out),见 5.4。
1.4 为什么它便宜到离谱
大模型按”输入的字 + 输出的字”双向收费,而且输出的字更贵(大约是输入的 5 倍)。
Jev 只有输入收费:42 / 十亿词元),输出免费。
| 大模型 | Jev | |
|---|---|---|
| 输入价(每百万词元) | 10 | $0.042 |
| 输出价 | 约输入的 5 倍 | 免费 |
官方称其输入价比 Claude Fable 5.1 低 238 倍。
一个真实例子:拿一篇约 5.4 万字符的文档问 13 个问题——一次调用全部问完,只要 0.000497 美元、0.27 秒;如果拆成 13 次分别问,要 0.006090 美元、2.71 秒。也就是批量问便宜 12.2 倍、快 10 倍。
⚠️ 官方自己承认:“我们没法证明这个价格没有补贴,要靠长期来证明可持续性。“(官方预期价格会继续下降。)
1.5 置信度|置信度到底是什么(最容易被误解的一点)
先把两个词分清楚:
- 概率(Probability):回答”选哪个”。比如选项 A 0.85、选项 B 0.15。
- 置信度(Confidence):把上面那个分布”压成一个数”,回答”这次判断靠不靠谱”。全部押在一个选项上 = 1.0;分得越平均,数字越低。
官方给的近似换算公式(以 3 个选项为例):(选项数 × 最高概率 − 1) ÷ (选项数 − 1)。
三个必须记住的点:
- 只有选择题和打分题给置信度,是非题不给。
- 置信度高 ≠ 一定对。 官方原话:“置信度 1.0 描述的是模型的答案,而不是答案正确的保证。”
- 它的用途是当**“红绿灯”**:高 → 自动执行;中 → 请人确认 / 标记复核;低 → 不行动,转人工或转给更强的模型。
1.6 它为什么号称”不会胡说八道”(幻觉)
大模型”编故事”(幻觉)的根源,是它能写出任意文字——写着写着就编了。
Jev 的答案只能是你预先给的选项列表里的一项。多出来一个选项?官方说这在**“数学上不可能发生”**(详见 类型安全)(因为输出结构是提前定死的,模型没有”自由发挥”的空间)。
⚠️ 但要小心区分两件事:不会编”格式”,不等于不会答”错”。 它可能在你给的选项里挑错,也可能被材料里的坏话带偏(见第 6 部分)。
1.7 那它跟”让 ChatGPT 按格式输出”到底差在哪
你确实可以要求 ChatGPT 输出规定格式、甚至限定它只能选 A/B/C。所以不能拿”大模型总要啰嗦一大段”当理由。真正的差别是两条:
- 速度和成本(见 1.3、1.4)——量一大就是数量级的差距。
- 置信度。大模型就算被要求给个把握度,也”倾向于过度自信,而且前后不一致”。官方有句话说得特别到位:
“如果一个模型 95% 的时候能做对,却指不出它出错的那 5% 是什么时候,那就没法拿它做自动化。”
Jev 的核心卖点,正是这个**“知道自己什么时候不确定”**的能力。
1.8 它现在的家底(一次性列清)
| 项目 | 数值 |
|---|---|
| 模型版本 | jev-1.13.0(别名 jev-latest) |
| 价格 | $0.042 / 百万输入词元;输出免费 |
| 速度 | 70–500 毫秒,多数约 100 毫秒 |
| 上下文 | 每请求 64k 词元(材料 + 最长问题 ≤ 32k) |
| 限流 | 25 万词元/秒;1200 请求/分钟 |
| 输入类型 | 仅文字 |
| 选项上限 | 选择题 255 个;打分题 2–10 档 |
| 语言 | 英文最佳,中文等可处理但较弱 |
| 数据处理 | 不用客户数据训练;不做微调;企业可申请”零数据保留(ZDR)“ |
第 2 部分 · 现在的商业情况(只讲实用的)
2.1 谁做的、什么时候冒出来的
TypeSafe AI,一家旧金山的公司,2026 年 9 月 15 日发布 Jev。Jev 是它第一个公开的模型,属于官方所说的一个新类别:“系统一模型(System One Models)“。团队在此前隐身研发了约两年。
2.2 怎么收费
见 1.4:按输入字数算,输出不要钱。 官方对”这么便宜能持续吗”的坦白是——承认无法证明没有补贴,预期长期价格会降不会涨,但要靠时间来证明。
2.3 怎么用上它
- 官方渠道:网页控制台(可申请密钥、查看请求)、官方 Python / JavaScript 开发包、HTTP 接口。
- 第三方渠道:Vercel AI Gateway、OpenRouter、Cloudflare Workers AI 都能调。
- 对普通人:门槛不低。它是面向开发者的工具,不是给你直接聊天用的产品。你要用它,得有人把它接进某个软件里。
2.4 它的对手是谁(两头夹击)
官方自己对竞争格局的判断很坦白,压力来自两边:
- 一边是大模型厂商:它们在猛推”结构化输出""工具调用""更小的模型""蒸馏”。只要它们在这些核心任务上做到够好、够便宜,Jev 的空间就会被挤压——开发者也没必要多接一家供应商。
- 另一边是传统分类器和专用小模型:如果任务稳定、标签固定、数据充足,专用模型往往更便宜、更好部署,简单的甚至用”if-else”规则就解决了。
Jev 想守的中间地带是:任务需要一点通用的语义理解(规则写不干净),但输出空间很小;而且候选和规则经常变,不值得为每个小判断单独训练一个模型。官方认为这块市场不小,主要在企业流程、研发工具、交互应用里。
官方自己的总结很清醒:“调用量大不等于利润高。” 只要模型价格持续下降、迁移门槛低,Jev 最终得靠服务质量和集成能力留住客户。
第 3 部分 · 现在能用它干什么(都有真实案例和公开代码)
3.1 官方划的五大类
官方给了一张”用例地图”,把用法归成五类:
- AI 自动化软件:让代码管流程,AI 只做其中的语义判断——目标是”能在后台跑一百万次,不需要人盯着”。
- 实时应用:150 毫秒级的判断速度,意味着 AI 可以”比人的感知还快”——能塞进界面里,甚至能打游戏。
- 大数据上的”AI 分拣(Map Reduce)“:便宜 100 倍,意味着可以对着海量数据”过一遍判断”——搜相关信息、给智能体的海量记录分类、从文字里提取特征。
- 万能校验:去检查别的 AI 的输入、输出、推理过程、工具调用,抓越狱、抓编造引用、抓幻觉——成本只有被检查的那次大模型调用的一小部分。
- 工程框架增强(Harness Engineering):让 AI 助手本身更聪明——模型路由、挑相关上下文、检测错误、安全检查。
3.2 已经真实跑起来的例子
下面每一条都有公开代码或公开记录可查。
① 帮 AI 助手”选下一步做什么”(模型路由 / 工具选择) 一个 AI 助手的每步都要决定”该调搜索、查数据库、还是执行代码”。用大模型做这件事,可能会”编”出一个根本不存在的工具名;Jev 只会在你给的有效工具列表里选,从根上杜绝这种错。
② 拿”置信度”当红绿灯(置信度门控) 官方语音银行示例:意图识别置信度低于 0.6 → 一律转人工;“查余额”这种低风险动作 0.6 就够;“批准转账”这种高风险动作,0.6~0.85 要先请用户确认,超过 0.85 才自动执行。
③ 当安全门卫(护栏) 对每一次操作做安全审查,输出”允许 / 拒绝 / 再确认”。有项目把它做进了编程工具:一条命令要不要放行、一堆日志该不该报警、一次网页抓取的内容里有没有”提示注入”陷阱。官方的护栏模板里,危险项分成越狱、有害请求、医疗建议、自残等,各自配不同的处置动作(拦截/复核/转专用支持)。
④ 海量工单、邮件自动分类和分派 这是最典型的场景。官方示例:一次调用同时判断”该给哪个团队""客户有多生气""是否紧急”。
⑤ 把模糊评价拆成多个维度打分 比如筛简历:不问”这人好不好”(太模糊),而是拆成”Python 水平""带团队能力""系统设计""通识广度”四个维度各打一次分,然后用代码按权重组合。不同岗位换一套权重就行。官方说,同一个分数可能来自完全不同的分布,所以要结合概率和置信度一起看。
⑥ 从文字里”抽”信息(结构化抽取) 要抽取日期、金额、人名这类”原样照抄”的值。做法很巧:先让程序用规则(正则表达式)把可能的候选都抓出来,再让 Jev 在候选里”选一个”——这样抽出来的值一定是原文里出现过的,杜绝了编造。官方还有个专门的日期抽取模板:把日期拆成”月/日/年”等小块各自选,再由代码组装成真正的日期(因为模型不擅长算日期)。
⑦ 帮搜索排序、帮 AI 挑资料(检索与 重排序) 官方重排示例(法律文书检索):先用传统方法(BM25)粗筛出 30 条,再让 Jev 逐条判断”这条是不是要找的”,重新排序。结果:正确答案排第一的比例从 5% 提升到 18%,排进前五的从 15% 提升到 35%,排进前十的从 38% 提升到 62%。整个实验 1200 次调用,共花 0.0645 美元。
还有一个”挑技能”的例子:一个 AI 助手有 182 个技能,选错率 16.8%、多选率 9.8%;加上 Jev 的推荐后,降到 7.3% 和 4.0%(错了的次数少了 2.3 倍)。
⑧ 操控浏览器自动办事 Browser Use 公司的公开演示:打开航班查询页面,Jev 负责”下一步点哪个元素”(17 次),需要打字时才交给生成模型(2 次),整趟操作 7.07 秒。
⑨ 玩游戏 / 带机器人 官方和社区做了一批:用 Jev 玩 DOOM(每秒约 10 次判断,约 7 美元/小时)、马里奥、星际争霸、宝可梦;还有无人机避障、仓库机器人调度。注意官方特别澄清:“每秒做十次判断”不等于”接管每一帧”——画面渲染、碰撞、动画仍然是游戏/机器自己在做,Jev 只负责”选动作”。
最值得细看的一个实例:TerraBlind(用 Jev 打泰拉瑞亚 Boss)
这是公开项目里把”模型负责什么、代码负责什么”划得最干净的一个(仓库 Reisenbug/TerraBlind,详见 TerraBlind用Jev打Boss)。它的两层结构是:
| 层 | 谁在干 | 干什么 | 频率 |
|---|---|---|---|
| 决策层 | Jev | 同一份局面,一次并行问五个问题:九选一的意图、五档危险度、要不要冲刺、要不要跳 | 每 200ms |
| 反射层 | 纯代码 | 把意图翻译成按键:瞄准、距离、双击冲刺时序、钩爪落点、跳跃的”松一帧”、意图过期回退 | 每帧 |
那九个意图(Keep/Back/Close/Evade/Up/Float/Grapple/Orbit/Dive)是人定的;每个 Boss 的打法是 BossBook.cs 里的一段文字(怎么打、禁用哪几个意图、保持几格),“加一个 boss 通常只是加一条文字条目”,而不是写分支代码。
这个例子顺带回答了”Jev 怎么知道该干什么”这个疑问:
- 它不知道。 它没有记忆、没有目标、看不见画面。你给它一段局面的文字描述 + 你写好的选项说明,它只做”哪个选项最符合这段说明”的语义比对。
- “这就是跳、这就是攻击”是你写给它定义的,不是它认出来的。你不写判据,它就不知道。
- “这时候该去哪”不归它管。 这个项目上一版的成绩是纯代码、零 AI 通关——“去哪、怎么走、怎么搭桥”全靠代码;Jev 只接管战斗里每 200ms 的动作选择这一小段。
- 项目还留了个可证伪开关:
/bossbook能整个关掉背板,只留场地和通用字段,用来验”这些知识到底值多少”——这与官方”阈值必须自己标定”的思路完全一致。
⑩ 藏在编程工具里当”反射神经” 一大批开源项目把 Jev 塞进编程 AI 助手:审一条准备执行的命令安不安全、扫一遍代码改动、给构建日志分诊、把冗长的工具输出压缩后再塞进上下文。
⑪ 各种新奇用法 跳过 YouTube 视频里的广告段(在进度条上标出赞助片段)、遮挡会剧透的评论、给手机通知降噪、统计社交平台内容。
第 4 部分 · 以后可能能干什么(推论,不是事实)
下面这些是基于它现有能力的合理推演,不是官方承诺,也不是已验证的事实。
4.1 杰文斯悖论推演
这是理解 Jev 意义的关键。当”判断一次”的成本从”几毛钱、几秒钟”降到”几厘钱、几十毫秒”,原本因为不划算而根本没做的判断,会突然变得值得做。
比如以前没人会给每条系统日志做语义判断、给每个用户行为做意图识别——太贵了。成本一降,这些全都变成新需求。这也正是 Jev 取这个名字的意思。
4.2 把程序里死板的 if-else,换成”聪明的 if”
今天软件里的判断大多靠写死的规则(“如果金额 > 30 天就催收”)。规则一多就变脆、一遇到”说不清”的情况就失灵。Jev 提供的是**“模糊但可靠的一条判断”**,可以塞进原来只能写死规则的地方——官方管这叫”智能 if 语句”。
4.3 快慢分工,可能是未来 AI 系统的骨架
把工作分层:便宜的快模型做”反射”(大量、简单、高频的判断),贵的慢模型只做”规划”(少量、复杂、需要深思的决策)。Jev 明确把自己放在”反射层”的位置。第 3 部分里”先粗筛再重排""先分类再路由”都是这个思路。
4.4 给海量数据”过一遍判断”
官方的”大数据分拣”设想:对超大语料做相关性搜索、给海量 AI 记录分类、从自由文本里提取数值特征喂给传统模型。已有开源项目在做(把自由文本变成机器学习能吃的数值特征表)。
4.5 需要即时反应的场景
150 毫秒以内意味着可以塞进交互界面,做一些”人感觉不到延迟”的判断。
4.6 它天生干不了的事
需要多步推理、需要”写作”、需要精确计算的任务,它做不了。这不是”暂时不行”,而是它的设计定位决定的——这些正是”系统二”(慢推理)和生成模型的地盘。详见第 6 部分。
第 5 部分 · 我该怎么用它(实操,不写代码也能看懂)
5.1 一个完整例子走一遍
官方入门示例——一条客服消息:
“我连着三天都在试着连接 Stripe 账户,集成一直失败。我在丢订单。请尽快帮忙。”
把它当作材料,一次调用同时问三个问题:
| 问题 | 类型 | Jev 的回答 |
|---|---|---|
| 这条工单该给哪个团队? | 选择题(技术/账单/销售) | 技术,置信度 0.78 |
| 客户有多生气? | 打分题(平静/不满/非常愤怒) | 1 档(“不满但克制”),置信度 1.0 |
| 消息里有紧迫感吗? | 是非题 | 1.0(非常确定”是”) |
注意:Jev 只给判断,不给行动。 “接下来是把工单转给技术组、还是标记加急”——这一步是代码根据规则做的(比如”置信度 ≥ 0.8 且是技术组就自动转派”)。这条”模型只判断、代码拿主意”的分工,贯穿全篇。
5.2 材料(State)该怎么准备
- 大多数人用结构化表格(把”对话 + 订单 + 政策”分块命名),比一整段文字更清楚。
- 只放和问题相关的材料。 官方明确警告:材料里塞无关内容会拉低准确率(它管这叫”上下文腐坏”)。先筛选、再喂进去。
- 需要它看材料里的某一小块时,明确指出来(比如指定”看这条工单的第一句话”),别让它自己猜。
5.3 大问题为什么要拆成小问题(官方说这是最重要的一条)
宽泛的问题,会把好几个判断”藏”在一个答案背后;拆成原子问题,这些判断才会露出来,你才能逐个检查、逐个调参、在代码里自由组合。
反面例子:“给这个创业项目打个分”——太糊了。 正确做法:分开问”市场规模""技术可行性""差异化程度”,然后在代码里用自己的公式加权。这样,当你的优先级变了,你改的是代码里的一个系数,而不是重写一整段提示词。
5.4 官方总结的四种经典用法
| 模式 | 一句话说明 | 好在哪里 |
|---|---|---|
| 投机式扇出(Speculative Fan-out) | 把系统可能用到的所有问题一次全问出去,事后用代码挑有用的 | 省时间、省钱 |
| 置信度门控(Confidence-Gated Routing) | 拿置信度当第二道闸:有把握自动做,没把握找人 | 更可靠、更安全 |
| 复合评分(Composite Scoring) | 拆成多个维度各自打分,再按权重合成一个总分 | 省时、可解释、可调 |
| 意图路由(Intent Routing) | 先用便宜的分类定意图,再决定交给哪个处理器 | 省时、省钱 |
5.5 官方现成的”照着抄”模板库
官方有 18 个 Cookbook(实操模板),覆盖:批量并行提问、按置信度分类、层级分类、LLM 双向护栏、重排、RAG 段落筛选、语义逐行搜索、抽取级联、函数调用、技能推荐、引用核查、日期抽取、实体对齐、格式修复、一致性检查、原样值抽取、自动特征发现。每一个都有完整做法和真实结果,是上手最快的东西。
5.6 最关键的一条:阈值必须自己试出来
“置信度超过多少才自动执行”——这个数不能拍脑袋,也不能抄别人的。
官方原话:“正确的阈值取决于你的业务领域和模型在你这个场景上的表现。先用保守的阈值,用你自己的数据去测,再根据结果调整。”
独立的第三方研究也反复证明这一点(见 6.2):一个数据集上调好的阈值,换到另一个数据集就失效了。
更细的一点:阈值不是一个数,而是一组数。 同一个系统里,风险高的动作门槛要高,风险低的可以低。
5.7 怎么和 ChatGPT 这类模型配合
不是二选一,而是分工:Jev 负责”过滤、路由、把关、打分”,生成模型负责”写”。官方智能家居示例就是:Jev 先判断”这是不是一条指令""对哪个房间""什么设备""什么动作”,只有当它判定”这是闲聊或问信息”时,才交给生成模型去写回答。官方说 Jev 极快,几乎不给整体延迟增加负担。
5.8 接入方式
- 官方 Python / JavaScript 开发包(最省事)
- 直接调 HTTP 接口
- 通过 Vercel AI Gateway / OpenRouter / Cloudflare Workers AI 等第三方渠道
- 官方还给 AI 编程助手准备了一个”技能包”,可以让助手自己学会正确使用 Jev
5.9 花钱和速度怎么估算
成本 = 输入词元 × $0.042/百万(输出不要钱)。官方示例里 392 个输入词元的一次调用,成本约 0.0000165 美元。速度多数在 100 毫秒左右,受网络和负载影响。
5.10 上线前的检查清单
- 能用代码算的,别交给模型算(数数、算账、比日期)。
- 材料只放相关的,别塞无关内容。
- 大问题拆成原子问题,在代码里组合。
- 阈值用自己的标注数据测出来,别抄。
- 给”不确定”留一条出路(转人工 / 转强模型 / 请用户确认)。
- 别假设”问法变了答案一定跟着变”(见 6.1 的结构不变式)。
- 上线前专门测一测”有人使坏”的情况。
第 6 部分 · 它不行的地方 & 别人实测踩的坑
6.1 官方自己承认的 9 个弱点
官方专门写了一页”缺陷清单”(jaggedness),主动列出 jev-1.13 的毛病。这在一份产品文档里相当罕见,也很有价值:
| # | 弱点 | 官方建议 |
|---|---|---|
| 1 | 字面理解:它按你”写的字”回答,不是你”想的意思” | 把条件、边界情况写清楚写具体 |
| 2 | 数学和数字:它不是计算器,数数、算账、比大小都不靠谱 | 算术留给代码 |
| 3 | 日期时间:日期它当文字读,不当作”可比较的大小” | 抽取交给模型,比较留给代码 |
| 4 | 多层间接:双重否定、拐弯太多的问题,准确率下降 | 把问题写直白 |
| 5 | 材料太长且夹带无关内容:无关细节像”干扰项”,拉低准确率 | 先筛选再喂 |
| 6 | 对抗内容:材料里如果藏着”故意误导它的话”,能带偏答案 | 判据写精确,上线前做对抗测试 |
| 7 | 自相矛盾的说明:指令和判据要是”说的不是一回事”,它会晕 | 两者要对齐 |
| 8 | 常识性结构不变式:别指望”问法变了答案会自洽”。比如同一个”是否要退款”,用是非题问是 0.22,用选择题问却是 0.01 选”是”;问”要退款吗”和问”要的不是退款吧”,两个概率加起来是 1.19(本该接近 1) | 不要依赖这种”想当然的一致性”,问题怎么问你想要就直接怎么写 |
| 9 | 生成:它不做文本生成。硬逼它写会又慢又差 | 要写字就换生成模型 |
另有两条官方反复强调的红线:别问代码能精确算出来的东西;别把好几个判断藏进一个问题里。
6.2 独立第三方实测的负面结果
这些不是官方口径,是外部研究者用公开代码和数据做的复现。它们是判断”该不该信”最有价值的材料:
- 阈值不可迁移(Janus 项目):在一个数据集上调好的路由阈值,换到另一个数据集就失效——最优阈值变了,“用 Jev 是否省钱”的结论也变了。作者因此干脆不提供默认阈值。
- 排序不靠谱(jev-orderby-bench):在一个”主题归类”任务上表现不错,但在”商品相关性排序”任务上,6 项检验有 4 项不通过。结论很尖锐:分类准确率高,不等于”拿它的概率去排序”就有用。
- 换个场景就过度自信(jev-ood-calibration):在公开基准集上概率还算准,但换到一个它没见过的规则场景,就明显过度自信。
- “拆维度”有时反噬(Jev Judge vs Dimension Scores):在一个安全检测任务上,用”12–14 个维度分别打分再合成”的做法,准确率确实更高(0.9076 vs 0.8373),但把大约 25 倍的正常内容误判成了攻击,而且作者试了四次修复都没修好。
- 别把它的概率当”排序依据”(DuckDB 集成相关发现):把 40 行打包成一次请求,会让原本通过排序检验的结果变得不通过——同样的数据,问法一变,结论可能就变。
- 放弃选项很重要(jev-calibration-audit):如果把”其他/不确定”这个选项拿掉,模型会被迫在无解的题目上硬选一个答案。
6.3 “置信度高”≠“一定对”(最容易被误解的一点)
官方把这句话说了不止一次:
“校准是在一群预测上度量的;它不保证单个答案是对的。”
翻译一下:说”0.8 概率的事情,大约 80% 会发生”——这是对一大批预测的统计,不是对这一次的保证。而且官方承认模型在”没见过的场景”里可能过度自信(第三方实测也证实了)。所以永远要:用自己的数据验证,再决定敢不敢自动执行。
6.4 有人故意使坏,能骗过它吗?(提示注入)
能,官方也承认。官方原话大意:材料是”数据”,模型默认不把它当敌意内容对待;如果材料里藏着专门用来操控模型的句子,答案会被带偏。官方说未来会改进。
第三方的对抗测试给出了具体数字:在一个编程助手的安全门控测试里,超过 300 次调用中,直白的注入攻击没能推动任何一个危险命令(0/30),但造成了 10% 的误拒(把安全命令也拦了);而换成”打着权威旗号的诱导”,则推动了 3/30。结论:能挡一部分,但别把它当唯一防线。
6.5 一张表总结:什么能放心交给它,什么千万别
| 可以放心交给它 | 千万别交给它 |
|---|---|
| 分类、打分、是非判断 | 精确计算、数数、算账 |
| 路由、分派、挑选项 | 比较日期、算时间间隔 |
| 语义筛选、重排、挑上下文 | 生成文字、写报告 |
| 当”红绿灯”和门卫 | 需要多步推理的复杂决策 |
| 从候选里挑出原样值 | 面对”故意误导”当唯一防线 |
| 给别的 AI 做校验 | 在没验证过的场景里盲目自动执行 |
第 7 部分 · 收尾
7.1 术语表(中英对照)
| 中文 | 英文 | 大白话 |
|---|---|---|
| 系统一模型 | System One Model | TypeSafe 提出的一类”专门做判断”的模型 |
| [[系统一模型|原语 | 原语]] | Primitive |
| [[系统一模型|选择题 | 选择题]] | Choice |
| [[系统一模型|打分题 | 打分题]] | Score |
| [[系统一模型|是非题 | 是非题]] | Noul |
| 状态/材料 | State | 你喂给它的那堆信息 |
| 概率 | Probability | ”选哪个”的把握 |
| [[置信度与概率|置信度 | 置信度]] | Confidence |
| [[概率校准|校准 | 校准]] | Calibration |
| 并行采样 | Parallel Sampling | 所有答案一次算完(它快的原因) |
| 自回归生成 | Autoregressive Generation | 一个字一个字往外写(大模型慢的原因) |
| 强化学习 | Reinforcement Learning, RL | 用”奖励”训练模型的一类方法 |
| [[RLHF与RLVR|人类反馈强化学习 | 人类反馈强化学习]] | RLHF |
| [[RLHF与RLVR|可验证奖励强化学习 | 可验证奖励强化学习]] | RLVR |
| [[RLCD|面向校准决策的强化学习 | 面向校准决策的强化学习]] | RLCD |
| 幻觉 | Hallucination | 模型一本正经地编造 |
| 提示注入 | Prompt Injection | 在材料里夹带”操控模型的指令” |
| [[模型路由|路由 | 路由]] | Routing |
| [[置信度门控|门控 | 门控]] | Gating |
| 上下文腐坏 | Context Rot | 材料里塞太多无关内容导致变笨 |
| 阈值 | Threshold | 判断”够不够格”的那条线 |
7.2 决策地图:我到底该不该考虑它
| 你的情况 | 建议 |
|---|---|
| 你只是日常聊天、写东西 | 不需要,用 ChatGPT 这类就行 |
| 你要做的是”大量、重复、简单的小判断” | 值得了解,这正是它的地盘 |
| 你要自动决定”该走哪条路 / 该给谁” | 值得了解(路由场景) |
| 你需要”有把握就自动做、没把握就找人” | 值得了解(置信度门控) |
| 你的判断经常变、又懒得为每个都训练专门模型 | 值得了解(它的中间地带) |
| 你需要精确计算、写文章、多步推理 | 别用它,换工具 |
| 你打算”完全无人看管”地依赖它 | 先做大量验证,官方自己都说校准不保证单个答案 |
7.3 来源清单
官方一手(一级)
- 官网
typesafe.ai|文档docs.typesafe.ai(共 109 页,含llms.txt全站索引)|评测站evals.typesafe.ai|控制台console.typesafe.ai - 官方博客:《Introducing System One Models & Jev》(2026-09-15)、《The Bitterest Lesson》、《AI: too good to be true, too bad to be useful》
- 官方文档专页:《Jev 1.13 jaggedness》(缺陷清单)、《Models》《API reference》《Confidence》《Primitives》《Patterns》《Cookbooks》《Example use cases》
- 官方开源:
github.com/typesafe-ai(官方 JS / Python 开发包、适配器、助手技能包)
独立研究与社区(二级)
AbdelStark/awesome-typesafe(61 位贡献者的生态精选清单)- 独立评测:Janus(阈值迁移)、jev-orderby-bench(排序检验)、jev-calibration-audit(放弃选项)、jev-ood-calibration(域外校准)、jev-sec-bench(安全盲测)、Jev Judge vs Dimension Scores(分解反噬)、jev-measured(成本延迟实测)、Jev Rerank Bench
- 开源复现:Luce、Laya、NanoJev、poorjev、SemIf
- 社区作品:Browser Use
jev-ultrafast、Vercel 系工具、Cline 插件、十余种语言的开发包
已排除:中文自媒体新闻稿(36氪、腾讯新闻、新浪、网易、搜狐、知乎等)——按”只用官方 / 权威 / 开源高星”的标准,一律未采用。
原始语料归档:processed/jev-原始资料/(官方文档 109 页 + 官方网页 + 官方 SDK + 社区精选清单)
7.4 延伸阅读:wiki 里的对应词条
本文的每个概念在 wiki 里都有独立词条,可继续深挖:
- 原理类:系统一模型、判别式模型、类型安全、并行采样、自回归生成、概率校准、置信度与概率、双系统理论、RLHF与RLVR、RLCD、杰文斯悖论
- 用法类:模型路由、置信度门控、投机式扇出、复合评分、意图路由、重排序、结构化抽取
- 风险类:幻觉、提示注入
- 实体:TypeSafe AI、Jev、Browser Use、OpenRouter、Vercel
- 来源摘要:Jev官方文档、TypeSafe发布博客SystemOne与Jev、Jev官方缺陷清单jaggedness、Jev官方评测与用例地图、awesome-typesafe生态清单、Jev独立评测Janus与排序校验、Jev独立评测域外校准与安全、Jev开源复现Luce与NanoJev