Introducing System One Models & Jev

TypeSafe AI 官方发布博客(2026 年 9 月 15 日,作者 Diogo Almeida,创始人)与官网首页(typesafe.ai)的来源摘要。这两份是 Jev 全部「官方声称」的第一手出处,包含官方的产品定位、新旧路径对照表、被引用的关键数字、以及官方主动承认的偏差与 caveat。原始语料见 processed/jev-原始资料/官方-网页/o04-blog-sysone.txt 与 o01-home.txt。

一句话摘要

TypeSafe 宣布其第一个「系统一模型(System One Model)」Jev 进入早期访问:官方称它在系统一类任务上达到与现有前沿大模型相近的智能水平,同时快两个数量级、便宜两个数量级,代价是放弃字符串生成——换来结构化、限定在预设选项内的类型安全输出,因此「不会幻觉、不会类型出错」。

关键要点

一、官方对「老路(Existing LLMs)vs System One + Jev」的完整对照表

以下为官方博客原表逐行摘录(左=现有 LLM,右=System One + Jev):

维度现有大模型(Existing LLMs)System One + Jev
训练方法(Optimized with)RLHF / RLVRRLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习)
优化目标(Optimizes for)人类偏好:人类评分者更喜欢的文章与聊天回复;可验证奖励:能被程序化验证的输出校准决策:在系统一类任务上给出「认知上诚实」的概率
输入(Inputs)非结构化数据(如文本),偏重顺序消息非结构化数据(如文本),偏重结构化程序状态(program state)
输出(Outputs)字符串 / 生成文本;灵活但需解析 + 校验,且「总有跑偏风险」类型安全的结构化值;可能的输出与结构提前定义,模型永不产生类型错误,所有答案附带校准概率与置信度
采样(Sampling)串行(Sequential):一次一个词元,每个词元以上一个为条件并行(Parallel):单次查询生成全部输出,极其高效且硬件友好
成本(Cost)输入词元 10 / Mtok;输出词元约为输入的 5 倍输入词元 42 / 十亿词元);输出词元免费(“too cheap to meter”)
速度(Speed)端到端 3–329 秒;与人交互够快,嵌进代码是巨大瓶颈端到端 70 ms–500 ms;对系统一形态的查询,同等前沿智能下快 40–200 倍
置信度(Confidence)即便被要求给置信度估计,模型也倾向过度自信且前后不一致;官方原话:一个模型若 95% 情况能做对却说不出错的那 5%,就无法自动化该任务每次输出都传达置信度与不确定性;校准(置信度越高准确率越高)、更一致(相似输入返回相似答案)
用例(Use cases)人在环任务(聊天机器人、副驾、编程智能体)通用但需人监督;可验证问题(数学证明、内核优化)只要正确性可低成本自动检验,就能生成—测试—迭代;以及演示原型AI 驱动的工作流 / 智能 if 语句:结构化输出嵌进普通软件,做「分类、路由、打分、抽取、分支」;大数据的 Map-Reduce;实时应用(100 ms 级);校验一切(打分、评判、护栏、检测越狱)

二、关键数字(官方口径)

  • 193.6x Faster, 444.6x Cheaper:官网首页大字(标注 “based on workflows for System One tasks (proof)”),博客说明这来自 workflow evals,并承认属于真实世界增益的高位(higher end)。
  • 首页同屏对照的具体一次运行:Jev 成本 0.013880、耗时 8.566 s。
  • 42 / 十亿输入词元;官网称输入价格比 Claude Fable 5.1 低 238 倍(“238x Lower input price than Claude Fable 5.1”)。
  • 速度:70 ms–500 ms(对比大模型 3–329 秒);系统一形态查询下快 40–200 倍。
  • 官方定位句:「two orders of magnitude faster and more efficient」。

三、官方自己承认的 caveat 与 bias(博客 “Nuance” 小节,逐条)

关于可验证性

  • 速度:官方称「我们真的有那么快」,但公布评测一般是在西海岸的笔记本上跑的(服务当前也部署在那里)。
  • 价格:官方称定价透明,但**「我们没法证明它没有被补贴」,需要长期来证明定价的可持续性——并预期价格会下降而非上升**。
  • 无类型错误:官方称这**「在数学上是不可推翻的」**,只要一个反例就能证伪,「但它数学上不可能」。

关于并排演示(side-by-side)

  • 查询被高度简化,问句特意选用描述性、人类可读的键名,以便屏幕输出好懂。
  • state 是一段短、密、详细的段落,为的是凸显采样方法的差异;较短的输入对 Jev 有利(“The relatively shorter input paints our model in an advantageous light.”)。
  • 录制那一次唯一与 GPT-5.6 Terra 的分歧在 “Churn likelihood level”,官方认为该题答案本身确实含糊。
  • 对比对象选 GPT-5.6 Terra(默认推理),因为官方认为它平均而言与 Jev 智能最可比。

关于 workflow evals

  • 该评测不优化 ground truth 分类、不允许改 harness 与模型(避免通过「工程框架(Harness)调优」过拟合);而是假定存在正确计算图(代码里的 workflow),以最大、最聪明、最贵的外部模型的预测作为参考概率。
  • 参考答案取 GPT-6 Astra 与 Fable 5.1 的平均,因此偏向 OpenAI 与 Anthropic 的模型;官方称可能低估了自家模型与 DeepSeek。
  • 工作流不是为让自家模型好看而挑选或构造的,也不在训练分布里;但由模型能力团队的人制作,因此可能存在偏袒。
  • 大模型一侧用 TypeSafe 的 System One LLM wrapper(把大模型约束成输出结构化决策),官方称这是从大模型拿决策最准的方式,但比不给概率的做法更慢更贵。

关于幻觉与类型安全

  • 大模型侧的数字来自 OpenRouter,官方承认几乎肯定有偏——更复杂的查询可能被路由给更好的模型。
  • Jev 的数字不是经验值:schema 匹配是保证的,所以可以自信地把 0% 加进图里。

四、三个官方 demo 及其标注的局限

① DOOM(博客 Fun Demos)

  • 每秒约 10 次查询,折合约 $7/小时;作者原担心太贵,团队反而觉得「比预期低」。
  • 局限(官方 Nuance):demo 跑在结构化 state(带文本的数据结构)上,而不是图像上(yet…);非 AI 的 DOOM bot 能打得更好,但官方想要的是「能对不同游戏状态表示作出反应」的 bot,并且「遵循指令这件事本身超酷」。

② Wikiracing(博客 Fun Demos)

  • 玩法:从一个维基百科页面出发,只用途中遇到的链接抵达指定的另一个页面;每一步可能要在数百到数千个链接之间选择;是「每秒智能」以及「高基数选择下不幻觉所带来的复利收益」的极佳试验场。
  • 局限(官方 Nuance):第 2、3 关都以 “Rubber Duck” 开头纯属偶然,作者是团队指出后才注意到的;此处的加速比前几个 demo 小得多,因为对手用的是非推理模式(Astra 也设为最低推理档),这也是 Jev 倾向用更少步数完成的原因(官方视作智能更高的迹象);大模型在开启推理时表现会比这里好得多;Jev 支持的基数上限是 255,遇到更高基数的选择时改用「先独立打分、再显式选择」的两阶段系统,因此偶有变慢。

③ 智能家居助手(官方文档 Demos 页,非博客)

  • 演示投机式扇出(Speculative Fan-out):每个用户请求都对一长串问句求值,其中许多问题对多数请求并不相关,由代码事后过滤。
  • 与生成模型分工:一个 Noul 问句判断「用户请求是否包含多个不同动作」,为真时用 LLM 把请求拆成原子命令再逐个交给 Jev;当 Jev 判定请求是「问信息或闲聊」时,交给 LLM 生成自由回复。
  • 局限/边界:官方强调这个 demo 的初始 Jev 响应相比 LLM 响应快到几乎不给整体延迟增加负担,但仍需 LLM 兜底字符串生成;该 demo 页面未标注准确性局限。
  • 反面做法(官方点名):把问题拆成多次 API 调用、等到确定需要再问,会明显更慢更贵。

五、FAQ 问题清单(两份,官方只列问题)

博客 FAQ(“We Give A FAQ”)

  1. Where do the names “System One Models” and “Jev” come from?
  2. Why was a new training algorithm needed?
  3. What use cases is Jev good for?
  4. Is Jev just a smaller LLM?
  5. How does Jev perform against public benchmarks?
  6. Where does our training data come from?
  7. These are results are kinda crazy - how is it possible?

首页 FAQ(“We give a FAQ”)

  1. What are System One Models? What is Jev?
  2. Is Jev just a smaller LLM?
  3. How is this different from JSON mode or structured outputs?
  4. How can Jev be so fast and inexpensive?
  5. Can you make Jev even faster?
  6. Are these prices temporary or subsidized?
  7. What is Jev good at? Where does it struggle?
  8. Can Jev still get things wrong?
  9. Is Jev deterministic?
  10. How do I get started or ask a question?

注:首页 FAQ 中仅第 1 条给出了正文答案——「System One 模型是一类为软件内决策而建的新 AI 模型;Jev 是 TypeSafe 首个公开的系统一模型,为自动化优化。给 Jev 结构化问句,得到带概率与置信度的类型化决策。」

重要引用

“Models have been superhuman at chat for years, so where is all the automation?”

模型在聊天上超越人类已经很多年,那么自动化到底在哪?

“Think of Jev as a frontier-intelligence function call: unstructured state in, typed probabilistic decisions out.”

把 Jev 想成一次「前沿智能的函数调用」:非结构化的 state 进,带类型的概率化决策出。

“While Jev gives up string generation, it’s optimized for structured outputs and can’t hallucinate.”

Jev 放弃了字符串生成,但为结构化输出做了优化,并且不会幻觉。

“We can’t prove it isn’t subsidized; we’ll need the long-term to prove the sustainability of our pricing (which we expect to go down, not up).”

我们没法证明它没有被补贴;我们需要长期来证明这个定价的可持续性(我们预期它会降,不会涨)。

“If a model can do a task 95% of the time but doesn’t say when it’s in the 5%, it can’t automate that task.”

如果一个模型 95% 的时候能做对,却指不出它出错的那 5% 是什么时候,那就没法拿它做自动化。

“Jev is off the charts – owning the Pareto frontier for almost 2 orders of magnitude.”

Jev 直接冲出了图表——霸占帕累托前沿近两个数量级。

“Every order of magnitude drop in the cost of intelligence unlocks orders of magnitude more use cases.”

智能成本每下降一个数量级,就会解锁多出几个数量级的用例。

相关页面