RLCD(Reinforcement Learning for Calibrated Decisions)
一句话定义:RLCD 是 TypeSafe 自己的后训练(post-training)方法,优化目标既不是”写人爱看的文字”,也不是”答对可验证的题”,而是”给出认识论上诚实的概率”。 Jev 就是用 RLCD 训练的。
1. 官方定义
AI primer 的定义:
“Reinforcement learning for calibrated decisions trains TypeSafe to return decisions and calibrated probabilities instead of generated text.”
翻译:面向校准决策的强化学习训练 TypeSafe 返回决策与经过校准的概率,而不是生成文本。
官方把它在首页描述为一条新路线:新架构 + 新采样器 + 新训练算法,三件套中的训练算法即 RLCD。
2. 优化目标:诚实的概率
RLCD 定义了一份不同的输出契约:
“The model does not generate text. It returns decisions and probabilities. Higher probability should correspond to a greater chance that the answer is correct.”
翻译:模型不生成文本。它返回决策与概率。更高的概率应对应更大的”答案正确”的机会。
官方博客对照表把这一目标表述为 “calibrated decisions: answers with epistemically honest probabilities on System One tasks”(校准决策:在系统一任务上给出认识论上诚实的概率)。
“更高概率 = 更高正确率”这一性质的可检验含义见 概率校准。
3. 与 RLHF / RLVR 的对照表
下表取自官方发布博客的横向比较(RLHF 与 RLVR 属”既有 LLM”一列,RLCD 属”System One + Jev”一列):
| 维度 | RLHF | RLVR | RLCD |
|---|---|---|---|
| 优化目标 | 人类偏好:人类评分者更喜欢的文稿与聊天回复 | 可验证奖励:可被程序化验证的输出 | 校准决策:在系统一任务上给出认识论上诚实的概率 |
| 输入 | 非结构化数据(如文本),偏重序列化的消息 | 非结构化数据(如文本),偏重序列化的消息 | 非结构化数据(如文本),偏重结构化的程序状态 |
| 输出 | 字符串 / 生成文本;软件要用得先解析与校验,且总存在跑偏风险 | 字符串 / 生成文本;同上 | 类型安全的结构化值;可能输出与结构事先定义,模型不会犯类型错误,所有答案都带校准概率与置信度 |
| 置信度 | 倾向过度自信且不一致;即使被要求给出把握度也不可靠 | 同左 | 每个输出都沟通置信度与不确定性;更校准,对相似输入返回更接近的答案 |
两点说明:
- “输入""输出""置信度”三行中 RLHF 与 RLVR 合并表述,依据是博客把两者并列为同一列”Existing LLMs”。
- RLHF 与 RLVR 各自的展开与问题清单见 RLHF与RLVR。
4. RLCD 训练出的模型是什么样
由 RLCD 训练出的系统一模型(System One Model)具有这些性质:
- 不生成文本:不写回复、不写代码、不解释推理过程。
- 返回决策与概率:概率分布覆盖你预先定义的选项或档位。
- 概率与正确率挂钩:这是”校准”的可检验含义,见 概率校准。
- 并行采样:官方称其输出在一次查询中并行生成(parallel sampler),与 LLM 逐 token 的自回归生成相对;这也是它在速度与成本上拉开差距的原因。
- 可组合:因为输出是类型安全的受限值,可以像普通数据一样被排序、设阈值、做分支。
5. 与 Jev 的关系
- Jev 是第一个公开的、用 RLCD 训练的系统一模型,官方称其为”旗舰模型(flagship model)”。
- 同一份权重服务所有账户:
“Jev is not fine-tuned or LoRA-adapted with customer data. It is trained with RLCD to return calibrated decisions, and the same weights serve every account.”
翻译:Jev 不会用客户数据做微调或 LoRA 适配。它用 RLCD 训练以返回校准决策,同一份权重服务每一个账户。
相关来源
introduction__machine-learning-primer.md—— RLCD 定义、输出契约、与 RLHF/RLVR 的并列说明o04-blog-sysone.txt—— 三条路径的对照表与校准决策表述o01-home.txt—— 新架构 + 新采样器 + RLCD 的”三件套”表述models.md—— “同一份权重服务所有账户”concepts__how-to-build-with-system-one.md—— “RLCD 用校准概率而非过度自信来沟通不确定性”