Agent 系统性学习

强化学习

此标签下有2条笔记。

  • 2026年9月21日

    RLCD(Reinforcement Learning for Calibrated Decisions)

    • 概念
    • 训练方法
    • 强化学习
    • 计算机科学
  • 2026年9月21日

    RLHF 与 RLVR(Reinforcement Learning from Human Feedback / with Verifiable Rewards)

    • 概念
    • 训练方法
    • 强化学习
    • 计算机科学

© 2026 朱景元