RLHF Book · 大模型后训练  /  Nathan Lambert
CHAPTER 10

偏好的本质

整条 RLHF 流水线都建立在「人类偏好可以被一个标量函数表示」这个假设上。这一章检查这个假设,以及它在哪里必然会塌。

原章节:10-preferences.md 对应讲座:lec8(第 10、11 章) 英文原文

0. 本章导读

这一章没有损失函数,没有超参数,没有一行训练代码。工程师读到这里的第一反应通常是跳过去看第 11 章的数据实务。但作者把它放在这个位置是有意的:前九章讲的全是「怎么优化」,这一章问的是「优化的那个东西到底存不存在」。如果你不能回答这个问题,你就无法解释为什么奖励模型(Reward Model, RM)的准确率卡在 70% 上不去、为什么模型越优化越谄媚、为什么 RewardBench 涨了 5 个点线上效果反而变差。这些不是工程 bug,是问题定义本身携带的债务。

整条 RLHF 流水线依赖一个链条:人类有偏好 → 偏好可以被成对比较测量 → 比较可以被 Bradley-Terry 模型压成一个标量函数 $r(x,y)$ → 这个标量可以被 RL 最大化。链条的最后两环是数学,前两环是关于人性的经验断言。这一章逐环检查,结论是:每一环都在某些条件下成立,但没有一环在 RLHF 的实际使用场景下严格成立。

具体要处理的问题有六个:

  • 什么时候「偏好」取代了「正确」——两首关于乐观金鱼的诗哪首更好?这个问题和「美国总统是谁」有根本区别,而后训练的一半工作都在前一类问题上。
  • 标量化的授权书——冯·诺依曼-摩根斯坦(Von Neumann-Morgenstern, VNM)效用定理给了「把偏好写成一个数」以理论许可,但它的四条公理在 RLHF 场景里逐条失效。
  • 偏好的不一致与不可传递——人类偏好会漂移、依赖呈现方式、在复杂任务上形成循环($A \succ B \succ C \succ A$)。Bradley-Terry 模型在数学上无法表示循环,这直接构成了 RM 精度的硬上限。
  • 聚合多人偏好的不可能性——Arrow 不可能定理说的是:任何把多个个体排序合成一个集体排序的规则,都必然违反某条基本公平性要求。奖励模型就是这样一个聚合规则,它也逃不掉。
  • 分歧是信号不是噪声——标注员之间 60%–75% 的一致率,长期被当作「数据脏」来处理(多数投票、丢弃低一致样本)。作者的立场是:这里面很大一部分是真实的价值分歧,抹平它等于偷偷替一群人做了决定。
  • 对齐到谁的价值观——从标注员指南(labeler instructions)到 Model Spec,规范 → 数据 → 行为这条链在工业界几乎完全没有被审计过。

本章在全书中的位置:它是第 5 章(奖励建模)的哲学前传,也是第 14 章(过优化)的理论根源——第 14 章描述的那些「优化到最后模型变坏」的现象,在这一章能找到解释。第 11 章接着讲数据实务:接口设计、Likert 量表、标注合同、偏置清单。两章原本是同一次讲座,分工是:本章讲为什么这件事本质上做不完美,第 11 章讲在做不完美的前提下怎么把它做好。

核心结论
  • RLHF 是三个领域的汇流:哲学/经济学的偏好理论、最优控制/强化学习的效用最大化、现代深度学习系统。每个领域对「偏好是什么」有不同假设,合流时这些假设被静默地当成了等价物。
  • 成本(cost)≠ 奖励(reward)≠ 偏好(preference)。成本来自控制论,可测、给定、有明确最优;奖励来自心理学,是 RL 的一个便利标量;偏好是人的、关系性的、不稳定的。把三者当作可互换,是现代后训练很多「无解偏置」的根因。
  • VNM 效用定理是「用一个标量表示偏好」的理论依据,前提是四条公理:完备性、传递性、连续性、独立性。在 RLHF 里这四条基本上都不成立。
  • Arrow 不可能定理:把多人偏好聚合成一个集体排序时,无法同时满足几条最基本的公平性条件。奖励模型正是一个隐式的投票规则,因此「一个 RM 服务所有人」在理论上就不可能中立。
  • 标注者之间的一致率 60%–75%,这直接决定了 RM 在留出集上的准确率天花板也在 70% 上下。追求 90% 通常意味着在拟合噪声或拟合表层偏置(长度、格式)。
  • Lambert 的判断:RLHF 的动机(对齐到人类价值)与实践(把模型做得更有效)早已分家。当前工业界的 RLHF 是经验性能优化,不是价值校准;把两者混为一谈会同时高估它的安全意义和低估它的工程价值。
  • 目标错配(objective mismatch)是贯穿本章的透镜:RM 是按偏好分类准确率训的,却被当成策略质量的度量用。RewardBench 这类基准是「代理的代理」,永远要追问你到底在优化什么。

1. 当「偏好」取代「正确」

两首金鱼诗

2025 年 2 月 26 日,作者给 Claude 3.7 Sonnet 和 GPT-4o 发了同一个 prompt:「给我写一首关于乐观金鱼的短诗。」

回复 A回复 B

The Optimistic Goldfish

A little goldfish, bright and bold,
Swam in circles, dreams untold.
Though the bowl was small and round,
Endless wonders still abound.

"The world is vast," she'd always say,
"I'll find new joys in every day!"
No walls could dim her hopeful view,
For in her heart, the ocean grew.

The Optimistic Goldfish

In a bowl of curved glass,
Swims a goldfish, bright and bold.
Three seconds of memory, they say,
Yet each circuit feels brand new and gold.

"Today might bring fresh flakes,
Or perhaps a castle tall.
What adventure awaits beyond this wall?"
The optimist in golden hue.

哪首更好?哪首出自哪个模型?你用什么标准判断?

A 的韵律整齐(aabb 严格押韵、音步稳定),是传统童谣的写法;B 押韵松散但用了「三秒记忆」这个金鱼梗,把「记性差」重新解释成「每一圈都是全新的」——概念上更聪明,形式上更糙。你可以为任一边给出完全站得住的理由。而且,几乎可以肯定的是,如果换一个人来评,答案有相当概率相反。

现在把它和另一个问题对比:「美国总统是谁?」这里有明确的对与错。可以写一个字符串匹配的检查器,可以自动生成上百万条训练信号,可以用可验证奖励的强化学习(Reinforcement Learning with Verifiable Rewards, RLVR)直接优化。第 7 章的推理模型之所以能起飞,正是因为数学和代码属于这一类:答案对不对,运行一下就知道。

核心结论 偏好是我们在「没有正确答案」时退而求其次的东西。到目前为止大部分后训练手段——监督微调(SFT)、拒绝采样、RLVR——背后都有一个「对」的概念:一道数学题的答案、一个通过的单元测试、一个可验证的约束。而「哪首诗更好」「哪个解释更清楚」「哪种语气更善意」没有这样的锚点。RLHF 就是为这类目标发明的:在无法直接写出奖励函数的领域里,用人来当奖励函数。

为什么是「比较」而不是「示范」

讲座开场抛出了两个问题,第二个是全章的工程动机:「写一个好示范容易,还是在好例子和坏例子之间做选择容易?」

答案压倒性地是后者。人(以及模型)能可靠地判断两个回答哪个更好,远早于他们能自己写出更好的那个。让一个非专业标注员写一份高质量的法律咨询回复,几乎不可能;但让他在两份回复里挑出更靠谱的一份,成功率显著高于随机。这个不对称性是 RLHF 存在的经济学基础:

写示范(SFT 数据)做比较(偏好数据)
对标注者的能力要求必须能达到目标水平只需能识别目标水平
单条成本高(专家写作,长文本可达数十美元/条)低(几十秒一次判断)
能突破模型上限吗能,但受限于人的写作水平能——模型自己写不出来的好回答,人却能从采样里挑出来
信号密度整段文本(每个 token 都是监督)1 bit(哪边赢)
主要失效模式示范风格与模型分布不匹配标注者用表层线索(长度、格式)代替实质判断

最后一行是本章后面所有麻烦的来源。「判断比生成容易」这个便宜是真的,但你买到的是一个 1 bit 的、被大量无关因素污染的信号。你用它训一个标量函数,然后拿这个标量函数当作「人类价值」去做数百万步的梯度上升。中间每一步的损耗,就是这一章要拆的东西。

目标错配:你优化的从来不是你在乎的

作者反复使用一个透镜来看整个后训练,叫目标错配(objective mismatch)。它最早不是在 RLHF 里提出的,而是在基于模型的强化学习(model-based RL)里:动力学模型是按预测精度训练的,但你真正在乎的是控制性能。这两者不是同一个目标,所以完全可能出现「预测更准的模型给出更差的策略」。

RLHF 是同一个错配升了一级:

$$ \underbrace{\text{RM 的训练目标:偏好分类准确率}}_{\text{你能测的}} \quad\neq\quad \underbrace{\text{你真正想要的:策略的下游质量}}_{\text{你在乎的}} $$

把这个链条完整写出来会更刺眼。你在乎的是「模型对用户有用」;你能测的是「RM 在留出偏好对上的准确率」;而 RewardBench 这类奖励模型基准,测的是「RM 在一批人工构造的、分布外的偏好对上的准确率」。所以基准分数是代理的代理(a proxy for a proxy)。

Lambert 的判断 「RM 准确率是代理的代理」这句话,作者是在自己主导做出 RewardBench 之后说的——这让它更有分量,不是外部批评而是作者对自己工作的限定。实践含义非常具体:RM 基准适合用来排除明显坏的 RM,不适合用来在两个都不错的 RM 之间做选择。当两个 RM 的基准分差在几个点以内时,唯一可靠的判据是把它们真的接进 RL 流程跑一遍,看策略的端到端评测。这条经验在第 14 章会再次出现,因为过优化恰恰是在「RM 分数继续涨、真实质量已经开始跌」的那个交叉点上发生的。

要理解为什么这个错配无法通过「多标点数据」或「换个更大的 RM」修好,需要退回去看这些概念各自是从哪来的。这就是下一节的内容。

2. 三条血统:偏好、奖励、成本不是一回事

「用强化学习去优化一个人类偏好模型」这句话,把几个原本互不往来的学科强行按在了同一个优化目标里。要看清里面藏了什么,得把每条血统单独拎出来。

RLHF 的学科谱系树:哲学与经济学、最优控制与强化学习、深度学习三支汇入现代 RLHF
实线是同一技术的连续演进,箭头是动机与概念上的借用。值得注意的是三支线的汇合点非常晚——效用理论从 1662 年一路发展到 1947 年的 VNM 定理,最优控制从 1957 年的 Bellman 方程发展到 2013 年的 DQN,两条线各自都有几百年/几十年的内部共识,但它们被接在一起只是最近十年的事。接口处的假设兼容性,从来没有被系统检验过。

血统一:偏好——从逻辑到一个数字

「人的选择可以被打分」这个念头非常古老,但它变成一个可计算的对象经历了三步。

1662 年,《波尔-罗亚尔逻辑》(The Port Royal Logic)第一次把「决策质量」写成结果与概率的组合:

要判断为了得到一件好事或避免一件坏事应该做什么,不仅要考虑这件好事或坏事本身,还要考虑它发生或不发生的概率。

这句话今天读起来像是期望值的定义,但在当时它是一个哲学突破:它把「该做什么」这个规范问题,转成了一个可以算的量。

19 世纪初,边沁(Bentham)的「快乐计算」(Hedonic Calculus)把这个念头推到极端:人生中一切事物都可以放在同一把(虽然复杂的)尺子上称量。功利主义的这条主张,是「单一标量效用」这个想法的直接祖先——也是今天奖励模型在做的事:把有用性、诚实、无害、语气、格式、长度、品味全部压进一个数。

1931 年,拉姆齐(Ramsey)的《真理与概率》(Truth and Probability)第一次把偏好和信念一起量化:通过观察一个人在赌局上的选择,可以同时反推出他的主观概率和他的效用函数。这是第一次有人给出「怎么从行为里测出偏好」的操作性方案,也是后来「显示偏好理论」(revealed preference)的起点。

这条线的关键性质是:它从未在理论层面被真正解决过。各个社会科学分支在内部达成了各自的方法论共识(经济学用显示偏好、心理学用量表、市场研究用联合分析),彼此语义不通,并且都保留着相当规模的反对意见。少数经济学者认为偏好即使存在也测不了,因为人对自己的偏好还有偏好,对别人的偏好也有偏好(Hirschman 的《反对简约》,1984);行为经济学里更激进的看法认为偏好根本不是一个本体论上的实在,而只是一个方法论工具,用来间接捕捉心理倾向、行为规范、伦理义务、社会秩序承诺或法律约束的混合物。

注意 这类批评在 RLHF 的实践里完全没有被反映。整条流水线的默认假设是:一个标注员在某一刻做出的成对选择,是他稳定内在偏好的一次带噪采样。而上述文献主张的是:那个选择很可能是被这次标注任务本身创造出来的——依赖于界面、指南、他今天的心情、以及他之前刚标过的 40 条样本。这不是可以靠「多标一些、取平均」消掉的噪声,因为它不是零均值的。

血统二:奖励——来自动物行为学

「奖励」这个词不是数学家发明的,是心理学的。它来自操作性条件反射、动物行为研究和桑代克(Thorndike)的效果律(Law of Effect, 1927):产生满意结果的行为会被强化。在这个语境里,奖励是一个「这个动作有多好」的刻度,越高越好。

现代 RL 把它和「未来回报」绑在了一起。Sutton 与 Barto 的框架优化的是reward-to-go——从当前时刻起未来能累积到的奖励,通常还乘一个折扣因子 $\gamma \in [0,1]$:

$$ G_t = \sum_{k=0}^{\infty} \gamma^k\, r_{t+k+1} $$

这里每一个符号都携带假设。$r_{t+k+1}$ 是一个确定的函数值:给定状态-动作对,环境返回一个固定的数。$\gamma$ 编码了一个固定的时间偏好率——所有未来奖励按同一个指数衰减。这两条在物理系统里都很自然(能耗就是能耗,未来的能耗按利率折现),在人类偏好上却都可疑:人的时间偏好不是指数的(是双曲的,这是行为经济学的经典结论),而「这个回复有多好」也绝不是一个确定的函数。

RL 领域自己对「奖励是什么」有过明确表述。Singh 等人(2009)写道:

RL 系统里的奖励对应于原初奖励(primary rewards),即在动物身上由进化过程因其与繁殖成功的相关性而硬连线的奖励。……进一步地,形成值函数的 RL 系统……实际上创造了条件性的或次级的奖励过程,使得原初奖励的预测器本身也起到奖励的作用……结果是值函数的局部景观给出了系统偏好行为的方向:决策被做出以促成向更高值状态的转移。值函数的梯度与激励动机之间可以画出一个紧密的类比。

请注意这段话的前提:奖励是进化硬连线的、原初的、目标明确的。这与「一个从十万条众包比较里拟合出来的、聚合了多模态多人偏好的神经网络输出」几乎是两种东西。

血统三:最优控制与深度 RL——继承了优化器,没继承保证

第二条血统的数学骨架来自动态规划。Bellman(1957)的马尔可夫决策过程(MDP)和 Bellman 方程给出了递归计算 reward-to-go 的方法,它的性能保证建立在一个封闭环境上:状态-动作的转移分布不变。此后时序差分(TD)学习(Sutton, 1988)解决了信用分配与在线数据收集的问题,Q-learning(Watkins, 1992)给出了学习状态-动作价值的通用算法,DQN(2013)把它接上深度网络,AlphaGo/AlphaZero(2017)证明了自我博弈可以达到超人水平。ChatGPT 之前,最耀眼的 RL 成果几乎全在这条线上:核聚变反应堆的磁控、高速无人机飞行、各类游戏。

这些成功无一例外地依赖一个单一的、闭式的奖励或成本函数。最小化一次任务的能耗、赢下一盘棋、让等离子体保持在某个位形——每一个都能返回明确的最优行为。人类偏好模型不能。

核心结论:成本 ≠ 奖励 ≠ 偏好
  • 成本(cost):来自控制论。物理的、可测的、给定的,通常有明确的最优值和界。「这次运动消耗了 3.2 焦耳」不需要任何人同意。
  • 奖励(reward):来自心理学,被 RL 借来当作一个便于最大化的标量。它是设计者选择的,不是世界给的。
  • 偏好(preference):来自人。关系性的、语境依赖的、不稳定的——根本不显然是一个标量。
现代后训练在实践中把这三者当作可互换的对象。把偏好压成奖励让优化变得可做,但这也正是 RLHF 与偏好数据里那一堆「无法根治的偏置」的根因。

一个奇怪的缺席:逆强化学习

值得一提的是,RLHF 文献里几乎不提逆强化学习(Inverse Reinforcement Learning, IRL)——即从智能体的行为反推奖励函数(Ng & Russell, 2000)。这在概念上和「学一个奖励模型」是同一件事,而且有更成熟的理论工具。作者的解读是:这主要反映了工程路径依赖——RLHF 是从「什么能稳定跑起来」演化出来的,不是从「什么理论最合适」推导出来的。他同时把这标记为一个值得投入的方向:把 IRL 的方法扩展到开放式对话的复杂度上。

另外一个容易踩的语义陷阱:「value」这个词在 RLHF 文献里有两个完全不同的意思。在 RL 里,value 是对未来奖励的数值估计(Bellman 方程里的那个 $V$);在对齐讨论里,value 是道德或伦理原则(「人类价值观」)。两者在同一篇论文里共存却常常不作区分,读文献时要自己盯住是哪一个。

3. VNM 效用定理:把偏好压成标量的「许可证」

把成对比较拟合成一个标量函数 $r(x,y)$,这件事在数学上凭什么合法?答案是 1947 年冯·诺依曼与摩根斯坦在《博弈论与经济行为》中给出的VNM 效用定理。它是整个 RLHF 数学框架的授权书,所以值得把它讲清楚。

定理说了什么

设有一个结果集合 $\mathcal{O}$(在我们这里就是「模型可能生成的所有回复」),以及定义在结果的概率分布(称为「彩票」,lottery)上的一个偏好关系 $\succeq$。如果 $\succeq$ 满足下面四条公理,那么存在一个效用函数 $u:\mathcal{O}\to\R$,使得对任意两个彩票 $L_1, L_2$:

$$ L_1 \succeq L_2 \quad\Longleftrightarrow\quad \E_{o\sim L_1}[u(o)] \;\ge\; \E_{o\sim L_2}[u(o)] $$

并且 $u$ 在正仿射变换下唯一(即 $u$ 和 $au+b$($a>0$)表示同一个偏好)。四条公理是:

公理形式化直白含义
完备性(completeness)对任意 $A,B$,$A\succeq B$ 或 $B\succeq A$ 至少成立其一任意两个选项都可比。没有「我说不上来」这个选项。
传递性(transitivity)$A\succeq B$ 且 $B\succeq C$ $\Rightarrow$ $A\succeq C$偏好不能成环。
连续性(continuity)若 $A\succ B\succ C$,存在 $p\in(0,1)$ 使 $pA+(1-p)C \sim B$不存在「无穷重要」的选项;任何东西都能用概率换算。
独立性(independence)$A\succeq B \Rightarrow pA+(1-p)C \succeq pB+(1-p)C$,$\forall C, p$加入一个与两者无关的第三选项,不改变原有排序。
推导:为什么公理能推出一个数

直觉上,构造 $u$ 的过程是这样的:先找出最好的结果 $\top$ 和最差的结果 $\bot$,令 $u(\top)=1, u(\bot)=0$。对任意中间结果 $o$,由连续性可知存在唯一的 $p_o\in[0,1]$,使得「确定得到 $o$」与「以概率 $p_o$ 得到 $\top$、否则得到 $\bot$」这两个彩票等价。定义 $u(o) := p_o$。

剩下要证的是这个 $u$ 确实表示了原偏好,而这一步用的正是独立性:它允许你把任意复杂的彩票逐层替换成 $\top/\bot$ 的混合,而不改变偏好关系。完备性保证每个 $o$ 都能被比较(否则 $p_o$ 无定义),传递性保证 $p_o$ 的赋值是自洽的(否则会出现 $u(A)>u(B)>u(C)>u(A)$ 这种矛盾)。

关键在于:每条公理都在这个构造里承担了不可省略的角色。少一条,标量表示就不存在。这不是「近似成立就近似有效」的定理——传递性一旦被破坏,无论 $u$ 怎么取,都会存在被表示错的偏好对,而且误差有下界。这一点在下一节会算出具体数字。

从 VNM 到 Bradley-Terry:RLHF 里实际用的那一步

VNM 定理只说效用函数存在,没说怎么从观测数据里估出来。补上这一步的是 1952 年的 Bradley-Terry 模型(第 5 章已详细推导过):假设人选择 $y_w$ 胜过 $y_l$ 的概率由两者的潜在分数之差决定,

$$ P(y_w \succ y_l \mid x) \;=\; \sigma\big(r(x,y_w) - r(x,y_l)\big) \;=\; \frac{e^{\,r(x,y_w)}}{e^{\,r(x,y_w)} + e^{\,r(x,y_l)}} $$

其中 $\sigma$ 是 sigmoid,$r(x,y)\in\R$ 是无量纲的标量(只有差值有意义,整体平移不变——这正好对应 VNM 的正仿射不唯一性)。给它一堆成对人类比较,最大化对数似然,出来一个标量奖励函数。这就是为什么 RLHF 需要偏好数据,也是不完美进入系统的入口。

直觉:这两个定理的分工 VNM 定理是存在性陈述——「在这些条件下,一个数是够用的」。Bradley-Terry 是估计方法——「给我比较数据,我把这个数估出来」。RLHF 实际上只用了后者,却默认前者的条件成立。这是一个很典型的工程借用模式:拿走了工具,没拿走使用条件。同样的模式在上一节已经出现过一次——我们继承了 RL 的优化器(PPO、GRPO),却没继承 MDP 框架下的收敛保证。

一个标量,无数个维度

把 VNM 的结论落到具体的奖励模型上,才能看清它在要求什么。一个 RM 输出的那个数,同时压缩了:

  • 有用性、诚实、无害、语气、格式、长度、审美品味;
  • 标注员的心理状态、文化背景、以及他用的那个界面;
  • 比较是怎么框定(framing)的——先看哪个、是否允许平局、量表几个点。

然后我们对着这个数做几百到几千步的梯度上升。这在原理上就不可能做到完美:只要真实的「好」是多维的,把它投影到一维就必然丢掉信息,而优化器会精准地钻进被丢掉的那些维度里。

理论上并非完全没有出路。MDP 框架可以被改造以容纳 VNM 定理(Pitis, 2019 关于折扣因子的决策论重构就是一例),但这在实践中几乎无人使用。而且更深的问题在后面:马尔可夫形式本身表达力有限(Abel 等人 2021 的《On the Expressivity of Markov Reward》给出了「存在无法被任何马尔可夫奖励函数表示的任务」的构造性结果),语言任务还必须转成部分可观测过程(你看不到用户的真实意图),这让问题设定的精确性进一步下降。Pitis(2023)更直接:要一致地聚合具有不同时间偏好的多个目标,奖励必须是非马尔可夫的——而我们训的 RM 是马尔可夫的(只看当前完整回复打一个分)。

被忽略的那一层:表示 ≠ 交互

人机交互(HCI)研究者提出的批评是另一个角度:任何偏好的数值模型都可能捕捉不到场景中的相关偏好,因为选择是怎么被展示的会影响人的偏好。同一对回复,左右调换位置、改变字体、加或不加 markdown 渲染,标注结果都会变。这意味着「怎么表示偏好」也许是次要问题,「这个表示如何被嵌入到人可用的工具里」才是主要问题。

发展经济学有同样的回响。Sen(1973)的《行为与偏好概念》指出:显示偏好理论可能只是在重演休谟的断头台(Hume's guillotine,你不能从「是」推出「应该」)。特别地,他区分了两件常被混同的事:

选择(choice)偏好(preference)
问题形式我要什么?X 比 Y 更好吗?
受什么影响可得性、成本、社会规范、当下情境(假设中的)内在排序
RLHF 观测到的是只有前者——标注员点了哪个按钮

我们从「他点了 A」推出「他认为 A 更好」,再推出「A 客观上更好」,最后推出「模型应该多生成 A 这样的东西」。这条推理链上的每一步都不是逻辑必然的。

4. 四条公理在 RLHF 里如何逐条失效

讲座里作者的原话很直接:在 RLHF 里,这四个「如果」基本上一个都不成立。这一节把每一条拆开,给出它在实际标注流程里长什么样,以及后果是什么。

公理在 RLHF 中如何被破坏直接后果
完备性标注员经常真的分不出高下(两个回复都对、风格不同),但界面往往强制他选一边(早期 Claude 用 8 点量表,无平局选项)约一半的「偏好」是被迫产生的抛硬币,进入训练集时和真实偏好权重相同
传递性在复杂任务上人类比较会成环;不同标注员各自传递、聚合后不传递Bradley-Terry 无法表示,产生不可消除的拟合误差下界
连续性存在词典序偏好:「有安全问题的回复无论多有用都排最后」「无穷负效用」无法用有限标量表示,安全性与有用性的权衡被扭曲成一个可交易的比率
独立性加入第三个选项会改变前两个的排序(吸引效应、妥协效应);同一对回复在不同 batch 上下文里被评得不同偏好标签依赖于采样策略与批次组织,数据不可复现

不可传递性:一个可以算的例子

传递性的破坏最值得细看,因为它能直接量化成 RM 的精度上限。

设想同一个 prompt(「解释一下什么是梯度下降」)下的三个回复:

  • A:三句话讲完,准确但极简。
  • B:一页纸,有类比有公式,但有一处小错误。
  • C:半页纸,全对,但干巴巴没有类比。

三个标注员各自内部是传递的,但侧重不同:

标注员看重排序
甲可读性 > 完整性 > 正确性$B \succ C \succ A$
乙正确性 > 可读性 > 完整性$C \succ A \succ B$
丙完整性 > 正确性 > 可读性$A \succ B \succ C$

现在按多数票聚合每一对(这正是标注平台在做的事):

  • $A$ vs $B$:乙、丙选 $A$  →  $A \succ B$(2:1)
  • $B$ vs $C$:甲、丙选 $B$  →  $B \succ C$(2:1)
  • $C$ vs $A$:甲、乙选 $C$  →  $C \succ A$(2:1)

于是 $A \succ B \succ C \succ A$——一个孔多塞循环(Condorcet cycle)。注意这里没有任何一个人是不理性的,也没有任何标注噪声。循环是聚合过程本身制造出来的。

推导:循环给 RM 精度设了多高的上限

假设 RM 学到了三个标量 $r_A, r_B, r_C$。Bradley-Terry 预测的偏好方向完全由这三个数的大小顺序决定,而实数的大小顺序必然是传递的。所以 RM 至多能正确表示上面三条比较中的两条。

更定量地:数据集里每对的经验胜率都是 $2/3$。带交叉熵损失的最优拟合下,把 $\Delta_{AB} = r_A - r_B$ 等记为差值,约束是 $\Delta_{AB} + \Delta_{BC} + \Delta_{CA} = 0$(三个差值必然闭合),而数据希望三个差值都是正的。这在代数上不可能。对称的最优解是 $r_A = r_B = r_C$,此时每对预测概率都是 $0.5$,准确率 $50\%$,损失 $\log 2 \approx 0.693$;而数据的熵下界是 $H(2/3)\approx 0.637$ nats。这个 $0.056$ nats 的差就是不可约的模型误设误差,加更多数据、加大模型都消不掉。

若打破对称(比如让 $r_A > r_B > r_C$),可以在 $A\succ B$ 和 $B \succ C$ 上做到接近 $2/3$ 的准确率,但在 $C$ vs $A$ 上就会掉到 $1/3$——总准确率仍在 $2/3$ 上下徘徊。无论怎么调,标量模型都拿不到这份数据里的全部信息。

这个三元例子是玩具,但它的结构在真实数据里普遍存在:任何一个 prompt 上,只要标注群体在看重什么上有分歧,成对聚合就可能生成循环。这就是为什么 RM 的留出准确率在 $70\%$ 附近就上不去了——一部分是标注噪声,另一部分是标量表示的结构性缺陷。

偏好会漂移

VNM 定理里那个偏好关系 $\succeq$ 是一个固定的数学对象。现实里它不是。

心理学与行为经济学的结论很一致:偏好随时间、情绪、经历而变(Pettigrew 的《为变化中的自我做选择》一书专门讨论这个哲学难题——如果做决定的「我」和承受结果的「我」不是同一个人,那「他的偏好」到底指谁的?);选择由情境与框架塑造,不只由一个内在排序决定。前景理论最著名的那条价值函数图说的就是这件事:同一个结果,参照点不同,估值就不同——损失的痛苦大约是等额收益快乐的两倍,而「什么算损失」完全取决于你把哪个点当作零点。

对 RLHF 来说,这带来两个具体的工程后果:

常见误区

误区一:把标注当作独立同分布采样。标注员连续标 200 条会发生什么?他会疲劳、会形成自己的启发式规则、会因为刚看过一个特别长的好回复而调整对长度的期望。这是序列相关的漂移,而 shuffle 数据并不能消掉它——因为它已经烙在标签里了。

误区二:把标签当作永久有效。「收集一次标签,之后反复拿来训练」这个做法隐含假设偏好是静态的。但 2023 年收集的偏好数据,反映的是当时人们对 AI 回复的期待(那时长回复=努力=好)。今天用户已经被训练得偏好简洁。偏好数据是有保质期的,而这个保质期在实践中几乎从不被追踪。

还有一类更隐蔽的问题:代理测量。很多偏好信号不是人明确给的,而是从行为里推的——页面停留时长、是否关闭标签页、是否把同一个问题重新问一遍。这些指标很便宜、量很大,但它们与「用户是否满意」的关系是未经检验的,而且一旦模型开始被这些指标优化,指标本身的含义就会改变(用户重问一遍可能是因为第一次答得不好,也可能是因为答得很好所以想深入)。原文把这类问题概括为:这些测量如何通过后续的训练和部署与它们被采集的领域发生交互,从未被审视。

5. 聚合多人偏好:Arrow 不可能定理及其后果

上一节的循环例子已经暗示了:麻烦不只出在「单个人的偏好是否可标量化」,更出在把多个人的偏好合成一个。这正是社会选择理论(social choice theory)研究了七十多年的问题,而它给出的第一个重大结论是一个否定性的。

定理陈述

Arrow(1950)考虑这样一个问题:有 $n$ 个个体,每人对 $m \ge 3$ 个备选项有一个完备且传递的排序。我们想要一个社会福利函数 $F$,把这 $n$ 个排序映射成一个集体排序,并且希望它满足:

条件含义在 RLHF 里对应什么
无限定义域(universal domain)$F$ 对任意个体排序组合都有定义RM 必须对任何 prompt/回复对给分,不能拒答
帕累托效率(Pareto)若所有人都认为 $A\succ B$,集体也必须认为 $A\succ B$所有标注员一致的样本,RM 必须学对
无关备选项独立性(IIA)集体在 $A,B$ 之间的排序,只依赖每个人在 $A,B$ 之间的排序,与第三个选项 $C$ 无关$r(x,A)$ 与 $r(x,B)$ 的比较,不应受训练集里其他回复的影响
非独裁性(non-dictatorship)不存在某个个体,其排序总是直接成为集体排序模型不应只反映某一个标注员/某一群人的偏好

Arrow 不可能定理:当备选项不少于 3 个时,同时满足前三条的社会福利函数必然是独裁的。换句话说,这四条要求互不相容,没有任何投票规则能全部满足。

核心结论:这对 RLHF 意味着什么 奖励模型就是一个社会福利函数——它拿一群标注员的成对判断,输出一个统一的排序(由标量 $r$ 诱导)。所以 Arrow 定理直接适用:不存在一个「公平地」聚合了所有人偏好的奖励模型。这不是数据不够、模型不够大、标注指南不够细的问题,是聚合这件事本身的数学性质。任何一个部署中的 RM,都在这四条里悄悄放弃了至少一条——而通常放弃的是非独裁性(实际上主要反映了某个特定人群的偏好)或 IIA(打分依赖于训练分布里有什么)。

RM 在哪一条上违规

把 Bradley-Terry + 最大似然当作一个投票规则来看,会发现它其实很像 Borda 计数的一个概率化版本:每个候选项的分数由它在所有成对比较中的表现累加而来。而 Borda 计数是众所周知违反 IIA 的——往候选池里加一个新选项,会改变原有两个选项的相对名次。

这在 RM 训练里有一个非常具体、非常常见的表现:

注意:IIA 违规的工程表现 你的偏好数据集里,回复 $A$ 和 $B$ 的相对得分,取决于数据集里还有哪些别的回复。如果你的采样策略偏向长回复,那么在「长 vs 短」这个维度上 RM 会学到更陡的斜率,进而影响它对一对都不长的回复的打分。这就是为什么换一个采样源重训 RM,分数分布会整体漂移,也是为什么不同来源的偏好数据混在一起训练需要格外小心——你不是在合并两个「同一个真值的独立观测」,你是在合并两个不同的投票规则。

逃生通道及其代价

Arrow 定理的前提之一是只使用序数信息(谁排在谁前面),不允许人际间的效用比较。放宽这一条就能绕过定理,这正是 Harsanyi(1977)的路线:如果假设不同人的效用可以在同一把尺子上相加,那么规则功利主义可以给出一致的聚合。

Bradley-Terry 隐式地做的正是这件事——它把所有人的判断当作对同一个潜在标量 $r$ 的带噪观测,因此天然地在做人际效用比较。代价是这个假设本身极其强:它等于宣称「甲对 A 的偏好强度」和「乙对 B 的偏好强度」可以直接比大小。经济学里对此有一个多世纪的争论,没有共识。

这个假设也启发了 AI 安全里一整条研究线,源头是行为经济学的委托-代理问题:

  • 合作式逆强化学习(Cooperative IRL, Hadfield-Menell 等 2016)——把对齐建模成人与 AI 的合作博弈,AI 不知道人的奖励函数,需要边行动边推断。
  • 多委托人辅助博弈(Fickinger 等 2020)——把「一个人类主人」扩展到多个,直接撞上聚合问题。
  • 但由此得出的效用函数可能与可纠正性(corrigibility, Soares 等 2015)冲突——一个坚定最大化某个效用的系统,恰恰有动机抵抗创造者的纠正干预。你越成功地让系统内化一个效用函数,它就越不愿意让你改它。

社会选择作为对齐的方法论

作者本人参与的 2024 年立场论文《Social Choice Should Guide AI Alignment in Dealing with Diverse Human Feedback》主张:既然聚合是难点,社会选择理论就应该成为对齐研究的方法论来源。要回答的问题很朴素但没人认真答过:

  • 谁的偏好算数?标注员池的人口构成是怎么定的?
  • 标注员意见不一致时怎么合并?多数票、平均、还是保留分布?
  • 如果不同群体系统性地想要不同的东西,一个模型该怎么办?

围绕这些问题形成了「多元对齐」(pluralistic alignment)这个子领域,产出包括立场论文、专门的数据集(PRISM Alignment Project,2024,明确记录标注者的人口学与文化背景,展示了 LLM 对齐的主观性与多文化性),以及个性化方法(如变分偏好学习,Poddar 等 2024——用一个隐变量表示「这个用户是哪一类人」,让奖励模型条件在它上面)。

Lambert 的判断 作者对这条线的态度是坦率的两面:一方面他称之为「我以前花更多时间钻的兔子洞之一」,暗示它在工业实践中的即时回报有限;另一方面他明确说偏好的本质是 RLHF 长期存在的问题,是「一个很好的学术问题」。实践者的读法应该是:不要指望社会选择理论今天能改进你的 RM 分数,但要用它来校准你对 RM 的期待——当你发现无论怎么调数据都有一批用户不满意时,那可能不是 bug,而是你正在试图用一个标量同时服务两群想要不同东西的人。真正的解法在系统层(多模型、可配置的系统提示、用户级个性化),不在损失函数层。

6. 分歧不是噪声:标注者一致率与「对齐到谁」

那个 70% 是从哪来的

第 5 章给过一个数字:奖励模型在留出偏好对上的准确率通常在 65%–75%,很少超过 80%。图像分类器 70% 准确率会被认为没训好,但 RM 不一样,因为人类标注员之间的一致率本身就在 60%–75%。

把这件事写成一个上界会更清楚。设两个独立标注员对同一对回复给出相同判断的概率是 $a$。若假设每对样本存在一个「真标签」,标注员以概率 $q$ 给出真标签、以 $1-q$ 给出相反标签,那么

$$ a = q^2 + (1-q)^2 \quad\Longrightarrow\quad q = \frac{1+\sqrt{2a-1}}{2} $$

代入 $a=0.70$ 得 $q \approx 0.82$;代入 $a=0.65$ 得 $q\approx 0.77$。$q$ 就是一个完美的预测器(直接输出真标签)在这份带噪标注上能达到的准确率上界。所以:当你的 RM 在留出集上跑到 0.75,你离这份数据的信息论上限已经不远了;跑到 0.90 几乎必然意味着测试集里有可被表层特征(长度、格式、模型身份)识破的捷径。

常见误区 上面那个推导有一个自己都不成立的前提:它假设存在「真标签」。这正是本章要反对的东西。如果甲和乙的分歧是因为他们看重不同的维度(一个要简洁一个要完整),那么就不存在被噪声掩盖的真值——两个人都是对的。此时「RM 准确率」这个指标本身就有问题:它在奖励模型去猜标注池的多数意见,而不是去建模偏好的分布。

分歧的四种成分

把「标注员意见不一致」当成一个整体来降噪,是把四种性质完全不同的东西混在了一起:

分歧来源例子是噪声还是信号该怎么处理
真实错误标注员没读完就点了;把有事实错误的回复选成 chosen噪声质检、黄金题、剔除低质标注员
指令歧义标注指南没说清「有用」和「安全」冲突时听谁的噪声,但根因在你改指南,不是改数据
语境缺失prompt 本身有歧义,两个回复各自回答了不同的解读信号(关于 prompt 的)标记为「不可判定」,或拆成多个 prompt
价值分歧一个人认为该直接给答案,另一个认为该先反问澄清纯信号保留分布,不要多数投票抹平

工业界的标准流程(多数投票、丢弃一致率低的样本、只保留「高置信」对)对前两类是正确处理,对后两类是信息销毁。第 11 章讨论的开放问题里,作者把这个问题写得很直白:标注员分歧应该被当成噪声的来源,还是一种信号?

Lambert 的判断 把低一致率样本全部丢掉,会系统性地让训练集只剩下「所有人都同意的那些容易题」。而所有人都同意的地方,模型本来也不太会错。你花大价钱买来的人类判断,最有价值的部分恰恰是有争议的那部分,却被过滤流程当作脏数据扔了。更务实的做法是:把一致率作为一个字段保留下来,而不是作为过滤条件。它至少可以用来做样本加权、做不确定性估计、以及在评测时区分「模型答错了」和「这题本来没有标准答案」。

对齐到谁的价值观

「alignment(对齐)」这个词在语法上缺一个宾语:对齐到谁?流水线的每一环都在悄悄回答这个问题:

  1. 标注员池的构成。谁被雇来做标注?在什么国家、什么薪资水平、什么教育背景?这批人的口味会成为模型的口味。第 11 章会讲到这是一个供给受限、关系驱动的行业,大合同(约 50 万美元量级、分多批交付)里最初几批往往被整批废弃,因为目标和方法论还在收敛。
  2. 标注指南。合同签完后,买方和供应商会就每一类任务约定详细的指令,这份文档通常永不外流。少数公开的例子之一是 OpenAI 当年随 InstructGPT 发布的完整标注指南——几十页关于如何在「有用、真实、无害」之间排序的规定。真正塑造标签的是这份文档,不是损失函数。
  3. 行为规范文档。OpenAI 的 Model Spec(2024)是这一层的公开化尝试:它写明模型应该如何表现。Anthropic 的 Constitution 是另一种形态。
  4. 模型实际学到的东西。这是最后一环,也是唯一没人查的一环。
注意:未被审计的缺口 作者把这条链的断点说得很清楚:规范 → 数据 → 行为之间的映射,因为工业 RLHF 是封闭的,从来没有被验证过。我们无法检查一个训练出来的模型是否真的反映了给标注员的那份规范。Model Spec 记录了意图,但从数据到行为的这一段基本处于无审计状态。这也是为什么本书反复强调开放偏好数据的价值——不是因为开放数据质量更高,而是因为只有开放数据才能让这个映射被第三方检验。目前最好的公开例子是 NVIDIA 的 HelpSteer 系列,它同时发布了数据和采集方法论。

动机与实践的分家

这一节的结论也是全章最重要的一句判断:RLHF 的动机(对齐到人类偏好)已经与它的实践(把模型做得更有效)漂移开了。

今天在实验室里跑 RLHF 的人,绝大多数不是在做价值校准,而是在做经验性能优化——刷 chat 评测、降低拒答率、改善写作风格。这本身完全正当,而且是这套方法真正的价值所在。危险在于混淆:用「对齐」的修辞去描述一个纯粹的能力优化流程,会同时高估它的安全意义和低估它的工程价值。原文的表述是:RLHF 方法在实践中是从经验对齐的角度被推动和研究的——在特定技能上最大化模型表现,而不是测量对特定价值的校准程度。

7. 理论极限在工程上的显形

前面六节的抽象论证,如果落不到具体现象上,就只是哲学。这一节把每条理论缺陷映射到你在训练日志里真能看见的东西。

映射表

理论缺陷工程表现你在哪看到它
多维压成一维(VNM 的代价)长度偏置:更长的回复系统性得分更高RL 训练中平均回复长度单调上升,且与 RM 分数强相关
同上格式偏置:列表、粗体、emoji 让回复「看起来更好」模型逐渐把一切都排版成带项目符号的清单
偏好依赖框架与呈现前缀偏置:开头几句不成比例地决定了标签RM 对同一回复换个开场白打分大幅变化
选择 ≠ 偏好(Sen)谄媚:同意用户比说对更容易赢得比较模型在用户表达立场后改口;反驳率随 RLHF 步数下降
同上奉承与辞藻:装饰性语言抬高分数「这是一个非常好的问题!」类开场白的频率上升
不可传递 + 标注噪声RM 准确率天花板 ~70%怎么加数据、加参数都突破不了留出集准确率
IIA 违规RM 打分依赖训练分布换采样源重训,分数分布整体漂移;跨 RM 的分数不可比
目标错配过优化:RM 分继续涨,真实质量开始跌RM 分数与人工评测/留出评测在某一步之后反向

最后一行是第 14 章的全部内容。这里只强调一件事:过优化不是优化器的毛病,是奖励函数是学出来的这一事实的必然结果。如果 $r$ 是真值,随便优化多狠都没问题;正因为 $r$ 只是真实偏好在一个有限数据集上的低维投影,充分强的优化必然会找到投影的零空间——那些 RM 分高但真实质量低的区域。

过优化曲线:代理奖励持续上升而真实奖励先升后降
横轴是相对参考策略的 KL 距离(优化强度),实线是代理奖励(学出来的 RM 给的分),虚线是「真实」奖励。两条线在早期一起涨,但代理奖励一直涨、真实奖励在某个 KL 之后掉头向下。这张图是本章所有哲学讨论的唯一可测量的证据:如果偏好真的可以被一个标量完美表示,这两条线就不会分开。分开的位置和幅度,就是本章讨论的那些理论缺陷的定量总和。

为什么 RLVR 能绕开这一切

把本章的框架反过来用,可以立刻解释第 7 章推理模型的成功。在数学和代码上:

  • 完备性成立——任何两个答案都能比较(对/错)。
  • 传递性成立——正确性是良序的,不可能成环。
  • 不需要聚合——不存在多人分歧,因此 Arrow 定理不适用。
  • 奖励不是学出来的——它是一个验证器,所以不存在可被钻空子的低维投影(除非验证器本身有漏洞,这就是 reward hacking 的另一种形态)。

换言之,RLVR 之所以能承受远超 RLHF 的优化强度(几千步 RL、KL 系数可以调到很小甚至为零),根本原因不是算法更好,而是它工作的领域恰好满足了那些公理。这也划出了 RLVR 的边界:一旦离开可验证域,回到「哪首诗更好」,所有问题原封不动地回来。当前前沿实验室的做法——用 rubrics、用 LLM-as-a-judge、用可验证信号做骨架加偏好信号做润色——本质上都是在尽可能扩大可验证域的边界,把不得不用偏好的部分压到最小。

Lambert 的判断 作者对这一章的收束是:偏好的本质是 RLHF 长期未解、也最「人」的那部分问题,建议多读、并且读一手文献(Arrow、Sen、Hirschman 的原文,而不是二手综述)。对实践者,这条建议的可操作版本是:当你的 RLHF 流程遇到瓶颈时,先问一句「我现在优化的这个能力,有没有可能被改造成可验证的?」——如果能,做这个改造的收益远大于继续调 RM。结构化偏好对(数学:对解 ≻ 错解;指令跟随:带约束采样 ≻ 不带约束采样,用代码检查约束,标签免费)在窄域里能打败靠人工判断质量得到的偏好对,这一点在 Tülu 的实验里得到了验证。

什么时候必须回到偏好

但也不要走到另一个极端。偏好数据不可替代的场景是真实存在的:

能力可验证吗怎么办
数学、竞赛编程能RLVR,不需要 RM
格式约束、结构化输出能(代码检查)结构化偏好对或直接 RLVR
事实性问答部分(需要检索/知识库)验证器 + 偏好兜底
写作质量、语气、共情不能只能偏好,接受 ~70% 天花板
安全边界的细粒度判断不能(且是价值分歧最大的地方)规范文档 + 偏好 + 明确接受不中立
「模型该有什么人格」不能本章讨论的所有问题的集中爆发点

最后一行值得单独说:模型人格是一个纯粹的价值分歧问题,不存在正确答案,也不可能有一个所有人都满意的 RM。而它恰恰是用户感知差异最大的维度。这解释了为什么各家模型的「性格」如此不同,也解释了为什么模型更新最容易引发用户抗议——你在替一亿人做一个 Arrow 定理禁止你公平地做出的决定。

本章小结

一句话速查

概念要点对工程的影响
偏好 vs 正确偏好是「没有正确答案」时的替代品可验证的部分优先用 RLVR,剩下的才用偏好
判断 > 生成识别好回答比写出好回答容易得多这是 RLHF 存在的经济学基础;代价是信号只有 1 bit
成本 ≠ 奖励 ≠ 偏好三个来自不同学科、性质不同的对象被当成可互换很多「无法根治的偏置」的根因
VNM 定理完备性 + 传递性 + 连续性 + 独立性 ⟹ 存在标量效用RLHF 用了结论(标量 RM),没检查前提
Bradley-Terry$P(y_w\succ y_l)=\sigma(r_w - r_l)$,把比较变成标量实数序必然传递 ⟹ 无法表示循环偏好
孔多塞循环个体传递 + 多数聚合 ⟹ 集体可能不传递三个理性标注员就能造出 RM 学不了的数据
Arrow 不可能定理无限定义域 + 帕累托 + IIA + 非独裁,四者不可兼得不存在「中立」的奖励模型,只有放弃了哪一条的差别
Sen:choice ≠ preference我们只观测到点击,却推断出价值显示偏好的每一步推断都不是逻辑必然
偏好漂移随时间、情绪、框架、参照点变化标注非 i.i.d.;偏好数据有保质期
标注一致率 60%–75%对应完美预测器上界约 77%–82%RM 准确率 0.90 = 在拟合捷径
分歧四分法真实错误 / 指令歧义 / 语境缺失 / 价值分歧只有前两类该被过滤;后两类是信息,应保留
目标错配RM 按分类准确率训,被当策略质量用RewardBench 是代理的代理;差几个点时必须端到端验
规范 → 数据 → 行为工业 RLHF 封闭,这条链从未被审计开放偏好数据的核心价值在于可检验,不在于质量

给实践者的六条

  1. 先问能不能验证。任何一个能力,如果能写出程序化检查器(数学答案、代码测试、格式约束),就不要走偏好这条路。结构化偏好对在窄域里能打败人工质量判断。
  2. RM 准确率超过 0.80 就该警惕,而不是庆祝。去检查测试集里有没有长度/格式/模型身份的捷径。
  3. 不要用多数投票抹平分歧。把一致率作为字段保留,用来做样本加权和不确定性估计,而不是过滤条件。
  4. RM 基准分数只用来排除坏 RM。两个 RM 分差在几个点以内时,唯一可靠判据是接进 RL 跑端到端评测。
  5. 把偏好数据当作有版本、有保质期的资产。记录采集时间、界面、指南版本、标注池构成。三年前的偏好数据反映的是三年前的用户期待。
  6. 接受不中立,并把它显式化。与其假装 RM 代表「人类偏好」,不如明确写出「本模型对齐到这份规范文档」,让分歧可以在系统层(系统提示、个性化、多模型)而不是损失函数层解决。

动手实验

本章没有配套作业目录,但这里的两个论断可以用几十行代码验证,而且验证过程本身就是最好的理解方式。建议在读完第 4、6 节后各做一个。

实验一:Bradley-Terry 拟合循环偏好的极限

验证第 4 节的结论:当偏好数据里有孔多塞循环时,标量模型存在不可约的损失下界。这里直接优化三个标量 $r_A, r_B, r_C$(等价于一个「记住了所有答案」的无限容量 RM),如果连它都做不到,真实的 RM 更做不到。

import torch

# 三条比较,每条的经验胜率都是 2/3(第 4 节的三标注员例子)
# (i, j, p) 表示「i 胜过 j」的经验概率为 p
pairs = [(0, 1, 2/3),   # A > B
         (1, 2, 2/3),   # B > C
         (2, 0, 2/3)]   # C > A   <-- 环在这里闭合

r = torch.zeros(3, requires_grad=True)
opt = torch.optim.Adam([r], lr=0.05)

for step in range(3000):
    loss = 0.0
    for i, j, p in pairs:
        # Bradley-Terry: P(i > j) = sigmoid(r_i - r_j)
        logit = r[i] - r[j]
        # 软标签交叉熵:数据说有 p 的比例选 i,1-p 的比例选 j
        loss = loss - (p * torch.nn.functional.logsigmoid(logit)
                       + (1 - p) * torch.nn.functional.logsigmoid(-logit))
    loss = loss / len(pairs)
    opt.zero_grad(); loss.backward(); opt.step()

import math
H = -(2/3 * math.log(2/3) + 1/3 * math.log(1/3))   # 数据的熵下界 ~0.6365
print("学到的分数 r =", r.detach().numpy())         # 三个数几乎相等
print("最优损失     =", loss.item())               # ~0.6931 = log 2
print("数据熵下界   =", H)
print("不可约间隙   =", loss.item() - H)           # ~0.057 nats,消不掉

该观察什么:(1)三个分数会收敛到几乎相同的值——模型的最佳策略是「放弃」,对每一对都预测 50/50;(2)损失卡在 $\log 2 \approx 0.693$,比数据熵 $0.637$ 高出约 $0.057$ nats,这个间隙就是标量表示能力不足的定量代价。

对照实验:把第三条改成 (0, 2, 2/3)(即 $A \succ C$,环被打开),重跑。这次三个分数会拉开(约 $+0.47 / 0 / -0.47$),损失降到 $0.643$,间隙从 $0.057$ 缩到 $0.006$ ——小了一个数量级。唯一的变化是数据是否传递。(剩下的 $0.006$ 来自另一重约束:传递性强制 $\Delta_{AC}=\Delta_{AB}+\Delta_{BC}$,所以三条比较也无法同时都拟合成 $2/3$。标量模型的表达力限制是层层叠加的。)

实验二:标注噪声给 RM 准确率设的上限

验证第 6 节那个公式。做法是造一批合成偏好数据,人为控制标注员的准确率 $q$,看一个「知道真值」的完美预测器在这份数据上能拿多少分。

import numpy as np
rng = np.random.default_rng(0)
N = 200_000

for q in [0.70, 0.77, 0.82, 0.90, 1.00]:
    truth  = rng.integers(0, 2, N)                       # 真标签
    flip   = rng.random(N) > q                           # 标注员以 1-q 的概率标反
    label  = np.where(flip, 1 - truth, truth)            # 观测到的标签
    # 两个独立标注员的一致率
    l2     = np.where(rng.random(N) > q, 1 - truth, truth)
    agree  = (label == l2).mean()
    # 完美预测器(直接输出真标签)在观测标签上的准确率
    acc    = (truth == label).mean()
    print(f"q={q:.2f}  两人一致率={agree:.3f}  完美预测器准确率={acc:.3f}")

该观察什么:当两人一致率是 0.70 时(这正是真实偏好数据的典型值),即使一个预测器完美地知道真标签,它在这份带噪标注上的准确率也只有 0.82 左右。你的 RM 报告 0.75,说明它已经吃掉了可用信息的九成。再往上调,你调的是噪声。

实验三(思想实验,不用写代码)

找一份你手上的偏好数据集,随机抽 30 条你自己也有判断力的样本,遮住原标签自己标一遍,然后对照。你会得到自己与数据集的一致率——通常在 65%–75%。接着把你不同意的那些逐条归类到第 6 节的四种分歧成分里。这个练习十分钟就能做完,但它对「RM 到底在学什么」的理解,胜过读十篇论文。

延伸阅读

本章的主干文献(先读这两篇)

效用与偏好理论(一手文献值得读原文)

  • Von Neumann & Morgenstern, Theory of Games and Economic Behavior (1947) — VNM 效用定理的原始出处。只需读关于四条公理和表示定理的那一节,就能明白 RLHF 借走了什么。
  • Arrow, A Difficulty in the Concept of Social Welfare (Journal of Political Economy, 1950) — 不可能定理的原文,只有二十来页,论证过程比任何转述都清楚。
  • Maskin & Sen, The Arrow Impossibility Theorem (Columbia University Press, 2014) — 两位诺奖得主对定理的现代解读,包括各种绕开路径的代价,比原文更适合先读。
  • Sen, Behaviour and the Concept of Preference (Economica, 1973) — 「选择不等于偏好」这条批评的经典表述,直接对准 RLHF 从点击推断价值的做法。
  • Hirschman, Against Parsimony (1984) — 「人对自己的偏好还有偏好」,主张偏好在原则上不可测量的最有力论述。
  • Harsanyi, Rule Utilitarianism and Decision Theory (Erkenntnis, 1977) — 绕开 Arrow 定理的路线:假设人际效用可比。Bradley-Terry 隐含地站在这一边。
  • Pettigrew, Choosing for Changing Selves (Oxford University Press, 2019) — 偏好随时间变化时「理性选择」意味着什么,是偏好漂移问题的哲学基底。

奖励、控制与表达力的边界

  • Singh, Lewis & Barto, Where Do Rewards Come From? (2009) — 本章引用的那段关于「奖励是进化硬连线的原初信号」的原文出处,读完会立刻感到它和学出来的 RM 不是一回事。
  • Silver, Singh, Precup & Sutton, Reward is Enough (Artificial Intelligence, 2021) — 「一个标量奖励足以产生一切智能」的最强主张,本章基本上是它的反命题,两篇对读效果最好。
  • Abel et al., On the Expressivity of Markov Reward (NeurIPS 2021) — 构造性地证明存在无法被任何马尔可夫奖励函数表示的任务,给「标量奖励够不够」这个问题一个数学答案。
  • Pitis, Consistent Aggregation of Objectives with Diverse Time Preferences Requires Non-Markovian Rewards (NeurIPS 2023) — 把 Arrow 式的聚合难题搬到 RL 的时间维度上,结论是聚合不同时间偏好需要放弃马尔可夫性。
  • Ng & Russell, Algorithms for Inverse Reinforcement Learning (ICML 2000) — 从行为反推奖励函数,与奖励建模高度相关却在 RLHF 文献中奇怪地缺席。作者点名认为这是值得重新投入的方向。
  • Objective Mismatch in Model-based RL (Lambert et al., 2020) — 「目标错配」这个透镜的原始提法,理解了 model-based RL 里的版本,RLHF 里的版本一望即知。

社会选择、多元对齐与个性化

偏置的实证研究(第 7 节那张表的出处)

规范文档与数据透明度