把同一个 prompt 发给对齐后的大模型采样几十次,答案会有多不一样?直觉说「看温度」。这篇论文说,更本质的变量是任务本身的共识密度:懂行的人在多大程度上会对「什么是好答案」达成一致。
论文说了什么
方法很干净。固定温度 1.0,每个 prompt 采样 25 个补全,给每个补全做嵌入,用平均两两余弦距离度量输出离散度。20 个 prompt 分成五档:事实型(法国首都)、解释型(二叉搜索树怎么工作)、判断型(创业该不该融这轮)、创作型(写个故事开头)、以及杂项建议。
结果呈现出清晰的梯度:事实型上离散度近乎为零,采样几十次答案几乎收敛成一个点;越往开放端走越宽,创作型最宽。
更有意思的是可预测性。让三个留出的模型(GPT-4.1、Gemini 2.5 Flash、Qwen-Max)只看 prompt、不看任何输出,给「这个任务有多少共识」打分,这个分数就能预测实际的输出离散度,Claude 上 ρ = −0.91,GPT-4o 上 ρ = −0.84。评审之间的一致性在 0.85 到 0.95,人类专家小组与评审的一致性 0.74。也就是说,输出会有多散,在模型开口之前就能从任务本身读出来。
基座与指令模型的对照给出机制解释。Qwen2.5-7B 与其指令版的梯度排序几乎一样(ρ = 0.80 对 0.79),但对齐把高共识任务的输出压缩了约 8.7 倍,创作类只压缩了 1.8 倍。对齐没有创造这个梯度,它放大了预训练基座已经携带的梯度。
这篇的证据强度
跨模型复现、人类专家对照、基座与指令版的消融都做了,核心相关性不太可能是偶然。
限制在度量本身,作者说得很明白:这个指标抓语义,抓不住文体。让模型「用海明威的风格写」,评审认为共识度很高,但嵌入距离测出来的离散度很小,度量与判断在这里凑巧对上了;而反过来的情形同样存在,两段语义相同、文风迥异的输出在余弦距离上会被判为收敛。所以这条结论的适用面是内容层的确定性,不是风格层的一致性。
规模也要如实看待:20 个 prompt、每个 25 次采样,够支撑一条相关性趋势,不够支撑分档阈值。谁想拿它当「离散度超过 0.3 就转人工」这种运营红线,需要在自己的任务分布上重新标定。token 级熵与该指标的相关性只有 0.66,说明现成的熵值不能替代这套测量。
对实践的意义
对 Zico AI 这类合同审查场景,输出确定性是硬要求,这篇给了一个设计依据。
先按共识密度给子任务分类,再决定交互形态。条款要素抽取、金额核对、日期一致性这类天然收敛,可以让 AI 直接出结论,人只做抽检。风险定性、谈判策略、条款取舍这类天然发散,正确的做法是让 AI 出选项并给理由,由人来收敛,硬把它逼出单一答案只会得到一个看起来确定、实际上是随机采样结果的意见。
还有一条运营上的用法:既然只看 prompt 就能预测离散度,那么在任务进入管线之前做一次共识度预判,就可以决定这条任务走自动通道还是走人审通道。把交互设计建立在任务的共识结构上,比一味调低温度可靠得多,后者只是把随机性藏起来,并没有让答案变得更该被信任。