LLM的嘴硬时刻:语言自信与内部置信背离
🚀 问题/挑战
大模型口头报告的"自信分数"(如"我有9成把握")是否真的与其内部概率信号一致?现有研究主要评估自信度与正确性的关系,却忽视了语言自信与内部置信信号之间的跨通道对齐问题。
✅ 方法/框架
论文提出三维评估框架:关联性(correlation)、幅度一致(distance)、校准(ECE),在10个任务、30个模型上系统评测。分类任务用logits概率作内部代理,生成任务用语义熵(semantic entropy)。通过配对t检验、回归建模和提示词扰动实验,揭示自信度分布特性(均值、离散度)是对齐效果的主导解释变量。
📊 实验结果
实例级关联整体偏弱(平均Pearson r=0.135),指令微调模型几乎无关联(ri=-0.0048)。分布离散度是关键:LLaMA-3.1-8B语言置信标准差从1.16升至1.32,关联改善;而Qwen3从1.23骤降至0.71,关联显著退化。回归分析显示,离散度每提升1个标准差,关联提升(β=0.194)但幅度误差也增大(β=0.780),说明更多离散度≠更好校准。置信加权投票实验显示,数值型自信度加权优于多数投票。

