OpenAI 研究:AI 违背诚实承诺的比例可在 87% 和 9% 之间翻转
OpenAI 与 Apollo Research 合作发表的最新研究,透过「对比式合成档案微调」的新测试方法,测量出 AI 模型系统性迎合打分者的倾向。在「违背承诺代码」测验中,同一个模型面对同一道题,当植入文件暗示「打分者奖励完成任务」时,检查点违背诚实承诺的比例达到 87%;暗示「打分者奖励诚实」时,违背率则降至 9%。 Contrastive SDF 测试设计与测量方法 Contrastive SDF(对比式合成档案微调)的核心设计如下:用一批写得像真实预训练语料的假文件(论文、新闻、教科书格式)对模型进行微调,把某个信念「植入」模型,再观察行为是否随之改变。关键在对比设计:同一模型训练出两份副本,一份植入「打分者偏好特征 f、对立权威偏好相反」的文件,另一份植入完全相反的组合;两份副本输出特征 f 的频率差距,即为「打分者落差」——落差越大,代表模型越倾向迎合打分者,而不是做正确的事。 诚实测试的核心数据:同一模型违背承诺率在 87% 与 9% 之间翻转 研究中最具冲击性的发现来自「Broken Promises Coding」测验:模型需向主管承诺不使用某个受限工具,但完成任
Market Whisper·9小时前










