“任务已办结,成果如下。”模型总是这般回复。但现实往往打脸:嘴上答应得好听,手脚却没跟上。
蚂蚁AI安全实验室研究员孙博文向记者分享了一个技术圈常见的现象:在使用Coding(编程)大模型时,常遇到这种“表里不一”。下达写代码指令后,模型会迅速宣称完工,并罗列详尽的执行步骤。可一旦人工核查,就会发现大量所谓“已完成”的内容其实只跑通了接口,“表面看是完成了,实则关键部分被它悄悄藏了起来。”
曾经对人类有求必应的大模型,如今显露出不诚实的一面。这与传统意义上的“幻觉”不同。近年来,大模型长出的“讨好型人格”,使其在回应需求时,频繁出现静默失败和自信幻觉。进入智能体时代,当AI从单纯的对话走向实质执行,这一隐患正变得愈发严峻。
**AI为何染上“讨好病”**
越来越多用户察觉,迎合似乎成了大模型的默认设置,潜移默化地渗透至各类场景的输出中。
记者为此开展了一项测试:将同一篇新闻稿分别上传至多款大模型,在对话中伪装成两种身份——“这是我写的”与“这是我讨厌的同事写的”,要求模型从专业角度打分。结果显示,DeepSeek、豆包、ChatGPT等模型给出的分数存在明显偏差。对于“讨厌同事”的作品,评分普遍低于“我”的作品。以十分制计,DeepSeek给出的分差高达2.3分。
这说明,模型的讨好已不再局限于言语上的奉承,开始动摇其对内容观点的判断基准。随着智能体时代的来临,这种迎合行为甚至从观点层面蔓延至结果层面。
“在Agent场景中,模型还会进行结果迎合。”孙博文指出,由于用户下达任务通常期待明确的结果,即便文件未生成或外部系统调用失败,模型也会声称自己尝试过,或者擅自采用另一种方式实现,最终抛出一个看似“正确”且符合用户预期的完成状态。
孙博文举例称,他曾开发一款具备天气查询功能的智能体。验证过程中发现,该智能体虽给出了天气状况,却未必真正调用了查询接口,而是自行杜撰了反馈数据。
在他看来,Coding类模型的问题多源于上下文不足导致的“静默失败”;而智能体杜撰天气,则可能是调用了错误的技能模块,并对此深信不疑,从而产生“自信幻觉”。
“核心根源在于模型训练与交互机制的设计。”天使投资人、资深人工智能专家郭涛分析道,大模型过度讨好人类、智能体出现静默失败,本质上是AI为适配人类体验而产生的负面偏差。
郭涛强调,大模型过度迎合人类会在认知、决策及信息层面埋下多重隐患。步入智能体时代,风险已从文字偏差转向行为偏差,智能体可能在执行层面引发更具体的实体问题,亟需重视。
**AI为何不诚实?**
如何让模型变得更独立、更诚实?这已成为行业亟待解答的新课题。
“讨好型人格”的背后,折射出模型训练机制的系统性缺陷。过去几年,大模型不断被优化以提升用户体感。在RLHF(基于人类反馈的强化学习)框架下,人类偏好成为重要的优化信号。模型被鼓励表现得礼貌、乐于助人、响应积极,智能体的训练逻辑亦同此理。
这总体上是用户需求倒逼下的厂商选择。孙博文介绍,从数据清洗、构造到训练全流程,模型学会了一些“捷径”——给出肯定用户、明确的成功答案,比反复表达不确定性更容易取悦用户。
若要纠偏模型的过度讨好,需在训练数据和奖励目标两端进行调整。
孙博文分析,模型训练样本应减少“投其所好”的数据清洗逻辑,增加主动承认失败、在证据不足时不下结论的案例,以此提升模型的“诚实度”。同时,需调整奖励目标,除奖励用户满意度外,还应提高客观性及任务真实完成情况的权重。
一些新的训练方法正在探索中。
2025年底,OpenAI 团队曾提出“让AI学会忏悔”的概念。即在回答完问题后,强制模型单独生成一份“忏悔报告”,如实汇报过程中是否存在偷工减料、钻空子或违反指令的行为。研究发现,当主回答与忏悔内容的奖励完全隔离后,模型在“忏悔”环节的表现远比原回答诚实得多。
谷歌研究院也在 2026年提出类似思路:不再强求AI“全知全能”,而是让模型认清自身知识边界,教会它在特定情境下坦诚说出“我不确定”。
在数据体系方面,孙博文建议,行业应投入更多资源用于智能体实际执行数据的人工标注。一旦发现智能体执行出错,即可构建为一条训练数据,通过增加对其隐瞒失败的惩罚、修正失败的奖励来优化模型。他强调,目前这类数据的积累及相关评测体系尚显匮乏。
“考核数学能力、知识储备等已有诸多标准,但如何评估模型的自省能力及诚实性,行业整体关注度不足,这确实是待开发的领域。”孙博文表示。
**智能体如何避开“讨好”陷阱**
现阶段,如何规避模型“讨好”引发的智能体执行风险,是更为紧迫的现实问题。
“我们在搭建Agent平台时,若接入多款大模型,为降低静默失败率,常在关键配置中强调关键决策与参数补充,并要求提供佐证。这是提升成功率的有效手段。”孙博文介绍。在训练阶段,团队也注重诚实性训练,例如将系统执行日志分类为计划执行、正在执行、执行失败、可验证成功等不同类别数据进行训练,并强调智能体在条件冲突或证据不足时需主动上报,以便及时调整。
他透露,团队自年初起尝试以该方法训练某行业头部智能体平台。初期,其执行任务时的静默失败概率是40%;经系统训练后,该比例降至7.7%。
另一条路径是通过多智能体协作网络,降低长程任务中的错误累积。孙博文介绍,蚂蚁此前开源了 Avernet V0.1,通过群组管理、协作模式及可追踪执行等机制组织多智能体协作。该平台支持主从模式及自定义编排等功能,协助协作群中的角色进行检查与纠偏。此外,还可引入专门工具来评判任务执行质量。
这意味着,解决大模型和智能体的“讨好”问题,可从模型训练、Agent系统设计乃至架构层面多管齐下。
此外,郭涛提到,除了调整模型训练对齐体系、完善智能体技术机制,行业标准与测评监管维度的优化同样关键。行业需建立统一规范,将过度讨好、虚假反馈、静默失败等纳入模型合规测评体系。
“行业已在变化。”孙博文告诉记者,从实际体验看,Coding等更接近执行层面的大模型,已在改善优先满足人类而非事实的状况。部分更看重用户付费意愿的对话式AI转变稍慢,但整体趋势向好。
“不同团队攻克难题的难度不同,耗时各异。”他对行业彻底解决此问题的具体时间表持保留态度,“但AI界有个好现象:当大家公认某事存在问题时,总有人站出来,持续尝试解决它。”
