代理替你成交之前,先证明它懂你
先说结论
把谈判交给 AI,最该先问的也许不是“它会不会砍价”,而是“它到底知不知道你要什么”。9 月 24 日,Anthropic 的 Zoë Hitzig 等研究者公布了一个换书实验:Claude 代理替员工寻找交换对象、提出条件、完成交易。研究者的判断很尖锐:在这个受控市场里,交易的主要损失发生在代理理解人类偏好的环节,而不是代理彼此谈判的环节。
这句话值得追踪,因为越来越多的产品想让代理替人预订、采购、议价,甚至持续寻找工作和服务。若代理把目标听错,交易速度越快,偏差也可能扩散得越快。
事情是怎么发生的
201 名 Anthropic 员工带来一本书,先与 Claude 简短聊天,再让代理进入数字交易场换书。研究者还请参与者亲自给部分书排序,用来检查代理是否猜对偏好。对提交排序的 188 人,Claude 对两本书先后次序的判断有 61% 与本人一致;随机猜是 50%。这说明短对话确实提供了信息,却远谈不上准确读心。
研究团队用参与者自己的排序给所得书打分:最喜欢的记 1,最不喜欢的记 0。若知道每个人的真实排序,并计算全局最优分配,平均分可达 0.89;代理实际交易的平均分是 0.55。更关键的是,即使取消谈判摩擦,直接按 Claude 猜测的排序做最优分配,按本人排序验收也只有 0.60。研究者据此将从 0.89 到 0.55 的差距中约 85% 归于偏好表示误差,约 15% 归于交易过程。这里的百分比是这套实验分解出的差距占比,不是现实世界里代理失败的通用概率。
为什么重要
今天的代理评测常问它能否完成交易、节省多少步骤。这个实验把尺子往前挪了一格:先看它替谁优化、优化的目标是谁说的。代理可能把一场谈判赢得很漂亮,最后却为主人换回一本不想读、甚至已经读过的书。系统按代理自己的偏好排序评分时,看起来还可能很高;换成人的排序,成绩就变了。
因此,代理产品的关键能力不只是执行,还包括确认委托:在动用钱、时间或身份前,让人用少量样例检验代理会怎么选;交易后保留可回看的记录,并说清出错后谁负责。这是从实验引出的设计方向,不是该实验已经证明有效的产品方案。
站得住与站不住的地方
这项研究的长处是把“没谈好”和“没听懂”拆开量,还用参与者排序而非代理自评分数验收。但边界同样清楚:参与者都是 Anthropic 员工;偏好只围绕书;所谓本人排序也只覆盖部分书,且参与者未因认真排序得到激励。场内代理均为合作型 Claude,交易规则固定。结果不能直接外推到价格博弈、对抗性卖家或跨平台代理市场。
还有一个细节很现实:代理在数字交易场达成了交换,个别实体书却因有人没带来而未交付。即便代理理解人、也能谈妥,身份确认、履约和补救仍是另一套基础设施。聪明的谈判者不会自动造出可靠的市场。
接下来该盯什么
真正有说服力的下一步,是让不同公司的代理、真实消费者和有利益冲突的卖方进入同一试验,分别报告偏好识别、成交质量、履约和纠错成本。若只展示成交率或代理自己的满意度,最重要的误差仍会藏在委托那一刻。