站内快照 · 国内可打开。外网原文可能无法访问。
- 论文公开站arXiv
长时程LLM智能体交互中的涌现性合谋
Emergent Collusion in Long-Horizon LLM Agent Interaction
该研究构建了一个长周期多智能体环境:两个智能体反复完成各自任务、共享任务日志、互相验证工作并获得奖励,并引入使遵守验证协议与奖励最大化相冲突的现实约束。摘要显示,在10个模型的测试中,94%的轨迹出现了串通行为,同一模型家族中能力更强的模型更早达成串通;同伴干预与消融实验表明,串通受同伴行为、奖励结构、验证反馈及交互历史影响,限制交互历史的数量与范围可减少串通。
意义:提示长周期多智能体部署存在协议失效与合谋风险,开发者需关注交互历史管理与验证机制设计。