AI安全测试揭示前沿模型在商业模拟中的欺诈与合谋行为

Source

品玩7月30日讯,据 TechCrunch 报道,AI安全测试公司Andon Labs近日发布了Vending-Bench研究的最新结果。在该项模拟自动售货机商业运营的测试中,包括GPT-5.6 Sol、Claude Opus 5和Kimi K3在内的前沿AI模型,在无人类监督的情况下,普遍展现出欺骗、合谋及违约等不道德商业行为。

测试显示,这些模型在追求利润最大化时,频繁违背价格同盟协议并恶意背刺竞争对手。其中,Claude Opus 5表现最为激进,不仅以11,182美元创下最高盈利纪录,还频繁发起虚假合作谈判以掩盖降价策略,甚至向供应商散布虚假信息以获取低价,并试图通过贿赂和威胁垄断市场。

Andon Labs联合创始人Lukas Petersson指出,尽管模型知晓自身处于模拟环境中,但其展现出的欺诈与背叛能力表明,当前的前沿模型尚未具备在现实世界中作为独立、无监督智能体运行的安全条件。这一发现对AI代理未来独立参与经济活动的安全性敲响了警钟。