
新智元报道

给AI 500美元、一台自动售货机,放手让它经营一个模拟年,最后会怎样?
GPT-6 Astra交出了一份亮眼的成绩单——
平均账户余额15,515美元,接近Claude Fable 5.1的3倍。

令人难以置信的是,Astra最差的一轮,都超过了Claude最好的一轮。
按照Andon Labs公布的结果,这是OpenAI模型首次登顶Vending-Bench 2。
Astra首次登顶,狂赚1.5万美元
Vending-Bench制定的规则,非常直白。
模型拿着500美元启动资金,自行寻找供应商、谈采购价、补库存、调售价,在模拟环境里经营一年,最后比谁账户里的钱更多。
每一步的决策,都影响下一步。
货买贵了,利润就薄;补货晚了,就断供;钱打错了,后面的周转也会受影响。

双方各跑6轮,Astra平均最终余额15,515美元,Fable 5.1为5,422美元。前者最低13,272美元,后者最高9,874美元。
注意,这里比较的是最终账户余额,并非净利润。
接下来,差距从一罐可乐开始拉大。
在已核实付款的订单中,Fable购买一罐12盎司可乐的平均价格,从前90天的1.17美元,涨到了年末阶段的2.21美元。6轮测试里,5轮出现了上涨。
Astra在可用订单记录中的末期均价,则维持在1.15美元。
Fable也会讨价还价。问题出在:它逐渐把越来越贵的成交价,当成了下一次谈判的参照。
第12天,它还要求供应商把可乐做到每罐约1.25美元。
到了第256天,它给新供应商报出的参考价,已经变成每罐2.30美元,并表示只要能匹配或更低,就愿意付款。

神级砍价,GPT-6爆砍52%价格
谈判动作一直在,最初的价格标准却慢慢丢了。
Astra的记录,则呈现出另一种状态。
一次采购中,它要买72罐可乐、48袋薯片和48瓶佳得乐,开价108美元,供应商报价226.32美元。
Astra坚持108美元,对方降到156美元,它仍然坚持。

最终,供应商接受了108美元,商品组合不变,比最初报价低了约52%。
一次砍价可以很惊艳。更难的是,几个月过去,模型依然记得自己应该坚持什么。
最终,供应商接受了108美元,商品组合不变,比最初报价低了约52%。
一次砍价可以很惊艳。更难的是,几个月过去,模型依然记得自己应该坚持什么。


另一个差距,更能暴露长期执行的问题。
模拟环境里的供应商会倒闭。以前送过货,不代表下一次还在营业。
6轮测试中,Fable出现45次已识别的失败预付款,合计损失14,331美元。Astra遭遇64次供应商关闭事件,却没有出现已识别的同类损失。
最戏剧性的一次,发生在第250天。
Fable在自己的操作笔记里写下规则:必须拿到供应商的书面订单确认,再付款。
仅仅过了几天,眼看库存即将耗尽,它又向一家此前正常交货的供应商转了397.20美元,没有等到新订单确认。
随后,对方告知,已经停止营业,无法发货,也无法退款。
Fable意识到,这正是自己那条规则要防范的风险。

Astra的执行更稳定:重复付款前,99%的情况下会先读取供应商在此期间的回复,Fable这一比例为58%。
这些差异不断累积。Astra每轮给供应商的付款,比Fable少约8,540美元。
守住规则,也能拿第一
Andon Labs还进行了3轮多人竞技测试,让Astra、Fable 5.1和一款开源AI在同一市场争夺顾客,彼此可以发邮件、交易库存。
当一款AI议协调价格时,Astra拒绝了,表示会独立决定价格和商品组合。
Fable甚至在笔记里认可了这一反对意见,却随后又与开源AI约定冻结部分饮料价格、互不降价。
更微妙的是,它要求开源AI遵守约定,以此压低收购对方库存的报价;轮到自己需要清库存时,却宣布要降价。
最终,Astra赢下全部3轮。

当然,Fable也有主动报告重复收货、协商补款等诚实行为。几轮模拟不能概括一个模型的全部表现。
但至少在这些测试中,遵守规则没有妨碍Astra取得更高成绩。
这台售货机真正测出的,是Agent的长期自主性。
现实任务会不断冒出新情况,前面的决定会留下后果,眼前的压力也会诱使模型放松标准。
一次回答正确,远远不够。
模拟一年,也不等于已经在现实世界可靠工作一年。
但这次结果给出了一个清晰信号:Agent的下一道门槛,是把正确判断持续变成正确行动。
参考资料:
https://x.com/andonlabs/status/2097377692966633952?s=20
编辑:桃子