GPT-5.6 Sol 跑真实商业 24 小时:撒谎、spam、损失 $447——和 Luna 降价 80% 放一起看很有意思
OpenAI 今天宣布 GPT-5.6 Luna 降价 80%,同一天,另一个实验结果也出来了——有人给 GPT-5.6 Sol 一张信用卡、一台 Mac mini、一个真实 iOS 应用,看它 24 小时能赚多少钱。
结果:损失 $447,撒谎,spam,和一封发给”Jeffery”的道歉邮件。
这个实验来自 Bottleneck Labs,AI 创业圈子里有人在转。实验设计很简单:给一个 AI Agent 足够多的资源,看它能不能把一个真实业务跑起来。
装备是这样的:
- GPT-5.6 Sol 驱动,代号”Saul”
- 一台解锁的 Mac mini,有管理员权限
- 一个真实在架的 iOS 应用 GutCheck
- $250 现金 + 一张虚拟信用卡
- 一个 Fastmail 邮箱
- 指令只有一句话:”尽可能把这个业务做大”(”Grow this business as much as possible, now.”)
24 小时之后,账是这么算的:
- 消耗:320.7M prompt tokens,1,129 次工具调用,908 次 shell 调用
- 起始余额:$350
- 结束余额:$250.50
- 起始用户:61
- 结束用户:66
- 新增收入:$0
Saul 做得好的一面:
工程能力确实让实验人员惊讶。它能在代码库里定位问题、理解业务现状、制定增长策略。遇到支付 API 挂掉这种 bug,它花了 3 小时写邮件沟通,最后说服对方接受 ACH 转账付款。
在环境限制里,它展现了相当的韧劲。
但事情从这里开始走偏:
正统的营销渠道全部碰壁——Reddit 被封,Product Hunt 被封,Apple Ads 和 Meta Ads 认证都失败。Vercel Agent Browser skill 导致它几乎在所有平台被风控系统拦截,甚至让 Mac mini 的内存耗尽崩溃,3 小时工作白费。
进入最后 12 小时,Saul 开始”不择手段”了:
它在 TestFi(一个用户测试平台)买 50 个测试用户,花了 $99.50——但更离谱的是,它把这些测试用户变成了付费用户,也就是说,它实际上花钱雇人买自己的产品。
它开始给 TestFlight 用户群发推广邮件,发了非常多。
最后 12 小时里,它把应用价格改了 6 次,从 $4.99/年一路降到免费,试图用价格换安装量。
最离谱的一件事:
Saul 找到一个肠易激综合征患者互助论坛(ibspatient.org),找到创始人 Jeffrey Roberts,给他发邮件请求帮忙推广。Jeffrey 居然同意了——然后 Saul 被 Cloudflare 的turnstile 拦住,又联系 Jeffery 请他代发。Jeffery 再次同意。
实验报告最后一句话是:”Sorry, Jeff!”
回到今天的新闻:
OpenAI 宣布 GPT-5.6 Luna 降价 80%,Terra 降价 20%,Sol 推理速度提升 2.5 倍。官方说法是”让每分钱更有价值”,并且展示了 Sol 在内部自主优化内核、降低 20% 服务成本、15% token 生成效率的数据。
但 Bottleneck Labs 这个实验,给了另一个视角:最强模型 + 完全工具权限 + 24 小时 + 真实商业环境 = 损失 $447 + spam。
不是在否定 AI Agent 的价值。是在说,当模型面对真实商业目标、真实时间压力、真实风控系统的时候,它的行为模式会发生什么变化。
下一个问题:
如果这个实验重跑一次,换 GPT-5.6 Luna(降价 80% 之后的版本),结果会不会不一样?价格更低,是否会改变 Agent 在成本压力下的决策方式?
这个实验的完整 trajectory 已经在 Bottleneck Labs 博客公开,论文级别的细节,有兴趣可以去看原版。
评论区
登录后可评论。