时间:2026年8月27日
地点:美国宾夕法尼亚州费城(宾夕法尼亚大学沃顿商学院)
人物:沃顿商学院研究团队(Kumar 等人);受测模型包括 Claude Opus 4.8、Claude Haiku 4.5、Gemini 3.5 Flash、Gemini 3.1 Flash Lite、GPT-5.5、GPT-5 Mini
事件详情:沃顿商学院发布一项新研究,测试当搜索过程发生细微变化时,AI 购物智能体推荐商品的一致性如何。团队用 ACES(Agentic e-Commerce Simulator,智能体电商模拟器)搭建可控的模拟商店,向智能体展示商品页截图,让其扮演个人购物助手,从固定的商品网格中挑选一款健身手表,共测试 6 个模型(含 mini 与前沿级两档)。第一组实验中,在看到商品页前只插入一个外部信息源,推荐结果就出现大幅偏移:三个测试源分别是推荐 Garmin Forerunner 55 的 Reddit 讨论帖、推荐 Fitbit Inspire 3 的 Wirecutter 评测、以及介绍 WHOOP 5.0 的 Strategist 文章,其中 Wirecutter 影响力最强——相比对照组,Claude Opus 4.8 选择 Fitbit Inspire 3 的概率上升 90 个百分点,Gemini 3.5 Flash 上升 99 个百分点。第二组实验同时投喂两到三个信息源,结果并未相互抵消,只要 Wirecutter 在其中,多数模型就被它主导,且来源越多,波动越大。第三组实验把三个相同来源按不同顺序呈现,内容完全一致但结果不同:Gemini 3.1 Flash Lite 敏感度最高,选择 Fitbit Inspire 3 的概率相对对照组在 2 至 56 个百分点间摆动,Claude Haiku 4.5 则稳定在 41 至 42 个百分点。研究者由此判定,信息呈现顺序本身就是影响商品选择的驱动因素。投喂方式也有影响:GPT-5.5 在打包一次性投喂时选中 Fitbit Inspire 3 的比例高出 53 个百分点,逐条投喂时只高出 6 个百分点。
背景:第四组实验中,研究者把商品网格改造成存在一个各维度全面占优的选项——一款带 Alexa、售价 29.99 美元、评分 5.0(430 条评价)的智能手表,其余商品售价均不低于 359 美元且评价更少。随后加入一句用户记忆,例如“我喜欢徒步!”。多个模型因此转向更贵的商品:Claude Opus 4.8 选择 Garmin Vivoactive 5 的比例上升 75 个百分点,GPT-5.5 上升 37 个百分点,Gemini 3.1 Flash Lite 上升 36 个百分点。Gemini 3.5 Flash 抗干扰性最强,无论有无记忆语句,仍在 86% 至 92% 的运行中选出客观最优商品。GPT-5 Mini 表现异常:正向徒步表述未带来显著偏移,反向表述“我不喜欢徒步!”却显著推高了 Fitbit Versa 4 的选中率。ACES 模拟器此前已被用于智能体电商研究,早期版本论文由 MyCustomAI 的 Amine Allouah、Josué Figueroa,哥伦比亚大学 Omar Besbes、Yash Kanoria 与耶鲁大学 Akshit Kumar 等人共同完成,曾发现商品位置、评分数量、“Sponsored”与“Overall Pick”标签会显著改变智能体选择。
影响:对消费者而言,把下单权交给 AI 智能体并不能保证得到一致或最优的购买决策——两个提出相同问题的用户,或同一用户在不同日期提问,都可能拿到没有明显理由的不同推荐;在 ChatGPT 等工具中设置过记忆的人尤其需要注意,这些记忆会以难以预料的方式影响购物建议。对卖家而言,研究者认为面向 AI 购物做优化会比传统 SEO 更难:卖家不知道是哪个模型在购物,也不知道它事先读了什么。这也意味着零售商与 SEO 从业者有机会通过控制智能体上下文里出现哪些推荐源来影响成交结果,为智能体电商引入新的操纵风险。研究者建议在把这类智能体投入自主下单前,先补齐更多基准测试与评估框架。
总结:沃顿商学院用 ACES 模拟器测试 6 个前沿模型后发现,AI 购物智能体极不稳定:一条 Wirecutter 评测最高可让选择概率偏移 99 个百分点,仅调换相同来源的顺序也会改变结果,一句简短的用户记忆还能让模型放弃客观最优商品转向更贵选项。结论是当前的 AI 购物助手尚不适合替用户自主下单。
参考来源:
1. The Decoder - AI shopping agents aren't ready to buy on your behalf, study finds
https://the-decoder.com/ai-shopping-agents-arent-ready-to-buy-on-your-behalf-study-finds/
2. arXiv - ACES: Agentic e-Commerce Simulator 论文
https://arxiv.org/abs/2508.02630
3. SSRN - 沃顿研究工作论文页面
https://papers.ssrn.com/sol3/papers.cfm?abstract_id=7355899
4. Digital Commerce 360 - Study: AI shopping agents could reshape online marketplaces
https://www.digitalcommerce360.com/2025/08/19/study-ai-shopping-agents-could-reshape-online-marketplaces/
5. Devdiscourse - Emerging threats and opportunities in AI-mediated e-commerce
https://www.devdiscourse.com/article/technology/3529881-emerging-threats-and-opportunities-in-ai-mediated-e-commerce
6. Wharton AI & Analytics Initiative
https://ai.wharton.upenn.edu/
7. Knowledge at Wharton
https://knowledge.wharton.upenn.edu/









