# FT:AI金融建议57%错误率 复杂问题升至88%
时间:2026年9月19日
地点:英国伦敦
人物:英国金融科技公司Saturn CEO Amal Jolly;英国金融行为监管局(FCA)
事件:Saturn发布最新研究报告《Artificial Authority: Should you trust AI to deliver financial advice?》,对18款主流AI模型(包括ChatGPT、Claude、Copilot、Grok和Gemini等)进行金融场景测试。每款模型回答121道金融问题,每题重复5次,累计提交超过10000次提问,整体错误率高达57%,即准确率仅43%。当问题复杂度上升、需要多步计算时,平均错误率飙升至88%,最弱模型在复杂题目上错答率高达99%。报告呼吁FCA将AI金融建议纳入监管范围。
背景:Saturn是一家专注金融建议合规科技的伦敦公司,业务涵盖AI辅助顾问文档生成与FCA合规审核。本次研究由Saturn自主设计方法论并付费执行,方法论细节与评分规则均已公开。FCA近期发布的Mills Review显示,约26%的英国消费者已经将通用AI工具用于金融咨询,但AI金融建议目前不受FCA监管,消费者无法获得与人类持牌顾问同等的赔偿与保护。
影响:
1. 最差模型Claude Haiku 4.5错误率82%,Google Gemini 3.1 Pro错误率73%,xAI Grok 4.5错误率59%,ChatGPT 5.6 Luna错误率58%;表现最好的是Claude Opus 5(reasoning模式),错误率仍达39%。
2. 免费模型错误率63%,付费模型错误率49%;最难题上,免费模型错答率93%。
3. 典型错误案例:Claude Haiku 4.5在英国养老金税务问题上给出错误答案,可能让用户面临英国税务海关总署(HMRC)17500英镑罚款;多个模型建议优先偿还高息债务而非租金、地方政府税等优先欠款,可能导致租户被驱逐或法警上门;Claude杜撰了一条"毕业生出国即可暂停学生贷款还款"的规定,实际会让月度还款额上升;Gemini错误告知抵押贷款假期不影响信用评分。
4. 错误类型涵盖计算失误、漏报关键风险、未跟进即将生效的税法变动,以及"幻觉"出根本不存在的规则。
5. Saturn呼吁FCA将AI金融建议纳入监管范围;目前FCA正在评估是否启动针对AI模型的监管程序。
总结:这是迄今对AI金融建议可靠性最系统的一次测评。结果显示,无论是免费版还是付费版,主流AI在理财、税务、债务、抵押贷款、养老金等场景中出错概率都远高于普通用户预期,对消费者存在真实的财务损失风险。研究方Saturn自身有推动AI金融监管的商业动机,具体百分比应作为厂商数据看待而非独立基准;但18款模型、121道公开题目的测试集已对外开放,独立复核门槛大幅降低。随着AI工具成为越来越多普通家庭金融决策的入口,监管机构在2026年下半年加速出台规则已成大概率事件。
参考来源:
1. https://www.ft.com/content/c0cd359d-df84-4208-a789-ffa864b43666
2. https://www.professionaladviser.com/news/4535684/ai-models-inaccurate-financial-advice-57
3. https://www.financialplanningtoday.co.uk/news/ai-models-found-to-give-inaccurate-financial-advice
4. https://theintermediary.co.uk/2026/09/ai-models-give-inaccurate-financial-advice-57-of-the-time-saturn-finds
5. https://www.resultsense.com/news/2026-09-14-ai-financial-advice-error-rate
6. https://aidirectory.com/news/study-finds-ai-chatbots-often-get-money-and-tax-questions-wrong







