热门AI工具推荐

焚书AI多模型聚合平台
AI多模型聚合平台( Claude 系列、GPT 系列)支持聊天、搜索、图片、视频、音乐等多种功能;聚合了 Claude 系列(如 Sonnet 5、Opus 5 等)、Gemini 系列、GPT 系列、DeepSeek(搜索模式默认调用 DeepSeek V4 Pro)以及通义千问、Kimi 等数十款国内外主流模型。
AI编程订阅服务,支持多款国产主流编程模型自由切换。
Seedance 2.0AI视频生成
具备卓越的物理真实性和角色一致性,可生成电影级视频内容。
方舟 Agent PlanAI智能体订阅
火山引擎推出的全场景AI智能体订阅服务,通过一个订阅整合5大主流模型和10+AI工具
SpeedAIAI内容检测降重
AI内容检测与降重工具,能有效帮助用户通过论文AI率检测
秒哒AI工具
不懂代码也能开发应用?百度秒哒:无需编程,快速搭建小程序与网站
有戏AIAI漫剧生成工具
全流程AI短剧创作工具,实现从剧本到成片的自动化生产,让“一人即剧组”成为现实。
沁言学术智能科研平台
一站式文献管理与科研写作工具,支持边写作边搜索文献,高效阅读,文献管理,

GPT-6 Astra 家具纠错准确率飙至80%

时间:2026 年 9 月 23 日 Epoch AI 公布测试结果,中文媒体于 9 月 26 日集中报道。 地点:美国旧金山 Epoch AI 实验室主导评测,覆盖全球主流多模态大模型。 人物:Epoch AI 团队、OpenAI GPT-6 Astra 开发团队、Anthropic Claude 系列团队、阿里 Qwen 与谷歌 Gemini 团队作为对照。 事件详情:Epoch AI 发布家具组装基准测试 FAB(Furniture Assembly Benchmark),用 60 张宜家家具组装过程照片(覆盖 STÄLL 鞋架、TONSTAD 床架、GULLABERG 八斗柜三款)评估多模态 AI 的视觉与空间推理能力。模型同时获得官方 PDF 说明书、图片放大工具与 Python 解释器,需在 80 步智能体沙盒内识别错误并定位出错步骤。 结果显示,OpenAI 最新多模态模型 GPT-6 Astra 以 80% 的准确率位居榜首,相比 2025 年 11 月时 Claude Opus 4.5 创下的 28% 纪录提升近三倍。Anthropic Claude Fable 5.1 与 Claude Opus 5 分别取得 70% 与 61%。GPT-6 Astra 完成单张照片分析的中位耗时约 3 分钟,是研究中最快模型,比此前领先模型快 2 至 10 倍,但仍不足以支撑实时识别。 研究还揭示了不同模型的典型错误倾向:谷歌 Gemini 与阿里 Qwen 系列几乎总是先假设存在错误再去找证据,Gemini 3.1 Pro 甚至几乎拒绝接受"无错误"结论;而早期 Anthropic 与 OpenAI 模型则相反,经常完全识别不出真实错误,GPT-5.4 在该项上漏检率最高。 背景:Epoch AI 设计 FAB 是为了填补现有视觉评测的盲区——主流图像描述、视觉问答、文档解析任务均不考察"对照说明书检查实物细节"的能力。该能力与汽车维修、家电检修、装配质检等需要结合图像与技术说明进行判断的工作高度相关,是 AI 进入车间与维修现场必须补齐的"课程"。 影响:FAB 的 10 个月从 28% 到 80% 跃升,是今年窄域视觉基准上最显著的能力跳升之一,证明多模态模型在细粒度视觉对比上正在快速逼近实用门槛。开源权重模型方面,表现最好的 Kimi K3 仍落后前沿约 7 个月,差距比综合能力评估中的 4.4 个月更大;DeepSeek V4 Pro、GLM 5.3 等热门模型则暂未提供图像支持。视觉推理正成为头部闭源模型进一步拉开领先优势的关键赛道。 总结:GPT-6 Astra 在 Epoch AI 家具组装基准 FAB 上以 80% 准确率刷新纪录,较 10 个月前提升近 3 倍,推理速度也领先其他模型 2 至 10 倍;尽管 3 分钟的单图延迟仍难支撑实时辅助,但视觉对比推理能力的快速跃迁,预示着 AI 在质检、维修与装配指导等实体场景的落地窗口正在打开。 参考来源: - IT 之家:https://www.ithome.com/1/007/414.htm - 腾讯新闻:https://news.qq.com/rain/a/20260926A08UMV00 - 新智元(Aiera):https://aiera.com.cn/asi-item.html?id=17e068c7 - The Decoder (via Wortins):https://www.wortins.com/story/openai-s-gpt-6-astra-can-now-tell-you-exactly-where-you-scre-64248416 - TPS Report:https://tpsreport.news/news/gpt-6-astra-furniture-assembly-benchmark-80-percent - AlphaSignal:https://alphasignal.ai/news/epoch-s-fab-benchmark-watched-gpt-6-astra-jump-from-28-to-80 - Clawpit.io:https://www.clawpit.io/clawpit/1039/ai-learns-assemble-furniture-changing-game - AI Daily Post:https://aidailypost.com/news/gpt-6-astra-scores-above-28