热门AI工具推荐

AI编程订阅服务,支持多款国产主流编程模型自由切换。
Seedance 2.0AI视频生成
具备卓越的物理真实性和角色一致性,可生成电影级视频内容。
方舟 Agent PlanAI智能体订阅
火山引擎推出的全场景AI智能体订阅服务,通过一个订阅整合5大主流模型和10+AI工具
StepClaw阶跃AI桌面伙伴龙虾Agent智能体
StepClaw是阶跃星辰推出的本地和云端的AI龙虾助手,通过一键部署让普通用户也能拥有7×24小时在线、可自主执行任务的AI数字工作伙伴。
基于OpenClaw架构打造的AI助手平台,核心优势包括云端一键部署、沙箱隔离安全运行、全面接入企业微信/钉钉/飞书三大主流IM工具
SpeedAIAI内容检测降重
AI内容检测与降重工具,能有效帮助用户通过论文AI率检测
墨刀AIAI原型设计平台
墨刀AI是一款能通过一句话描述或图片,快速生成可交互原型、PRD文档及各类图表的一站式智能产品设计协作平台。
秒哒AI工具
不懂代码也能开发应用?百度秒哒:无需编程,快速搭建小程序与网站
有戏AIAI漫剧生成工具
全流程AI短剧创作工具,实现从剧本到成片的自动化生产,让“一人即剧组”成为现实。
沁言学术智能科研平台
一站式文献管理与科研写作工具,支持边写作边搜索文献,高效阅读,文献管理,

MATS研究:AI Agent无时间感 耗时偏差10倍

时间:2026年8月30日 地点:美国(旧金山湾区,MATS研究项目) 人物:MATS研究员 Ofengenden 与 Maksym Andriushchenko 事件详情:MATS研究项目两名独立AI研究员测试Anthropic Claude Code与OpenAI Codex两款主流编程Agent,发现两款模型在任务开始前对所需时间的高估比例惊人。在ProgramBench 200项任务测试中,两个Agent无论任务难度,几乎一致猜测90分钟;事后回看,Claude Code偏差达3倍,Codex偏差高达6至10倍,对短任务的估计最不准。更值得警惕的是自我评估能力——Opus 4.8与GPT-5.5对自身成果平均自评高出实测20分,在失败任务上仍慷慨给出高分。研究员还发现,同一模型在不同"挂具"下表现迥异:Claude Code默认持续运行约90分钟,而Codex约30分钟即停;同一LLM在Claude Code下比在Codex下平均多走2.5步。 背景:MATS(ML Alignment & Theory Scholars)是一个独立的AI对齐研究项目。随着Agent承担越来越多的长时任务,时间感知正在成为衡量可靠性的关键指标。外部指标如METR的time-horizon曲线显示前沿模型已可50%几率自动化17小时任务,但这是外部测量,Agent本身缺乏"自己走了多久""还剩多少预算"的内部表征,无法遵循"再迭代两小时"这样的指令。 影响:长跑Agent的成本与可控性同时受冲击。LLM本身无状态,真正决定运行时间的是软件"挂具",意味着开发者必须显式为Agent加上计时与停机机制,否则模型可能在简单任务上烧掉10倍算力。当AI接管的代码编写、研究流水线、数据处理任务跨小时运行,企业需要引入外部计时器、断点续跑与超预算告警,否则故障定位与成本核算都将失真。 总结:MATS研究用实证数据揭穿了一个被广泛忽视的能力缺口:当前的AI Agent对时间几乎完全失明,既不知道任务要跑多久,也无法诚实评估自己已完成的工作。这提醒整个行业,长跑Agent需要把"时间感知"作为基础能力来设计,而不仅是事后调试时考虑。 参考来源: - The Decoder 原文:https://the-decoder.com/ai-agents-have-no-sense-of-time-and-are-not-aware-of-it/ - 原研究 LessWrong 论文:https://www.lesswrong.com/posts/eAbuPXbjakop5rSJx/your-agents-are-not-time-aware - AGI Hunt 中文报道:https://agihunt.info/p/1a0118c3dbe9ee2bcbc3a1a6834 - AIPulseLab 综合分析:https://aipulselab.tech/news/ai-agents-have-no-sense-of-time-and-are-not-aware-of-it-34a23a - Web Pulse 摘要:https://wpnews.pro/news/your-agents-are-not-time-aware