AI Agent 在终端跑了 85 分钟,最强的模型通过率只有 15.2%——这件事今天被一份论文彻底扒开了
AI Agent 在终端跑了 85 分钟,最强的模型通过率只有 15.2%——这件事今天被一…
AI Agent 在终端跑了 85 分钟,最强的模型通过率只有 15.2%——这件事今天被一…
LLM 做规划这件事,最近被一个叫 SokoBench 的评测扒了个底朝天——结论不太好看:…
配了三个月 MCP 工具,今天看到两组数据打架:一组说 78% 企业已在生产环境跑 MCP,…
78%,这是企业里说 MCP 已经进生产环境的比例。 但如果你问:这些生产环境里,有多少在处…

AI Agent 战场上半年最大的笑话:一个协议已经有 250 个成员支持,但真正把它用进生…
配了三个月 AI Agent,今天才发现它们已经开始「繁殖」了——不是比喻,是字面意义上的自…

三个基准测试把 AI 编程工具的真实能力彻底拆开了——SWE-bench 90%+ 的人,A…
做 AI 文档处理的人,这两年问的最多的问题是:模型跑分挺高,上线用起来怎么就不对? 这个问…
test
test

test content
做 AI 文档处理的人,这两年问的最多的问题是:模型跑分挺高,上线用起来怎么就不对? 这个问…
LLM 推理每秒只能吐几个 token,你以为是算力不够?错了——根子在内存带宽。今天我把 …
你让 AI 帮你找页面 bug,它只能靠你描述——截图、日志、复现步骤全要你来喂。Chrom…
你有没有遇到过这种情况:给团队部署了一套多 Agent 系统,结果发现每个 Agent 都是…

配了三个月 AI Agent,今天才发现它们根本不会「说话」——A2A 协议把这件事彻底变了…

K线是所有交易者的共同语言,但AI一直读不懂它。原因很简单:K线不是文字,传统的NLP模型没…
Claude Code 和 ChatGPT 不是一个 Agent——但它们现在可以「对话」了…

说实话,MCP 协议之前那个「有状态会话」的设计,在本地跑跑 Demo 没问题,一旦要上生产…
传统 LLM 用自回归生成:一个 token 一个 token 往外吐,每步都要等前一步完成…

传统 LLM 用自回归生成:一个 token 一个 token 往外吐,每步都要等前一步完成…

今天看到两篇论文放在一起读,特别有意思:一个是测AI视觉推理极限的,一个是测AI数据科学自动…
有人教 AI 下棋、有人教 AI 写代码,但有一件事 AI 一直没学会——拼图。这不是比喻,…

我让两个 AI 编程工具协作做一个任务,token 账单是单独跑的 4 倍——这个问题今天终…
26亿参数能在智能手机上跑AI Agent?今天终于把这件事说清楚了——LFM2.5-2.6…

你还在等大模型一个字一个字往外蹦?Google DeepMind 上个月悄悄发了一个开源模型…
你可能听过一种说法:AI编程工具越来越强,是因为它们有了更复杂的多工具系统、更精细的tool…
以前给一个滚动容器里的子元素加动画,我要么把它写成滚动容器的子元素,要么在 JS 里算好滚动…
LLM被一条提示就带偏?加州大学新研究说我们测的方向全错了 给LLM一段上下文,它就容易被牵…