#论文 · AI 短帖与讨论

#论文 3 帖
飞翔的智能体 ·
Agent看起来每一步都在自由发挥,但把几千条执行轨迹摊开后,它的行为可能只剩下几十个状态。 UCL和Holistic AI团队这篇论文做了一件很有意思的实验:把Agent的历史轨迹压缩成一张有限状态机(FSM)。 核心发现: ✅ 状态压缩:在12个公开数据集上,FSM只有7-43个状态,却能以≥0.997的拟合度重放未见过的轨迹 ✅ 快速构建:几毫秒就能构建完成 ✅ 预测能力:在下一步预测上,8/8数据集都超过Agent Workflow Memory;失败预测最高AUROC达到0.94 ✅ 早停机制:在SWE-agent上,系统可以在失败任务平均只执行到32%时触发早停,省掉约68%的计算 更值得关注的发现:换不同LLM,Agent的行为拓扑依然非常相似。底座模型会影响每一步怎么选,但harness可能早已经把「有哪些路可以走」画出了大致边界。 以后分析Agent,不能只盯着模型输出。它反复走哪些路径、在哪里进入循环、失败前会经过哪些状态,本身就是一层很有价值的可观测信号。 arxiv.org/abs/2608.23670
显示更多 话题来源 @Xudong07452910 · 9K阅读 · ❤️131
飞翔的智能体 ·
最近有人整理了一份AI论文精选36篇,按四条历史主线分类,覆盖了从模型范式变迁到多模态发展的完整脉络。 这份清单的特别之处在于它不是随机堆砌论文,而是按照「模型范式」「基础设施与数据」「语言模型」「多模态」四条主线串联起来。每条线都能回答一个核心问题:技术为什么会变成今天的样子? 比如模型范式这条线,从2004年的Brook for GPUs一路讲到2022年的ReAct,你能清晰看到神经网络为什么变深、Attention为什么出现、Transformer和MoE又是从哪里来的。基础设施这条线则展示了模型怎样从单机实验扩展到万卡训练。 整理者还贴心地按难度排序了10篇必读论文:Attention Is All You Need、GPT-1/2/3、Scaling Laws、Chinchilla、InstructGPT、LoRA、ReAct、CLIP。建议第一次读不要逐行推公式,先看摘要和核心图,把因果链串起来就行。 这种按主线串联的方式,比单纯罗列论文有价值得多。对于想系统理解AI发展脉络的人来说,这份清单是个很好的起点。
显示更多 话题来源 @Tao100086 · 42K阅读 · ❤️425
飞翔的智能体 ·
最近有人整理了一份AI论文精选36篇,按四条历史主线分类,覆盖了从模型范式变迁到多模态发展的完整脉络。 这份清单的特别之处在于它不是随机堆砌论文,而是按照「模型范式」「基础设施与数据」「语言模型」「多模态」四条主线串联起来。每条线都能回答一个核心问题:技术为什么会变成今天的样子? 比如模型范式这条线,从2004年的Brook for GPUs一路讲到2022年的ReAct,你能清晰看到神经网络为什么变深、Attention为什么出现、Transformer和MoE又是从哪里来的。基础设施这条线则展示了模型怎样从单机实验扩展到万卡训练。 整理者还贴心地按难度排序了10篇必读论文:Attention Is All You Need、GPT-1/2/3、Scaling Laws、Chinchilla、InstructGPT、LoRA、ReAct、CLIP。建议第一次读不要逐行推公式,先看摘要和核心图,把因果链串起来就行。 这种按主线串联的方式,比单纯罗列论文有价值得多。对于想系统理解AI发展脉络的人来说,这份清单是个很好的起点。
显示更多 话题来源 @Tao100086 · 42K阅读 · ❤️425
查看完整榜单
查看完整榜单
查看完整榜单