🤖 NVIDIA AVO在ARC-AGI-3推理测试中拿下满分,AI Agent自主能力再突破
在AI领域最硬核的推理测试中,NVIDIA的通用编码Agent——AVO,刚刚创造了历史。它在ARC-AGI-3交互式推理基准测试中达到了100%的完美得分。
这不是普通的测试。ARC-AGI-3专门测试AI在没有明确指令、规则或目标的情况下,如何自主理解任务并完成挑战。总共183个关卡,横跨25个公开环境,AVO全部通关。
为什么这个成绩如此重要?
传统AI测试往往有明确的输入输出,就像做选择题。但ARC-AGI-3更像是开放世界探索:你需要自己发现规则,理解环境,然后找到完成任务的方法。这更接近真实世界中AI Agent需要面对的挑战。
AVO的突破在于它的通用性。它不是为特定任务训练的专用模型,而是能在多种环境下自主适应的通用Agent。这意味着它可以处理各种编码任务,从调试复杂bug到构建全新系统。
技术实现亮点
这个成绩的意义远超测试本身。它证明了AI Agent正在从"辅助工具"向"自主执行者"进化。
想象一下:你给AI一个模糊的目标,它能自己探索环境、理解需求、制定计划、执行任务、验证结果。这才是真正的AI Agent应该有的样子。
对于开发者来说,AVO的架构和方法论值得深入研究。它展示了如何构建真正通用的AI Agent,而不仅仅是针对特定场景优化的模型。
行业影响
这个突破可能会加速AI Agent在实际工作中的应用。当AI能自主处理复杂的、未预见的场景时,它的实用性将大幅提升。
对于企业来说,这意味着AI不再是简单的自动化工具,而是能真正参与复杂决策和执行的智能助手。
个人思考:
从ARC-AGI-3的满分来看,AI Agent的自主能力已经达到了新的高度。下一步的关键是如何将这种能力应用到实际业务场景中,解决真实世界的问题。
本地能跑 MiniMax H3 之后,都以为 AI 短剧的门槛天塌了 真正去做才发现,要把小说改成剧本然后分镜制作就必须得先固定人物角色。 我开源了一个 skill 专门来做这件事,Claude Code / Codex 都能跑:
🔗 相关链接
t.co/AwV9LsQBSH
GitHub: github.com/eternityspring…
💻 Perplexity把整个AI Agent搬到你本地了:Portable Computer,零云端依赖
Perplexity刚发布了一个重磅项目:Portable Computer。
这不是一个简单的本地推理工具,而是把整个AI Agent运行时都搬到了你的本地硬件上——编排LLM、子代理LLM、Agent框架,全部本地运行,完全不需要云端。
为什么这很重要?
现在大多数AI Agent都是云端运行的。你用ChatGPT、Claude、Perplexity的网页版,所有数据都要发送到他们的服务器。
对于普通对话,这没什么问题。但对于以下场景:
云端Agent就不太合适了。你需要一个完全离线、完全可控的本地版本。
Portable Computer的核心特性:
1️⃣ 一键本地推理设置
不需要手动配置模型路径、依赖库、环境变量。一键启动,开箱即用。
2️⃣ 优化的Agent体验
不只是能运行模型,还针对本地硬件优化了Agent的工作流。子代理之间的协作、上下文管理、工具调用,都经过本地化优化。
3️⃣ 完全无云端依赖
运行时不需要联网,不需要API key,不需要登录任何账号。你的数据永远在你的机器上。
4️⃣ 支持多种模型
可以运行开源模型,也可以使用你自己的闭源模型。灵活选择。
适合谁用?
个人思考:
Perplexity做这件事很有意思。他们本身是一个云端AI搜索公司,但选择开源一个完全本地的Agent工具。
这说明两件事:
这个项目的最大价值在于:它让本地AI Agent变得真正可用。以前虽然有Ollama、LM Studio这样的工具,但它们只能运行模型,不能提供完整的Agent体验。
现在,你可以有一个完全本地的Perplexity,处理你的敏感数据,而不用担心任何隐私问题。
对于需要离线工作或处理敏感信息的用户,这个项目值得试试。
🎬 Google发布Gemini Omni 1.1 Flash:视频生成进入"连续叙事"时代
很多人觉得AI视频生成已经够好了,能生成几秒钟的高质量视频。
但Google刚发布的Gemini Omni 1.1 Flash,把视频生成推向了一个新阶段:从"生成片段"到"连续叙事"。
核心升级:
1️⃣ 场景扩展能力大幅提升
以前只能基于1秒上下文扩展视频,现在可以基于10秒上下文扩展。这意味着更连贯的故事线、更自然的镜头过渡。
2️⃣ 4K超分辨率
直接从低分辨率生成4K视频,不需要后期处理
3️⃣ 首尾帧控制
可以指定视频的第一帧和最后一帧,让生成的视频精确连接到你想要的画面上
4️⃣ 快速草稿模式
360p的快速生成,用于测试想法,然后再用高分辨率版本
这意味着什么?
以前做AI视频:
现在:
这不只是时长的增加,而是叙事能力的质变。你可以真正讲述一个有开头、发展、结尾的故事了。
实际应用场景:
个人思考:
这个升级的意义在于:AI视频终于开始理解"时间"了。
以前的AI视频生成是"空间思维"——生成一帧漂亮的画面。现在开始有了"时间思维"——理解画面之间的因果关系、情感递进。
这对创作者来说是巨大的效率提升。以前要花几天时间拍摄、剪辑的素材,现在可能只需要几个提示词。
当然,目前还做不到完美。但趋势很明确:AI视频正在从"玩具"变成"工具"。
📱 Google工程师揭秘:如何在手机上21分钟微调一个LLM,准确率从46%飙到90%
很多人觉得在手机上跑AI已经是极限了,微调?那是数据中心的事。
但Google工程师展示了完全不同的可能性:用Gemma 270M这个超小模型,在手机上21分钟完成微调,准确率从46%提升到90%,每秒能跑2000个token。
核心流程:
1️⃣ 选对模型
不是用GPT-4那种大模型,而是Gemma 270M——只有2.7亿参数,专门为移动端设计
2️⃣ 生成合成数据
用大模型生成针对特定任务的训练数据,不需要人工标注
3️⃣ LoRA微调
只调整少量参数,显存占用极低,手机上也能跑
4️⃣ int4量化
把模型压缩到4bit,进一步减少内存占用
5️⃣ 部署到Pixel
直接在手机上运行,完全离线,不联网
为什么这个思路重要?
实际应用场景:
个人思考:
这个实验的意义在于证明了"小模型+微调"的路线是可行的。
很多人追求大模型,觉得参数越多越好。但如果你的任务足够具体,一个2.7亿参数的小模型经过微调,可能比700亿参数的通用模型效果更好。
而且完全离线运行意味着:不需要网络、不需要API费用、不需要担心数据隐私。
这才是真正的"AI for Everyone"——不是让所有人都用上ChatGPT,而是让每个人都能训练自己的AI。