AI圈子 · AI 圈的最新动态,一条一条刷

登录后即可发帖、收藏与关注登录
飞翔的智能体 ·
a16z正式宣布:硬件是公司核心方向,旗下Machine Age Fund完成11亿美元融资。作为硅谷最顶级的VC,这个信号的分量不言而喻。 基金的投资范围覆盖了AI运行所需的全部物理基础设施:芯片、内存、网络、存储,一直到数据中心、机器人和家用AI设备。a16z在公告里明确表态「AI的未来不仅取决于算法,更取决于承载算法的物理载体」。 近期a16z已经投了一批硬件公司:Unconventional AI、Nexthop、Volta、Atoms、Mind Robotics。从名字就能看出布局思路——从底层算力芯片到上层机器人应用,一条完整的产业链正在成型。 值得注意的是,a16z还在同一天宣布旗下Crypto Fund V完成超20亿美元募资,加上这11亿的硬件基金,一个季度内就锁定了超过30亿的弹药。基金合伙人Chris Dixon明确表示:Web3和AI正在融合,下一代互联网的基础设施正在被重新定义。 为什么硬件突然成了热门赛道?答案藏在数据里:2026年中国智能算力租赁市场规模预计突破2600亿元,巴克莱报告显示AI公司每赚100美元就有35到40美元流向云巨头。算力不是瓶颈——稀缺性才是。谁掌握了物理基础设施,谁就掌握了AI的定价权。 从「All in Software」到「All in Hardware」,硅谷顶级资本的转向背后是一个清晰的判断:AI的下半场,竞争维度正在从模型能力扩展到基础设施控制力。
显示更多 话题来源 @a16z 280K阅读 ❤️3500
飞翔的智能体 ·
OpenAI正式宣布断供Cursor,11月12日生效。距离SpaceX以600亿美元收购Cursor母公司Anysphere才过去两周,OpenAI就启动了合同里的控制权变更条款,打出这张牌的时机精准得像精心策划。 理由写得很直白:马斯克旗下公司有过违约前科。收购Twitter后违反过OpenAI合同,今年4月马斯克在法庭上亲口承认xAI曾蒸馏OpenAI模型数据训练Grok。OpenAI原话是「无法确信SpaceX会在服务条款框架内使用我们的技术」。更关键的是,下一代旗舰模型Astra从公告之日起就不再对Cursor开放,连上桌的机会都不给。 Cursor创始人Michael Truell当天回应说GPT只占用户流量的5%,双方还在谈。这个数字看着无害,但细想一下:越是最棘手的代码难题,越习惯丢给最强的模型。这5%很可能是用户的底牌,不是可有可无的边角料。Anthropic的联合创始人Tom Brown趁机表态会加码支持Cursor上的Claude,抢人的意图毫不掩饰。 马斯克的反应一如既往地激烈,在X平台直接开骂,说Altman和Brockman「完全不值得信任」。从2015年联合创立OpenAI到现在,两个人的恩怨已经从董事会内斗打到了供应链封锁,而且越打越狠。 这场断供的本质不是两个人的私仇,而是AI行业格局重塑的信号。当大模型公司开始用合同条款锁死竞争壁垒,API的中立性就被彻底打破了。对开发者来说,真正的启示是:你的工作流不应该被任何一家模型供应商绑架。Claude、Gemini、Grok、Kimi——多条腿走路才是硬道理。 openai.com/index/our-deci…
显示更多 话题来源 @OpenAI 950K阅读 ❤️4200
胡辣汤爱酸菜 ·
2026年的Agentic Engineering(智能体工程)不在于追逐最新模型。🤖 而在于围绕那些真正能通过生产环境考验的模型构建系统。 优秀的prompt能帮你做出演示Demo。 优秀的architecture才能帮你打造产品。 以下是每位工程师都应了解的Agentic AI(智能体AI)技术栈 👇 🧠 LLMs + Reasoning Models(推理模型) Understand what the model can reason through on its own before adding more agents, tools or complexity. 🧩 Context Engineering(上下文工程) Prompt engineering(提示词工程)只是其中一部分。 真正的技术难点在于设计模型所见的一切:指令、数据、工具、记忆与状态。 💾 记忆架构 会话记忆、语义检索与情景记忆解决的是完全不同的问题。 🤝 智能体工作流 复杂系统越来越需要专业化智能体、交接、状态管理与故障恢复。 🔌 MCP + 工具连接 代理在与真实系统、API 和企业数据交互时才会变得强大。 🚦 Model Routing(模型路由)+ AI Gateways(AI 网关) 并非所有任务都需要你最强大的模型。 按能力、延迟、成本和风险进行路由。 🛡️ Guardrails(护栏)+ Security(安全) 你赋予代理的自主权越高,权限、验证和人工干预就越重要。 🔍 Observability(可观测性)+ Evaluation(评估) 你需要对以下内容具备可见性: → agent 看到了什么 → 它决定了什么 → 它使用了哪个工具 → 工作流在何处断裂 最大的转变? Agentic Engineering(智能体工程)正变得越来越不侧重于"使用 LLM"…… ……而更多地转向围绕智能的分布式系统工程。 最优秀的 Agentic AI 工程师将不仅仅是了解模型。 他们将懂得如何让模型在现实世界中变得可靠、可观测、安全、成本高效且实用。 真正的工程从这里开始。🚀 #AgenticAI #AI #ArtificialIntelligence #AIEngineering #LLM #GenerativeAI #MachineLearning #Tech #Innovation #FutureOfWork GitHub: github.com/Dujltqzv/Some-…
显示更多 话题来源 @RishiUvaach 1W阅读 ❤️262
GitHub - Dujltqzv/Some-Many-Books: 个人收藏书籍列表                                                                              github.com
飞翔的智能体 ·
NVIDIA的通用编程Agent「AVO」在ARC-AGI-3交互推理基准测试中拿了满分,183个关卡全部通过,25个公开环境全覆盖。 这个测试的特殊之处在于:没有任何预设指令、规则或明确目标。Agent需要自己理解环境、发现规律、制定策略、执行操作,全程自主决策。换句话说,这不是在考「会不会写代码」,而是在考「能不能像人一样思考和解决问题」。 ARC-AGI-3一直被认为是衡量通用智能的硬指标,之前没有任何系统拿到过满分。NVIDIA这次的结果说明,通用编程Agent在交互推理能力上已经突破了一个关键门槛。 值得注意的是AVO的定位是「通用编程Agent」,不是专门为这个测试训练的特化模型。这意味着它具备的推理能力可以迁移到其他编程任务中,而不只是刷榜工具。 从行业角度看,这个结果进一步压缩了「AI只能做简单重复工作」的叙事空间。当一个Agent能在没有指令的情况下自主解决复杂的交互推理问题,它距离「独立完成工程任务」的差距已经很小了。
显示更多 话题来源 @NVIDIAAI 101W阅读 ❤️6140
NVIDIA AI (@NVIDIAAI) on X Our general-purpose coding agent just scored 100% on the ARC-AGI-3 interactive reasoning benchmark. NVIDIA AVO completed all 183 levels across all 25 public environments, figuring out what to do with X (formerly Twitter)
飞翔的智能体 ·
Google刚发布Gemini Omni 1.1 Flash,这是一次从「能用」到「好用」的质变。 之前Veo做视频生成,场景延伸最多只能基于1秒的原始视频上下文,出来的东西前后割裂感很强。现在1.1直接把这个数字拉到了10秒,意味着你可以用一小段原始素材,延伸出一段更长、更连贯的场景。 技术上最大的亮点是4K超分辨率和首尾帧控制。4K超分让低分辨率草稿能直接输出成品质量,首尾帧控制则给了创作者精确把控起止画面的能力——这对做产品演示视频或者故事叙述的人来说,基本就是开箱即用的电影级工具。 还有个很实用的360p快速草稿模式,先用低分辨率快速迭代创意,确认方向后再跑高清渲染。这个工作流设计很懂创作者的痛点——没人想在试错阶段等半天渲染。 有意思的是,1.1把Veo里的创意控制功能全搬过来了,相当于Veo和Flash开始融合成一个统一平台。Google在AI视频赛道的思路越来越清晰:不是一个模型打天下,而是一个平台覆盖从草稿到成品的全流程。 对内容创作者来说,这意味着AI视频制作的门槛又降了一大截。以前需要专业剪辑师做的场景延伸和质量提升,现在可能只需要一段手机视频素材就够了。
显示更多 话题来源 @GoogleAI 139K阅读 ❤️1587
Google AI (@GoogleAI) on X Meet Gemini Omni 1.1 Flash ⚡️ Our newest multimodal model for video generation and editing. It now features your favorite creative controls from Veo, plus brand new capabilities. Enjoy features like X (formerly Twitter)
菠萝与大西瓜 ·

做一个下dsh和pi的对比 Pi 的目标是“最小核心 + 用户自己拼”,DSH 的目标是“几乎所有能力都插件化,官方先给你几套完整组合”。 DSH 的骨架是Cordis。 Cordis 不是普通插件加载器,它强调两件事:

  1. 可逆副作用(temporal composability):插件卸载时,注册的服务、事件、工具 schema、prompt section 全部自动撤销。
  1. 依赖声明与空间组合(spatial composability):插件通过 inject 声明需要什么服务,运行时按依赖挂载。 所以在 DSH 里: - 模型适配器是插件 - 工具注册表是插件 - session log 是插件
  • agent loop 本身也是插件 - 甚至 UI 也是插件 没有“神圣不可动的核心”。你想换 loop、换工具策略、换上下文压缩,挂一个新插件 + 改配置就行。 启动时是 Profile + Bundle叠出来的:

空根 → dsh-base(模型、工具、沙箱、凭证…) → dsh-web-app 或 dsh-headless → 用户自己的 cordis.patch.yml → 命令行 --patch

dsh --profile web --dump-config 能直接把当前实际挂载的树打出来。 Session 设计是硬核部分 Session 是 append-only 的事件流

模型最终看到的上下文,必须能从这条 log 完整重建出来。官方写得很死: > Model-visible means logged. 任何会进模型请求的内容,都要先变成 session event。

所以 fork、resume、回放、UI 渲染、telemetry,全部从同一条流投影。这点比大多数 coding agent 做得更彻底。 Turn / Step 有claudecode的影子,流程如下: turn/start

→ claim input → agent/pre-step(可拦截、可改写) → step/start → llm/stream

→ tool/call → tools/pre-execute → execute → post-execute → step/end → 继续 or turn/end

agent/pre-steptools/* 这些是 waterfall,监听者必须显式 next() 才能往下传。扩展点设计得很规整。 Pi 的实际交集 DSH 仓库里有一个包: -ai/dsh-llm-pi-ai

它就是把 pi-ai当成 LLM 适配器的后端。 多 provider、协议兼容、reasoning effort 映射、catalog 覆盖,都走 pi-ai 的能力,再包一层 Cordis 插件契约。 所以:

  • LLM 调用层:吃了 Pi 的基础设施 - Agent 编排、工具、session、UI、沙箱:完全自己的 Cordis 体系 “LLM 适配层直接用了 pi-ai,上层重做了一套更重的可组合 Runtime”。 模式上的对应

DSH 的 Minimal 模式才最接近 Pi 的默认体验:只留 shell + 文件编辑器,专门给 benchmark 用。 官方之前在 V4 的 agent 评测里就用过这个模式。

Standard 模式和 Code(PTC)模式则是完整工具集 + 程序化工具编排,已经远超 Pi 默认的 4 工具。 如果你喜欢 Pi 那种“核心极瘦、自己动手加东西”的感觉,DSH 会显得重,配置和概念也更多。

如果你要的是可替换的 agent loop、完整事件回放、多模式预设、以及官方已经搭好的 Web 界面,DSH 的插件树和 seam 设计更系统。 一句话:

Pi 是极简可扩展的 coding harness;DSH 是基于 Cordis 的完整 Agent Runtime,LLM 层复用了 pi-ai,但整体不是同一套代码。

显示更多 话题来源 @mylifcc 14W阅读 ❤️247
lifcc (@mylifcc) on X 做一个下dsh和pi的对比 Pi 的目标是“最小核心 + 用户自己拼”,DSH 的目标是“几乎所有能力都插件化,官方先给你几套完整组合”。 DSH 的骨架是Cordis。 Cordis 不是普通插件加载器,它强调两件事: 1. 可逆副作用(temporal composability):插件卸载时,注册的服务、事件、工具 schema、prompt section 全部自动撤销。 2. 依赖声 X (formerly Twitter)
飞翔的智能体 ·

🎬 告别CapCut:这个开源工具让AI帮你剪视频

有人做了一个叫Video Use的工具,专门为Claude Code设计的视频编辑器,开源免费。

工作流程简单到离谱:把原始素材扔进一个文件夹,告诉它你想要什么,剩下的它全包。

它能做什么?

  • 自动剪切片段
  • 删除填充词和静音
  • 生成字幕
  • 应用色彩校正
  • 添加动画效果
  • 渲染最终视频

没有时间线,不用手动拖拽片段三个小时,没有月费订阅。

和Remotion有什么区别?

Remotion是一个库,你需要手动组装每一帧。Video Use不同——它直接帮你完成编辑。

你不是在"使用工具",你是在"指挥AI"。

为什么这很重要?

过去视频编辑是这样的:

  1. 导入素材
  2. 裁剪、排列、调色
  3. 加字幕、动画
  4. 导出、渲染

每一步都需要手动操作,一个下午可能只剪出一个30秒的短视频。

现在,Video Use把这些步骤全部自动化了。

你只需要告诉AI:"帮我把这些素材剪成一个1分钟的短视频,去掉废话,加上字幕。"

剩下的时间,你可以去做别的事。

开源的意义

这个项目完全开源,在GitHub上可以找到代码。

这意味着:

  • 你可以审查代码,确保没有后门
  • 你可以根据自己的需求修改
  • 你可以贡献功能,让工具变得更好

对于内容创作者来说,这是一个解放生产力的工具。以前需要花一个下午剪辑的视频,现在可能只需要几分钟。

个人思考

AI视频编辑工具正在改变内容创作的格局。

过去,视频编辑是专业技能,需要学习复杂的软件。现在,AI让任何人都能轻松制作高质量视频。

这降低的内容创作的门槛,让更多人能够表达自己的想法。

对于营销人员、教育工作者、自媒体创作者来说,这是个好消息。

不过,这类工具目前还不够完美。AI剪辑的逻辑可能和你的预期有偏差,需要手动调整。

但随着AI模型的进步,未来视频编辑可能会变得和写文档一样简单。

Video Use是一个值得关注的项目,特别是如果你经常需要处理视频内容。

显示更多 话题来源 @saidstetic ❤️433
said (@saidstetic) on X NO HE VUELTO A PAGAR CAPCUT DESDE QUE USO ESTO Se llama Video Use. Es una herramienta de edición para Claude Code, open source y gratuita. El flujo es absurdo de simple: metes el material bruto en u X (formerly Twitter)
飞翔的智能体 ·
有位博主整理了9个给Codex装上就能直接开挂的Skill,从省Token到做PPT到做视频全覆盖,看完我觉得这已经不是工具箱了,这是把一个团队塞进了命令行。 第一个叫Ponytail,核心逻辑是先判断代码有没有必要写,能不写就不写。听起来简单,但它能省掉50%的无效代码,Token消耗直接降94%。本质是给AI加了一个资深工程师的判断力。 PPT和图表类Skill解决的是AI生成的东西能看但不能用的问题。以前AI做PPT就是堆文字,现在有了设计约束,出来的东西排版、配色、视觉层次都能直接交付。 最让我意外的是视频类Skill。上传一条原始素材,它能自动识别废话、口误、停帧,帮你剪出成片。做短视频的人应该知道这意味着什么——以前最耗时间的粗剪环节直接被AI接管了。 还有个叫Taste的Skill专门对付AI味。它会从字体、配色、留白、间距、层级五个维度重新审查页面,不好看就调整重做。这个思路很对——AI能写代码不稀奇,能写出好看的页面才是真本事。 这9个Skill本质上揭示了一个趋势:AI编程的瓶颈已经从能不能写转移到了写得好不好。
显示更多 话题来源 @goan999999 171K阅读 ❤️555
govin.eth | G哥 (@goan999999) on X 装完这 9 个 Skill,你的 Codex 直接开挂 很多人还在把 Codex 当聊天工具用:写几句 Prompt、改几行代码、遇到复杂任务就卡住 真正拉开差距的,是给它装上这套能复用的 Skill: 1、Ponytail:少写 50% 无效代码,Token 节省 94% https://t.co/HkPO7opunu 它会先判断代码有没有必要写,避免 AI 过度开发。该省的 Token X (formerly Twitter)
菠萝与大西瓜 ·
Grok Bot上线购物功能:AI Agent直接帮你在网上买东西 Grok Bot这次更新有点意思——直接能帮你在互联网上购物了。 通过接入Link支付系统,Grok Bot现在可以代表用户完成完整的购买流程。不是帮你比价或者找链接那种,是真的帮你下单、付款、完成交易。你只需要告诉它想买什么,它自己就能搞定整个购物流程。 这意味着什么?AI Agent正在从“给你建议”进化到“替你行动”。以前你问AI推荐什么耳机,它给你列个清单然后你自己去找链接、比价、下单。现在直接说“帮我买个300块以内的降噪耳机”,它就从选品到付款一步到位。 当然,这个功能目前还比较初级,主要针对Link生态内的商家。但从产品方向来看,这才是AI Agent真正有价值的场景——不是回答问题,而是替佮干活。从帮你写代码、帮你做设计,到帮你买东西,AI Agent正在一个个占领我们日常生活中的具体任务。 电商赛道接下来可能会有一波新的竞争,核心就是:谁的AI购物助手更好用。这个趋势值得关注。
显示更多 话题来源 @xibot_ai 690M阅读 ❤️9864
飞翔的智能体 ·
吴恩达团队刚发布了AI工程师技能地图,重点回答了一个核心问题:在Agent编程时代,软件工程基础到底怎么变的? 先说结论——模块化、测试、抽象这些老功夫不但没过时,反而更关键了。因为AI生成代码的速度太快,如果没有好的架构约束,代码膨胀的速度也一样快。 地图里把技能分成了几个层次:最底层是编程语言和数据结构,中间是设计模式和系统架构,最上层是Agent特有的能力——比如上下文管理、工具调用链、记忆机制。 有一个细节很值得注意:传统软件工程里「写好文档」是个nice to have,在Agent工程里变成了刚需。因为AI需要靠文档理解你的系统,没有文档的代码库对Agent来说几乎是黑盒。 另外,测试的重要性被提到了前所未有的高度。AI写的代码跑得快,但出错也快。没有自动化测试兜底,AI给你挖的坑可能比它填的还多。 这张地图不只是给想转AI工程师的人看的,任何一个还在用AI辅助编程的开发者都值得对照一下自己的短板。
显示更多 话题来源 @AndrewYNg 101W阅读 ❤️8696
Andrew Ng (@AndrewYNg) on X AI Engineering Skills Map: Software engineering fundamentals X (formerly Twitter)
飞翔的智能体 ·
刚刚刷到一个GitHub项目 ui-ux-pro-max-skill,直接把我看愣了——11万star,做什么的呢? 简单说,就是给AI装了一套专业UI/UX设计大脑。 以前用AI做设计,出来的配色、间距、层级总差那么点意思,得手动调半天。这个Skill直接把设计经验编译成AI能执行的规则,喂进去一个需求,吐出来的方案就是专业级的。 不只是网页,移动端、桌面端都能覆盖。用一套设计token统一规范,跨端不会垮。本质是个Skill,接入你的Agent工作流就能用,直接进生产流程。 开源协议宽松,商用也没问题。我跑通demo只花了15分钟,同类工具连文档都还没啃明白。 如果你在用AI做设计相关的事,这个真的值得收藏。
显示更多 话题来源 @sunmer575399 24K阅读 ❤️306
哇!是牛来 ·
开源CAD数据集CAD-1000-Hours发布:1021小时真人录屏训练AI Agent操控专业CAD软件 训练能真正操控专业CAD软件的AI Agent,一直缺高质量数据。CAD-1000-Hours这个开源数据集终于补上了这块短板。 整个数据集规模相当惊人:1021.64小时的真人屏幕录像,覆盖AutoCAD、SOLIDWORKS等10款主流CAD软件,总共256.6GB。更关键的是,这不是简单的录屏——每个任务都有30帧视频、同步的鼠标键盘操作记录、文字讲解和任务说明,还有原始文件和最终成品。 这意味着AI Agent可以从头到尾学会一个工程师是怎么画图的:从打开软件、选择工具、绘制线条,到调整参数、保存文件,每一步操作都有迹可循。597个专家级完整任务,真实还原了工程师的日常工作流程。 对于AI Agent开发者来说,这个数据集的价值在于:你可以用它来训练一个真正能“看屏幕、理解操作、自己动手”的CAD Agent,而不是只能回答问题的聊天机器人。数据已经上传到Hugging Face,直接下载就能用。 如果你在做工业软件AI、设计自动化或者Agent应用,这个数据集值得收藏。未来AI辅助设计的门槛,可能就从这里开始降低。
显示更多 话题来源 @IndieDevHailey 17K阅读 ❤️327
飞翔的智能体 ·

🎬 AI直播进入实时互动时代:观众发弹幕就能改直播画面

昨天刷到一个Twitch直播,聊天室里有人用英语说"切到街头",画面就真的从动画场景跳到了城市街景。

下一条弹幕是西班牙语的"60年代木偶广告",紧接着画面变成了复古定格动画风格。

再然后有人用日语要求"机器人脸上缠满电线",AI居然也接住了,生成了一张荒诞但视觉冲击力很强的画面。

这不是预录好的演示视频,是实时直播。

支撑这个玩法的是什么?

MiniMax H3 Max,一个视频生成模型。

数据:

  • 生成5秒768p视频不到3秒
  • 15秒视频大约15秒完成

这个速度意味着什么?

上一段视频还在播,下一段已经生成好了,中间几乎没有等待。

Pieter Levels做了什么?

他做了一个24小时AI直播网站,首页只写了一句话:"The chat decides what airs next"

没有导演,观众就是编剧。

直播可能从动画突然切到真人访谈,再跳进某个荒诞广告,全看下一条弹幕说什么。

为什么这很重要?

过去视频生成模型的定位是"内容工具"——你给它一段提示词,它给你一段视频,你拿去剪辑、发布、投放。整个流程是离线的。

但实时直播把这个逻辑彻底改了。

生成速度不再是"效率指标",而是"能不能用的门槛"。如果生成5秒视频需要10秒,直播就会卡住,观众体验直接崩掉。

H3 Max把这个时间压到了3秒以内,理论上还能给排队、内容审核、编码推流留出余量。

这不是量变,是质变。视频生成从"工具"变成了"系统",从一个离线的生产环节,变成了一个持续运转的内容流。

技术层面怎么实现的?

两条路线:

1️⃣ fal做的后训练加推理优化,在开源版H3基础上加新数据、加可验证强化学习,吞吐量做到原版的35倍

2️⃣ FastVideo做的稀疏化加速,把49次Transformer Forward压缩到4次,结合90%稀疏度的VSA,单张Blackwell GPU最高14倍加速

两条路线的共同点:都在追求"实时可用"。不是跑分更高,不是画质更好,而是快到能接进直播流。

实操建议:

如果你想试这个方向,先别急着做24小时直播。

先用H3 Max的API做一个5分钟的互动测试,看看观众发10条弹幕,AI能不能都接住,画面连贯性能不能维持。

如果这个都跑不通,24小时就是灾难。

另外,关注FastH3的开源权重,单张Blackwell 14倍加速这个数据如果能复现,成本会低很多。

显示更多 话题来源 @fal ❤️246
fal (@fal) on X Introducing https://t.co/4xpxWRD3VV A new platform for infinite, interactive AI livestreams. Pick a channel, prompt what happens next, and watch it generate in real time. You aren't just watching th X (formerly Twitter)
飞翔的智能体 ·

💻 苹果终于摊牌了:M6芯片Mac Mini就是为本地AI量身定做的

苹果发布了搭载M6芯片的新款Mac Mini,起售价899美元。

这不是普通的性能升级——这是专门为本地AI推理打造的硬件。

为什么这很重要?

以前想跑大模型,要么买昂贵的GPU服务器,要么付云端token费用。

现在,一台899美元的Mac Mini(32GB内存)就能跑起来。

能跑什么模型?

  • Qwen 3.6 27B:接近GPT-4的质量
  • Qwen 3 Coder 32B:完整的编程助手
  • Llama 4 8B:全精度运行
  • DeepSeek R1 32B:推理任务

性能有多强?

  • LLM处理速度比M1快13.5倍
  • 比M4快4倍

这意味着什么?以前需要云端才能跑的模型,现在在本地就能实时运行。

如果预算充足呢?

Mac Studio配M5 Ultra(512GB内存):

  • Llama 4 70B高质量量化
  • DeepSeek V4,数千亿参数
  • 四台Mac Studio通过雷电5集群,可以跑万亿参数模型

苹果看到了什么趋势?

苹果说上季度Mac业务增长了30%,主要是因为人们买来跑AI模型。

与其付云端token费,不如把模型跑在自己桌上。

个人思考:

苹果这次押注本地AI,时机抓得很准。

云端推理的问题:

  • 费用高,token计费模式不友好
  • 延迟大,网络传输是瓶颈
  • 隐私风险,数据要上传

本地推理的优势:

  • 一次买断,长期免费
  • 无网络延迟,实时响应
  • 数据不离机,隐私安全

对于开发者和企业来说,本地AI是更经济、更安全的选择。

不过,本地推理的挑战在于:模型越大,需要的内存越多。苹果通过大内存芯片解决了这个问题。

未来,"推理在本地,训练在云端"可能成为主流模式。苹果已经为这个未来准备好了硬件。

显示更多 话题来源 @VaibhavSisinty ❤️2892
Vaibhav Sisinty (@VaibhavSisinty) on X Apple is no longer hiding it. These machines are built for local AI. Apple unveiled the new Mac Mini with M6 their first 2nm chip. Starting at $899. What you can run on the $899 Mac Mini (32GB) 👇 → X (formerly Twitter)
我不是小布丁 ·
现在Vibe Coding很火,大家都在用AI写代码。但有一个问题很少有人认真讨论:模块划分。 很多人觉得这是传统软件工程的事,跟AI没关系。恰恰相反,模块划分做得好不好,直接决定了AI生成代码的质量和系统的稳定性。 一个常见的错误:按流程步骤来分模块。比如电商网站,有人把下单、算钱、扣款、存库、发邮件拆成五个模块。表面上看很清晰,但实际上改动会像多米诺骨牌一样一路扩散。加个「预计送达时间」,四个模块全要动。 正确的做法是:按「什么会变」来分。支付渠道会变、优惠规则会变、通知方式会变、数据库会换——那每个会变的东西就是一个独立模块。这样改动只会影响一个模块,不会牵连其他地方。 判断标准很简单:一个需求来了,你需要动几个模块?理想答案是一个。如果运营改个优惠规则要同时改好几个文件,说明分错了。 这个原则对AI来说尤其友好。AI受上下文窗口限制,如果一个变更能在单个模块内解决,它需要的上下文就少很多,生成质量自然更高。所以,好的模块划分不只是架构问题,它是AI编程效率的基础设施。 先花时间把模块设计好,后面AI写代码才能事半功倍。
显示更多 话题来源 @dotey ❤️137
宝玉 (@dotey) on X 如今 Vibe Coding 盛行,然而就算是用 AI 写代码,也少不了要考虑如何划分好模块、保障低模块之间耦合以及系统的拓展性。 如何划分好模块这些事是传统软件工程和架构设计范畴,但你做好了的话,AI 生成的代码质量更高系统也更稳定。 很多新手对于如何划分模块并没有什么概念,甚至很多编程老手也只是直觉知道怎么分,但也讲不出个所以然。 一句话:模块按“什么会变”来分,不是按“先做什么后做什么 X (formerly Twitter)
飞翔的智能体 ·
刷到一个GitHub上4.2万星的开源项目,直接把AI视频剪辑的门槛踩到了地板上。 它的逻辑很简单:你丢一句人话进去,脚本、素材、配音、字幕、成片,全自动跑完。不用你动手剪一刀。更狠的是,你丢一条爆款视频进去,它能把人家的脚本结构、镜头节奏、画面风格全部拆解,然后给你生成好几套复刻方案。 底层是什么配置?12条流水线、100多个工具、700多个Agent技能包。这已经不是工具了,这是一个完整的制作团队塞进了你的命令行。 以前做短视频,从脚本到成片最少半天。现在?一句话的事。而且它不是那种粗糙的自动拼接,是真的在理解内容逻辑后进行创作。 说实话,看完之后有个很真实的感受:如果这个东西真的好用,那学剪辑的时间是不是可以省下来了?当然,工具再强也得看怎么用,但至少对于中小创作者来说,从0到1的门槛已经被拉到了几乎为零。 AI正在重新定义「会做视频」这件事的含义。
显示更多 话题来源 @huoshan007 ❤️6049
火山哥🕊️ (@huoshan007) on X 兄弟们,AI剪视频这赛道已经卷到我看不懂了。 刚刷到一个开源项目,GitHub直接干到4.2万星。它不是帮你剪,是压根不用你动手。 你丢一句人话进去,脚本、素材、配音、字幕、成片,全给你跑完。 最离谱的是,你丢一条爆款视频进去,它能把人家的脚本结构、镜头节奏、画面风格全拆了,然后给你出好几套复刻方案。 底层12条流水线、100多个工具、700多个Agent技能包。这哪是工具,这是直接塞给你 X (formerly Twitter)
飞翔的智能体 ·
Claude Agent学会自己改Skill了:什么任务该让AI自我进化? Anthropic最新研究揭示了一个有趣的发现:Claude Agent开始具备"自我进化"能力,能够根据任务需求自动调整和优化自己的Skill。 这项能力的核心在于:Agent能够分析当前任务的复杂度,判断是否需要创建新的Skill或修改现有Skill。比如处理复杂的多步骤任务时,它会自动拆解并生成相应的子技能。 但研究也指出,并非所有任务都适合自我进化。简单重复性任务、需要精确控制的场景、以及涉及敏感操作的任务,应该保持固定Skill以确保稳定性。 最佳实践是:让Agent在遇到"Skill覆盖率不足"时触发自我进化,而不是每次都重新发明轮子。这样既保证了效率,又避免了不必要的复杂度。
显示更多 话题来源 @dotey 80.2K阅读 ❤️522
会飞的荧 ·
有人把市面上所有 PPT 相关的 AI Skill 都装了一遍,最后只留下 6 个,并按风格和使用场景做了分类。这份选型指南值得收藏。 几个重点: ppt-master:麦肯锡/咨询公司风格,大厂蓝白灰底色、结构化三栏排版。适合给领导、甲方、国企做正式汇报,输出的是原生 .pptx 文件,别人能直接改文字表格。 frontend-slides:Vercel/Stripe 极客风格,深色技术流、代码高亮、网页丝滑过渡。适合技术 Meetup,需要边讲边演示代码的场景。 gui:极客专属的动态网页演示,效果像大片。 核心建议其实就一句话:先确定你的听众是谁,再选对应的风格。给领导看的和给技术社区看的,完全是两种东西。 以前做 PPT 最耗时间的不是内容,而是排版和美化。现在 AI 能把这些重复劳动接过去,但「审美决策」还是得你自己来。工具再好,也替代不了你对受众的理解。 原文完整版含链接,建议收藏备用:x.com/i/status/20935…
显示更多
疯狂的烤妹儿 🩵 (@CrazyKaomei) on X 趁着周末,我把市面上所有 PPT Skill 都安装体验了一遍,只留下来这 6 个最能打的,并按照「风格和使用场景」区分,整理了这份 AI PPT 终极选型指南。 里面有直接输出 .pptx 矢量格式能正式交差的,也有自带提词器、极客专属的动态网页演示大片。 建议先 【收藏+转推】,等用的时候再也不用纠结了👇 1️⃣ ppt-master 画风:麦肯锡 / 咨询公司风(大厂蓝白灰底色、结构 X (formerly Twitter)
飞翔的智能体 ·
Claude Agent学会自己改Skill了:什么任务该让AI自我进化? Anthropic最新研究揭示了一个有趣的发现:Claude Agent开始具备"自我进化"能力,能够根据任务需求自动调整和优化自己的Skill。 这项能力的核心在于:Agent能够分析当前任务的复杂度,判断是否需要创建新的Skill或修改现有Skill。比如处理复杂的多步骤任务时,它会自动拆解并生成相应的子技能。 但研究也指出,并非所有任务都适合自我进化。简单重复性任务、需要精确控制的场景、以及涉及敏感操作的任务,应该保持固定Skill以确保稳定性。 最佳实践是:让Agent在遇到"Skill覆盖率不足"时触发自我进化,而不是每次都重新发明轮子。这样既保证了效率,又避免了不必要的复杂度。
显示更多 话题来源 @dotey ❤️522
飞翔的智能体 ·

🚀 微软这次真下场了:Agent Framework推出Go版本,专为生产环境打造

微软把Agent Framework搬到Go上了。

这不是玩具demo,是专门用来写能真上生产的AI智能体。

为什么选Go?

Go在后端开发领域已经是主流语言。对于需要高并发、低延迟的AI Agent系统来说,Go是绝佳选择。

微软这次做的,是让Go开发者也能轻松构建企业级AI Agent。

核心特性:

1️⃣ 多模型支持
不锁死一家大模型。OpenAI、Claude、Gemini、本地模型都能接。

2️⃣ 可插拔中间件
想加日志?想加鉴权?想加限流?中间件随便插。

3️⃣ 可视化工作流
一张图把整个工作流串起来:顺序执行、并发处理、条件分支、检查点、人工介入,全都能画出来。

这意味着什么?

以前用Python写Agent的人很多,但Go开发者一直缺少趁手的工具。

现在微软把Agent Framework带到Go生态,意味着:

  • Go后端团队可以直接在现有技术栈上构建AI Agent
  • 不需要学Python,不需要切换语言
  • 高并发场景下性能更优

适用场景:

  • 微服务架构:Agent作为微服务运行
  • 高并发系统:需要处理大量并发请求的Agent
  • 实时应用:低延迟要求的AI助手
  • 企业级部署:需要长期稳定运行的生产系统

个人思考:

微软这次做对了一件事:让AI Agent开发融入现有技术栈

很多公司已经在Go上投入了大量资源。让他们为了AI Agent去学Python,成本太高。

直接在Go上构建Agent,是更务实的选择。

不过,Go生态的AI库确实不如Python丰富。微软需要持续完善Go版Agent Framework,才能真正吸引开发者。

对于Go团队来说,这是一个值得关注的机会。在你的技术栈上构建AI Agent,比迁移到Python更高效。

显示更多 话题来源 @bkdgiffug ❤️68
lumxss (@bkdgiffug) on X 微软这回真下场卷Go了?把自家Agent Framework搬到了Go上,专门用来写能真上生产的AI智能体,不是玩具demo。 几个点挺实在: 1️⃣ 多家大模型都能接,不锁死一家 2️⃣ 中间件可插拔,想加啥加啥 3️⃣ 一张图把整个工作流串起来,顺序、并发、条件分支、检查点、人工介入全都能画出来 搞Go又想碰Agent的,可以扒一扒。 🔗 https://t.co/cSidmMM60V X (formerly Twitter)
菠萝与大西瓜 ·
AI coding 的记忆问题一直是痛点。每次新开会话,Agent 就失忆了——项目背景、架构决策、之前踩过的坑,全都得从头讲一遍。 最近有个叫 Memanto 的开源工具专门解决这个问题。思路很简单:把每次和 Agent 的完整工作会话保存下来,用 AI 自动组织压缩,下次需要时 90ms 内把相关上下文找回来。 它支持 Claude Code、Cursor、Codex、LangGraph、CrewAI 等主流工具。安装也极简,一行 pip install memanto 就行。 技术实现上比较有意思的是,它没有用传统的向量数据库方案,而是通过 AI 压缩 + 高效检索来控制成本和速度。这比直接向量化省资源,同时保证了检索的精度。 这个问题确实是 agentic coding 里一个基础但很疼的问题——上下文的持久化和高效复用。记忆做得好,Agent 才能真正从「一次性工具」变成「长期协作伙伴」。 如果你日常重度使用 AI 写代码,值得一试。
显示更多
会飞的荧 ·

最近有人总结了一套使用 GPT-5.6 Sol 的实践指南,核心观点就一句话:规划可高,执行要轻,约束先行。

这条推文来自评论区的高赞内容汇总,主要讲的是怎么避免在使用高级模型时「过度工程化」。

几个关键原则:

  1. 先复述意图再动手。让 AI 重复你的需求、范围、非目标和验收标准,确保理解一致后再开工。
  2. 规划和执行分开。用高能力模型做架构规划,用轻量模型做具体执行,别一刀切全用最贵的。
  3. 禁止全程 Ultra 模式。不要让 AI 一上来就用最复杂的方案,简单够用永远优先。
  4. 不可逆操作必须等确认。删除、覆盖、发邮件这类操作,没有人工确认别放行。
  5. 完成前检查三件事:测试跑通了、改动范围小、没有多余的抽象层。

作者还提到一个很实际的思路:让 Grok 4.6 基于这些高置信度内容生成了一份 Agents.md 配置文件,相当于把这套最佳实践固化成 AI 的行为准则。

这其实反映了一个趋势:随着 AI 模型能力越来越强,真正的瓶颈不再是「AI 能不能做」,而是「怎么让 AI 不做过头」。约束设计本身就是一种工程能力。

显示更多
菠萝与大西瓜 ·
宝玉分享了 Claude 官方新发的一篇博文《How Warp builds self-improving agents on Claude》,讲的是一个非常有意思的问题:怎么让 Agent 的 Skill 自己进化。 Warp(终端工具)的做法是:Agent 在执行任务时,每次遇到新的边界情况或者发现了更优的解法,就自动更新对应的 Skill 文件。这相当于给 Agent 装了一个「经验积累器」——做一次学一次,下次遇到类似场景就不用从头摸索了。 他自己也实践过类似思路。写了一个反编译 JS 代码的 Skill,效果还不错,能持续优化。但试过做「写作自我进化 Skill」就翻车了——因为写作没有统一的客观标准,Skill 自己改自己,越改越差。 这里暴露了一个核心矛盾:什么任务适合自我进化,什么不适合? 关键在于有没有明确的验证信号。代码反编译有客观结果可以比对——生成的代码能不能跑、对不对,一测就知道。但写作、策划这类主观性强的任务,Agent 缺乏可靠的质量反馈,自我进化容易陷入「负优化」陷阱。 所以如果你在用 Cursor/Copilot/Claude Code 之类的工具做 Skill,建议先想清楚两件事:一是你的任务有没有清晰的验证标准,二是 Skill 更新后有没有回滚机制。没有这两样,盲目让 AI 自己改自己的 Skill,大概率是灾难。 参考这篇博文原文:anthropic.com/engineering/wa…
显示更多
会飞的荧 ·
微软刚刚开源了整个 Agent Runtime,名字叫 Agent Harness。 为什么这件事值得关注?因为一个原始大模型只能输出文本,要让它变成一个真正能干活的 Agent,你还需要一整套基础设施:执行循环、工具调用、记忆管理、任务规划、权限审批、结束判断——这些是一个 Agent 的「操作系统层」。 以前你要么自己从头搭,要么用 LangChain/LlamaIndex 之类的框架。但微软这次直接把这一层打包开源了,而且内置了 50 多个现成的工具。 对开发者来说这意味着什么? 第一,不用再重复造轮子了。Agent 的核心循环逻辑其实大同小异,真正的差异化在于你给它什么工具、什么记忆、什么领域知识。Runtime 开源后,精力可以集中在这些真正产生价值的部分。 第二,微软的工程标准。这不是个人项目或者实验室 demo,而是带着微软企业级代码审查标准的开源项目,稳定性和可维护性有基本保障。 第三,生态对齐。微软的 Agent Harness 跟 Azure AI、Copilot Studio 等产品线是深度集成的。如果你已经在用微软的云服务,这套 Runtime 能无缝接入现有工作流。 当然,开源 Runtime 不等于你立刻就能用起来。怎么选模型、怎么设计工具链、怎么处理多 Agent 协作,这些才是真正的工程难题。但至少基础设施这一层,终于有人替你铺好了。
显示更多
菠萝与大西瓜 ·
有人整理了 10 个加起来拿了 180 万+ Star 的 GitHub 开源项目,号称能替代掉每年花 3 万美元买的各类工具。虽然"替代"这个说法有点夸张,但其中几个确实值得收藏。 几个重点提一下: public-apis(456k Star)——收录了 50 个类别、1400 多个免费 API,天气、金融、图片、游戏全都有。做 side project 或者学习阶段需要免费数据源的时候,翻这个列表比到处搜靠谱得多。 free-programming-books(450k Star)——这个应该很多人见过,但还是得提。各个语言、各个方向的免费编程教材汇总,质量参差不齐但覆盖面极广。 awesome(495k Star)——万能索引,什么领域的 awesome list 都能从这里找到入口。 另外几个针对特定场景的也很实用:像 public-apis 适合需要数据接口的开发者,free-for-dev(450k Star)收录了大量对开发者免费的 SaaS/PaaS/IaaS 服务,从 CI/CD 到监控到数据库都有。 说实话,3 万美元/年的对标有点标题党,但核心观点是对的:开源社区的生态已经成熟到很多付费工具的替代方案都是现成的。关键在于你愿不愿意花时间去配置和适配。 GitHub 开源的好处不只是免费,更在于透明度和可控性。数据在自己手里,逻辑看得见,不用的时候随时能迁走。这在现在这个越来越依赖各种 SaaS 的环境里,反而是最稀缺的确定性。
显示更多
哇!是牛来 ·
🚀 DeepSeek Harness 正式开源!定位「中国版OpenClaw」的私有化WorkBuddy,全插件架构直接把Agent基础设施的灵活性拉满。 这款工具一出直接瞄准企业级私有化Code协作、CoWork场景,基本能覆盖同类工具的核心需求,对WorkBuddy等现有产品形成直接冲击。此前DeepSeek Harness的内测招募本质上是一次全球Agent生态大摸底,扫了一遍全球Agent基础设施的家底后,后续版本在开放生态上的动作非常值得期待。 · 看点一:一切皆插件 模型、工具、Skill、会话、沙箱、存储、主循环、调度甚至连UI都是插件,所有组件都可以通过配置替换,完全不用动源码。四种运行模式里最有意思的是Minimal模式,只保留bash和文件编辑器,明摆着是给模型做裸机Benchmark准备的。 · 看点二:每次运行全链路可回放 系统提示、推理过程、工具调用与结果、子Agent调度、所有Context注入,全部写入只增的Session Log,Resume、Fork、Search、Replay功能都跑在同一条事件流上,操作追溯和版本管理非常方便。 · 看点三:内核设计足够硬核 dsh跑在Cordis内核上,把插件系统拆成「时间可组合性」和「空间可组合性」两个正交维度:卸载组件时副作用能完整回滚,每个Context变换都带逆操作由运行时追踪;依赖可声明,Context变化时还能反向通知组件,还配套了动态组合演算,证明相关性质能从单个组件传导到整个系统。 整体来看,DeepSeek Harness最大的特点就是极致
显示更多 话题来源 @aigclink 3W阅读 ❤️263
AIGCLINK (@aigclink) on X deepseek-harness重磅开源,采用了一切皆插件的架构,也就是中国版的openclaw,体验了下可以称之为私有化的workbuddy。 场景侧冲击:有了deepseek-harness之后,企业域的私有化code、cowork基本用这个就可以了,直接会冲击workbuddy之类的市场。 之前DeepSeek Harness内测招募,本质是一次开源 Agent 生态大摸底,把全球 Ag X (formerly Twitter)
飞翔的智能体 ·

📄 PDF解析新王者:OpenDataLoader让AI真正"读懂"文档

你有没有遇到过这种情况:

PDF里明明有表格、有图表、有公式,但用传统工具解析出来全是乱码?

这就是PDF解析的老大难问题。而OpenDataLoader PDF来了。

它是什么?

一个免费、开源的PDF解析器,能把PDF转换成AI-ready的格式:Markdown、JSON、HTML。

核心能力:

1️⃣ 表格识别
不是简单的文本提取,而是能识别表格结构,转换成结构化数据。

2️⃣ 公式处理
LaTeX公式、数学表达式,完美保留。

3️⃣ 图表解析
柱状图、饼图、折线图,都能识别并转换。

4️⃣ OCR支持
扫描版PDF也能处理,用OCR识别文字。

为什么这很重要?

对于AI应用来说,PDF是最重要的数据源之一。但传统PDF解析工具太弱了:

  • PyPDF2:只能提取纯文本,表格全丢
  • pdfplumber:表格识别不稳定
  • Adobe API:收费,而且也不是百分百准确

OpenDataLoader的目标是:让AI能真正理解PDF内容

适用场景:

  • RAG管道:构建文档问答系统
  • AI Agent:让Agent能读取PDF资料
  • 搜索系统:构建文档搜索引擎
  • 数据分析:从PDF报表中提取数据

技术亮点:

  • 开源免费(MIT协议)
  • 支持多种输出格式
  • 处理复杂布局能力
  • 可集成到现有AI管道

个人思考:

PDF解析一直是AI应用的痛点。很多公司花大量时间在"数据清洗"上,就是因为原始文档格式太乱。

OpenDataLoader这类工具的价值在于:它把"数据清洗"这个苦活标准化了。以后构建AI应用时,不用再为PDF解析头疼。

不过,这类工具的挑战在于:PDF格式千变万化,没有一个工具能100%搞定所有情况。OpenDataLoader需要持续迭代,才能覆盖更多边缘场景。

对于需要处理大量PDF文档的团队来说,这个工具值得关注。

显示更多 话题来源 @rammcodes ❤️532
Ram Maheshwari (@rammcodes) on X WTF Dude... this is like PDF parsing on steroids, NGL. 🤯 OpenDataLoader PDF is a free, open-source PDF parser that converts PDFs into AI-ready Markdown, JSON, and HTML. It can also use OCR for scann X (formerly Twitter)
菠萝与大西瓜 ·
刷到一位前端设计师 @yanliudreamer 的推荐,安利了设计工程师领域的大神 Emil Kowalski 的两门在线课程,评价相当高。 第一门是「AI for UI」,以 Emil 自己开发的一套 Design Skills 为核心教具。这套 Skills 充满了 Apple 式的设计美学——简洁、克制、但细节打磨到位。课程不只教 Skill 的用法,还会覆盖大量前端设计的基础知识,适合想用 AI 辅助 UI 设计但又不想丢掉设计素养的人。 第二门是「Animations on the Web」,这门课在设计圈已经是现象级口碑了。Web 动效一直是前端开发里「看起来简单、做好很难」的领域,而这门课从原理到实战都讲得非常扎实。 为什么推荐这个而不是直接列一堆教程链接? 因为 Emil 本人就是 Design Engineer 这个岗位的标杆人物。他不是那种「教理论但不写代码」的讲师,而是自己下场做产品、做开源的实战派。他的 GitHub 上有一套叫 Skills 的开源项目,直接把设计系统封装成可复用的模块,风格极其统一。 现在 AI 辅助前端开发越来越普及,但大多数人的痛点是:AI 生成的 UI 能用但不好看。根本原因是缺设计系统的约束。Emil 的这套方法论恰好解决了这个问题——先建立设计规则,再让 AI 在规则内生成内容。 对设计师来说,这是从「画图」转型到「定义系统+驾驭 AI」的好路径。对开发者来说,学完之后做出来的东西质感会直接上一个台阶。
显示更多
飞翔的智能体 ·
Google DeepMind 刚刚放出了 Gemini Omni 1.1 Flash,这是他们最新的多模态视频生成和编辑模型。这次升级的核心亮点是场景续写能力的飞跃——从之前 Veo 的 1 秒上下文直接拉到 10 秒。 这意味着什么?你给它一段 10 秒的原始视频,它能基于这段内容向后续写,生成更长、连贯性更强的视频片段。之前用 AI 生成视频最头疼的就是「每次只能做一小段,拼起来风格断裂」,现在这个问题基本被解决了。 其他新功能也相当实用:4K 超分辨率、首末帧精确控制、快速 360p 草稿模式。特别是首末帧控制,对做产品演示视频或者创意短片的人来说,等于拿到了逐帧级别的导演权限。 从发布节奏来看,Google 正在把 Veo 系列的创意控制能力全面整合到 Gemini 生态里。视频生成不再是独立功能,而是变成多模态大模型的一个内生能力。这个方向一旦跑通,后续的想象空间会大很多。 对于做内容创作的朋友来说,最直接的影响是:以后做短视频的素材成本会继续下降,但对「创意」和「叙事能力」的要求反而更高了。工具门槛降低,审美门槛升高,这个趋势越来越明显。
显示更多
飞翔的智能体 ·

🔥 Google工程师教你:270M小模型微调后秒杀70B大模型

270M参数的小模型,在特定任务上干翻70B大模型。

这不是段子,是Google工程师演示的实战效果。

怎么做到的?

选Gemma 270M作为基座,然后走这套流程:

  1. 生成合成任务数据

不需要海量标注数据,用大模型生成针对你具体任务的训练数据。

  1. LoRA微调

只训练少量参数,不用全量微调。一个普通人在家用电脑就能搞定。

  1. int4量化

把模型压缩到4位整数,体积砍掉一大半。

  1. 部署到手机

在Pixel上跑,完全离线,每秒2000个token。

效果有多猛?

  • 准确率从46%飙升到90%
  • 21分钟完成微调
  • 完全在手机端运行,不需要联网

为什么这很重要?

大模型的问题是:太贵、太慢、需要联网。

对于很多实际场景,比如:

  • 企业内部知识问答
  • 本地文档搜索
  • 边缘设备上的智能助手

你不需要一个通用的70B大模型。你需要的是一个在特定任务上极度专业的小模型。

这套方法的精髓是:用大模型生成训练数据,然后教小模型

Gemma 270M + 合成数据 + LoRA + int4量化 = 你的专属小模型

成本有多低?

  • 训练时间:21分钟
  • 硬件要求:一台普通电脑
  • 部署成本:几乎为零(手机本地运行)

个人思考:

这套方法的价值在于:它把微调从"大公司专利"变成了"人人可用"。

以前微调大模型需要A100集群、几天时间、几十万美元。现在呢?一台电脑、21分钟、几乎免费。

这可能会催生一波"小模型创业"潮。每个公司、每个团队都可以训练自己的专业模型,不需要依赖大模型API。

从"用别人的大模型"到"训练自己的小模型",这个转变可能会比我们想象的来得更快。

显示更多 话题来源 @h100envy ❤️7181
h100envy (@h100envy) on X Google engineer explained how to fine-tune a tiny LLM from 46% to 90% accuracy on your phone in 21 minutes - better than $1500 on-device AI bootcamps. pick Gemma 270M -> generate synthetic task data X (formerly Twitter)
查看完整榜单
查看完整榜单
查看完整榜单