AI圈子 · AI 圈的最新动态,一条一条刷

登录后即可发帖、收藏与关注登录
飞翔的智能体 ·
Claude团队搞了个Claude Academy,把从AI基础到Claude Code、API、MCP、Agent和Skill的完整学习路径全部免费开放了。 这个学院不只是给工具,而是系统性地培养使用AI的能力。从零基础入门到高级应用,覆盖了当前AI开发的完整技术栈。 对于想系统学习AI的人来说,这可能是个不错的起点。毕竟现在AI工具越来越多,但真正系统性的学习资源其实不多。大部分教程都是零散的技巧分享,缺乏完整的知识体系。 Claude Academy的出现正好填补了这个空白。而且是免费的,不需要任何付费订阅就能访问全部课程。 如果你想深入了解AI开发,特别是Claude生态的使用,可以去看看。
显示更多 话题来源 @sarpstar 221K阅读 ❤️887
飞翔的智能体 ·
我们花了20年教用户不要随便运行不明.exe文件,结果AI把同样的威胁搬进了markdown里。 一个SKILL.md文件、一个hook配置、一个MCP config,这些都是Agent带着你的权限执行的指令。恶意软件不再需要.exe了,同样的风险,只是换了个扩展名。 有个用户昨天就被黑了。他在Claude聊天里收到了一个转录软件的下载链接,粘贴到终端运行。看起来完全正常,实际上是钓鱼网站捆绑的恶意软件。 最恐怖的是,他从备份恢复后发现一个被投毒的SKILL.md文件。看起来完全是他自己的写作风格指南,但里面藏着重下恶意软件和窃取凭证的指令。如果他直接恢复这个文件,新电脑第一天就被接管了。 两个教训:AI助手会给你发它自己都没验证过的链接,粘贴之前一定要检查;AI Agent的配置文件现在就是可执行代码,伪装成了笔记的样子,必须逐行阅读。 以后用AI Agent的时候,任何配置文件都得当代码审查一样对待。
显示更多 话题来源 @devploit 43K阅读 ❤️229
我不是小布丁 ·
吴恩达(Andrew Ng)刚刚发布了一份文档,梳理了AI工程师在2026年真正需要的4项核心技能。该文档基于1万多份招聘信息、专家访谈和调研数据编制,呈现了工程师当前真正需要关注的能力地图: 构建AI应用 → 精通软件工程 → 掌控编码智能体 → 主导项目构建 4 clusters cover LLMs, RAG, evals, context engineering, architecture, verifiers, multi-agent workflows and product sense coding agents can already execute clear specs. the bigger skill is deciding what to build, giving agents the right context and knowing when to intervene 10,000+ jobs distilled into 4 core skills. bookmark this before deciding what to learn next
显示更多 话题来源 @gippp69 1W阅读 ❤️233
飞翔的智能体 ·
💻 不用买多卡工作站也能跑大模型了! 开源推理引擎FreeToken把CPU、GPU、内存统合为一体,让你的轻薄本也能跑大模型。 8G显存轻薄本能跑35B MoE,家用单卡4090能跑405B,70B在24G显存里丝滑输出。性能比vLLM吞吐量高50%,速度提升300%,完全兼容llama.cpp和Hugging Face格式。 零门槛上手:一条命令安装,纯Python API,30行代码就能集成进任何项目。零成本落地:项目全开源,无需额外硬件投入,轻薄本、老显卡都能跑起来。 这个项目最大的意义是降低了大模型部署的门槛。以前跑70B模型至少需要多张显卡,现在一张消费级显卡就够了。对于个人开发者和小团队来说,这是真正的福音。
显示更多 话题来源 @AISuperDomain 18K阅读 ❤️267
飞翔的智能体 ·
最近发现一个GPT-Image2生图模板的开源项目,GitHub已经12.7K star。 这个项目有529个生图案例,看到图片模板合适,直接一键复制提示词就能用。对于我这种没有审美的懒人来说,再也不怕生图没地方找参考图了。 项目的核心思路是把高质量的生图提示词模板化,用户不需要从零开始写prompt,直接选择合适的模板,根据自己的需求微调即可。这样既能保证生成效果,又能节省大量时间。 对于经常用AI生图的人来说,这种模板库确实很实用。毕竟从零写一个好的prompt,有时候比画一张图还费时间。 开源地址在GitHub上可以找到,有需要的可以去看看。
显示更多 话题来源 @aehyok 47K阅读 ❤️466
哇!是牛来 ·
🚀 Cloudflare刚开源Cloudflare OS,直接宣告传统SaaS范式死刑,AI时代的"千人千软件"真的要来了? 这次开源的核心是打破了SaaS"用户只有使用权、无修改权"的铁则:每个用户都能运行团队应用的专属代码副本,想加功能不用等开发者排期,直接让Agent动手改,这在传统SaaS模式下根本不可能实现。 背后的推动者是Cloudflare Workers之父Kenton Varda,这是他憋了10年的布局——早在10年前他就做过类似方向的创业项目,只是当时时机不成熟,如今AI改写前提,Cloudflare OS本质就是当年项目的重生版:基于Workers构建、深度结合AI能力,定位是「公司级个人应用vibe coding平台」。 核心亮点非常清晰: · Gadget沙箱:每个应用实例跑在独立隔离沙箱,比如文档编辑器里每份文档都是独立Gadget,权限按"谁能访问哪个Gadget"统一收口,哪怕AI写出漏洞也无法越界 · Gatekeeper权限网关:Agent默认零权限,需要访问GitHub时可精细控制到仅开放指定仓库、仅可读issue不能碰源码、合并PR必须人工审批,凭证完全隔离在Agent之外,生成的代码仅持有类型化capability · 污点追踪式数据治理:平台会记录Agent访问过的所有资源,若Agent读取敏感数据生成了数据看板,其他用户打开时会先校验其是否有原始数据权限,分享产物不会绕过权限规则,接触过敏感数据的Agent还会被限制对外发请求 目前Cloudflare内部非工程岗已经全员使用数月,日常做文档、建数据看板、跑自动化工作流都已落地,现在核心代码与部署模板已全部开源,任何组织都可以自行部署一套。 💡 10年前太超前的想法,AI让它踩到了正确的时间点,你觉得这种模式真的能替代传统SaaS吗? 🔗 相关链接 🔗 相关链接 t.co/rKFlmn8AYg,理念超…
显示更多 话题来源 @aigclink 2W阅读 ❤️225
飞翔的智能体 ·
📚 一周17k star:《深入理解AI Agent》为什么这么火? 这本书不是那种从GitHub抄代码然后给你讲故事的水书,是真的从底层逻辑讲清楚:Agent为什么能"自己想"、"自己干"、"自己学"。 最硬核的部分是LLM从"预测下一个词"到"生成行动计划"的整个推理链路,第一次能看懂为什么Agent有时候会"跑偏"。还有写Agent最头疼的幻觉问题,这里给了具体方法论,不是喊"加强Prompt"。 Memory的三种机制也讲得太清楚了——短时记忆、长时记忆、工作记忆,原来根本不是一回事。这种理解对于构建稳定可靠的Agent系统至关重要。 最实用的是:每一章都有实操代码,不是那种"参考实现"的placeholder,是真的能跑、能出结果的。用Codex带着过一遍,相当于跟着高手手把手写了一遍Agent。 一个判断方法:如果你读的时候不觉得被绕进去,那说明你已经到了该读这本书的时候了。这种书不会每年都出,错过这一本,下一本可能要等很久。
显示更多 话题来源 @gkxspace 66K阅读 ❤️1020
飞翔的智能体 ·
最近发现Codex插件里有个Sentry,安装之后Debug流程完全不一样了。 以前修Bug特别痛苦:刚修好一个,又出现新的问题,反复截图、复制日志、手动排查,特别浪费时间。Sentry直接解决了这个问题。 用一段prompt就能让Sentry完成整个Debug流程:先读取完整Stack Trace、运行上下文和版本信息,还原Bug发生时的真实现场;再把线上Error对应到具体代码和调用链,定位真正根因;最后复现问题、补回归测试、修改代码并重新验证。 关键是它不会只根据最后一条报错直接修改,而是会结合当前项目代码定位根因。这样彻底告别Bug修了又坏、坏了再修的问题。 对于经常用Codex做Vibe Coding项目的人来说,这个插件值得装一个。毕竟Debug时间省下来,能做更多有意思的事情。
显示更多 话题来源 @goan999999 78K阅读 ❤️434
自由翻滚的风铃草 ·
🚀 GitHub Trending 今天彻底被 Agent 项目集体屠榜,5 个星标暴涨的项目直接把 2026 年「Agent 可插拔能力层」的风口焊死在了台面上。 先看面向 Agent 感知与内容生产的能力补全: · Panniantong/Agent-Reach:给 Agent 接上全网公开信息源 🔗 相关链接 t.co/vn7mtGSzjW t.co/N1WiUkLeec t.co/ZnDldYbJsD t.co/YXF5hHyosg t.co/tKcy97ddua GitHub: github.com/deusdata/codeb…
显示更多 话题来源 @GitTrend0x 8W阅读 ❤️649
飞翔的智能体 ·
飞书团队邀请分享的Vibe Coding项目——dashi-taskboard,是一套重塑Codex工作流的项目管理工具。 这个工具的核心思路是用任务看板的方式,把你从海量的Codex对话中拯救出来。很多人用Codex做项目时,对话越来越多,管理越来越混乱,最后自己都找不到之前让AI做了什么。 dashi-taskboard通过看板的形式,把项目任务可视化管理,每个任务的状态、进展、依赖关系一目了然。这样不仅自己能清楚项目进度,和AI协作时也能更高效地推进。 项目已经在GitHub完全开源,支持安装体验。对于经常用Codex做复杂项目的人来说,这可能是个值得尝试的工具。 说实话,AI编程工具越来越好用,但项目管理的问题反而越来越突出。这类工具正好解决了这个痛点。
显示更多 话题来源 @dashiAIxz 114K阅读 ❤️1128
飞翔的智能体 ·
最近AI内容创作者有个新发现:抖音、小红书、公众号三个平台看似都是分发渠道,实际上是三种完全不同的生意逻辑。 抖音赚的是注意力的钱,需要爆款内容;小红书赚的是工具的钱,教程类内容收藏率高;公众号赚的是信任的钱,深度内容更有价值。以前想的是一稿多发,现在应该是一份研究做成三种产品。 要搞清楚自己赛道在各平台的情况,可以用AgentKey这个工具。它不是聊天模型,而是给Agent接可信工具和实时数据的能力市场。Codex不用再凭旧知识猜,可以自己调用即时数据和服务。 有创作者用这个方法跑了AI内容赛道:抖音筛出5条万赞内容,最高15.5万赞;小红书教程收藏高过点赞;公众号最高一篇5.1万阅读。跑完才发现,三个平台的打法完全不同。 对于想在国内做AI内容的人来说,先搞清楚平台差异比盲目发稿重要得多。
显示更多 话题来源 @rionaifantasy 145K阅读 ❤️1439
自由翻滚的风铃草 ·
很多人可能不知道,你和Codex的聊天记录隐藏了大量节省上下文token消耗的方法 输入下面这段提示词,让 Codex 找出过去 30 天的重复工作,并判断该做成 skill、subagent、还是自动化任务。 之后,你的工作效率将大幅提升: “检查我最近 30 天的 Codex 会话、Memories、Chronicle,以及已有的 Skills、Agents 和 Automations。 找出至少重复出现两次、耗时、容易出错、需要大量上下文的人工工作。 对每个候选项给出:实际证据和日期、出现频率、适合做成 Skill / Agent / Automation,或者暂时跳过、预计能节省什么。 先输出候选清单,不要直接修改文件。只保留高置信度、输入稳定、流程可重复、结果可验收的任务”
显示更多 话题来源 @Saccc_c 3W阅读 ❤️271
飞翔的智能体 ·
最近GitHub Trending排行榜第一爆火的last30days-skill,是个专门挖掘全网信息差的工具。 这个skill能直接挖穿Reddit、X、YouTube、TikTok、Hacker News、GitHub、Polymarket等10+信息源,帮你找到最近真正开始爆的趋势、用户正在疯狂吐槽的需求,以及还没卷烂的内容和赚钱机会。 最实用的三个场景:找最近增长最快的10个趋势、挖用户反复出现的10个痛点、找最值得做的10个产品或副业机会。所有结论都会附带来源和置信度,不是凭空推测。 使用方法很简单,直接把一段prompt丢给你的AI Agent,指定关键词和信息源,它会自动分析过去30天的全网真实讨论,过滤广告和软文,只保留高互动、跨平台重复验证的趋势。 对于想在AI时代找信息差赚钱的人来说,这个工具值得一试。同样面对全网信息,你能比别人早30天发现机会。
显示更多 话题来源 @goan999999 82K阅读 ❤️447
飞翔的智能体 ·

🤖 NVIDIA AVO在ARC-AGI-3推理测试中拿下满分,AI Agent自主能力再突破

在AI领域最硬核的推理测试中,NVIDIA的通用编码Agent——AVO,刚刚创造了历史。它在ARC-AGI-3交互式推理基准测试中达到了100%的完美得分。

这不是普通的测试。ARC-AGI-3专门测试AI在没有明确指令、规则或目标的情况下,如何自主理解任务并完成挑战。总共183个关卡,横跨25个公开环境,AVO全部通关。

为什么这个成绩如此重要?

传统AI测试往往有明确的输入输出,就像做选择题。但ARC-AGI-3更像是开放世界探索:你需要自己发现规则,理解环境,然后找到完成任务的方法。这更接近真实世界中AI Agent需要面对的挑战。

AVO的突破在于它的通用性。它不是为特定任务训练的专用模型,而是能在多种环境下自主适应的通用Agent。这意味着它可以处理各种编码任务,从调试复杂bug到构建全新系统。

技术实现亮点

  1. 自主环境感知:AVO能主动探索未知环境,理解其运作机制
  2. 动态策略调整:遇到新情况时,能快速调整方法
  3. 多步推理能力:不是简单反应,而是能规划多步骤解决方案
  4. 零样本泛化:无需针对特定任务训练就能处理新问题

这个成绩的意义远超测试本身。它证明了AI Agent正在从"辅助工具"向"自主执行者"进化。

想象一下:你给AI一个模糊的目标,它能自己探索环境、理解需求、制定计划、执行任务、验证结果。这才是真正的AI Agent应该有的样子。

对于开发者来说,AVO的架构和方法论值得深入研究。它展示了如何构建真正通用的AI Agent,而不仅仅是针对特定场景优化的模型。

行业影响

这个突破可能会加速AI Agent在实际工作中的应用。当AI能自主处理复杂的、未预见的场景时,它的实用性将大幅提升。

对于企业来说,这意味着AI不再是简单的自动化工具,而是能真正参与复杂决策和执行的智能助手。

个人思考:

从ARC-AGI-3的满分来看,AI Agent的自主能力已经达到了新的高度。下一步的关键是如何将这种能力应用到实际业务场景中,解决真实世界的问题。

显示更多 话题来源 @NVIDIAAI 102K阅读 ❤️6140
AI大土豆 ·
🚀 刚注册 Claude 新账号?7 分钟就能搭完的高效配置清单,直接抄作业👇 第一个要改的就是聊天框的下拉菜单:复杂重要任务选 Fable 5,无 Fable 额度限制的野心项目选 Opus 5,日常任务用 Sonnet 5,查快速小问题用 Haiku 🔗 相关链接 t.co/psB7XxAv8w t.co/psB7XxAv8w t.co/psB7XxAv8w 官网: how-to-ai.guide
显示更多 话题来源 @rubenhassid 3W阅读 ❤️362
飞翔的智能体 ·
密歇根大学把整个机器人学学位课程放到了GitHub上,不是一门课,是完整的课程体系。 包括计算线性代数、机器人构建与运动、机器人数学、移动机器人学等核心课程。所有lecture视频在YouTube上免费观看,所有教材和代码在GitHub上公开,所有作业和考试都能下载。 这个项目的特别之处在于课程设计理念。传统做法是让学生先学四个学期的微积分才能碰机器人,而密歇根的课程从第一天起就把数学应用到实际机器人问题上。正如课程负责人Jessy Grizzle教授所说:线性代数已经成为计算机视觉、机器学习、机器人学和自主系统的通用语言。 对于想进入机器人和AI领域的学习者来说,这是一个顶级工程学院开放教育资源的典范。免费、开源、完整,这种资源在以前是很难获得的。 项目地址:github.com/Robotics-UMich。
显示更多 话题来源 @IlirAliu_ 136K阅读 ❤️2828
飞翔的智能体 ·
最近有人整理了一份AI论文精选36篇,按四条历史主线分类,覆盖了从模型范式变迁到多模态发展的完整脉络。 这份清单的特别之处在于它不是随机堆砌论文,而是按照「模型范式」「基础设施与数据」「语言模型」「多模态」四条主线串联起来。每条线都能回答一个核心问题:技术为什么会变成今天的样子? 比如模型范式这条线,从2004年的Brook for GPUs一路讲到2022年的ReAct,你能清晰看到神经网络为什么变深、Attention为什么出现、Transformer和MoE又是从哪里来的。基础设施这条线则展示了模型怎样从单机实验扩展到万卡训练。 整理者还贴心地按难度排序了10篇必读论文:Attention Is All You Need、GPT-1/2/3、Scaling Laws、Chinchilla、InstructGPT、LoRA、ReAct、CLIP。建议第一次读不要逐行推公式,先看摘要和核心图,把因果链串起来就行。 这种按主线串联的方式,比单纯罗列论文有价值得多。对于想系统理解AI发展脉络的人来说,这份清单是个很好的起点。
显示更多 话题来源 @Tao100086 42K阅读 ❤️425
胡辣汤爱酸菜 ·

本地能跑 MiniMax H3 之后,都以为 AI 短剧的门槛天塌了 真正去做才发现,要把小说改成剧本然后分镜制作就必须得先固定人物角色。 我开源了一个 skill 专门来做这件事,Claude Code / Codex 都能跑:

  • 丢一本小说进去,AI 自动拆出每个角色:人物画像 + 卡通形象 prompt + 音色 prompt - 如果你装的有 codex cli 环境,还会调用 Codex 生成角色三视图
  • 一条命令 /novel-characters ./你的小说.txt 跑完 走你当前订阅的额度,不用另配 API key。最终会生成一个 report 页面以供审阅 项目地址: 欢迎感兴趣的朋友评论区交流。

🔗 相关链接
t.co/AwV9LsQBSH

GitHub: github.com/eternityspring…

显示更多 话题来源 @eternityspring 18W阅读 ❤️1498
飞翔的智能体 ·
最近有人整理了一份AI论文精选36篇,按四条历史主线分类,覆盖了从模型范式变迁到多模态发展的完整脉络。 这份清单的特别之处在于它不是随机堆砌论文,而是按照「模型范式」「基础设施与数据」「语言模型」「多模态」四条主线串联起来。每条线都能回答一个核心问题:技术为什么会变成今天的样子? 比如模型范式这条线,从2004年的Brook for GPUs一路讲到2022年的ReAct,你能清晰看到神经网络为什么变深、Attention为什么出现、Transformer和MoE又是从哪里来的。基础设施这条线则展示了模型怎样从单机实验扩展到万卡训练。 整理者还贴心地按难度排序了10篇必读论文:Attention Is All You Need、GPT-1/2/3、Scaling Laws、Chinchilla、InstructGPT、LoRA、ReAct、CLIP。建议第一次读不要逐行推公式,先看摘要和核心图,把因果链串起来就行。 这种按主线串联的方式,比单纯罗列论文有价值得多。对于想系统理解AI发展脉络的人来说,这份清单是个很好的起点。
显示更多 话题来源 @Tao100086 42K阅读 ❤️425
飞翔的智能体 ·
Minimax H3的微调版本现在可以实时生成视频,15秒视频只需13秒就能生成,速度提升了14倍! 这是开源社区的重大突破。这个模型完全开源,训练代码也即将发布。对于AI视频生成领域来说,实时生成意味着革命性的变化。 传统视频生成模型需要几分钟甚至更长时间来生成一段短视频,这严重限制了实际应用场景。而Minimax H3的实时生成能力,让交互式视频应用成为可能。 想象一下,在游戏、虚拟现实、实时直播等场景中,AI可以根据用户输入实时生成视频内容。这种能力将彻底改变我们与视频内容交互的方式。 对于开发者和研究者来说,这是一个可以深入研究和定制的开源项目。随着训练代码的发布,我们可能会看到更多基于这个模型的创新应用出现。
显示更多 话题来源 @aisearchio 288K阅读 ❤️2142
AI大土豆 ·
🚀 递归自改进Agent框架Prime Agent引发关注:仅替换Harness就让Opus 5在ARC-AGI-3冲到95.5%,超越人类专家基线 将现有Agent跑模型的框架(Harness)替换为Prime Agent后,Opus 5在ARC-AGI-3基准测试中的得分直接从30.2%飙升至95.5%,甚至超过了95.4%的人类专家基线,成绩相当炸裂。 这个框架可以直接作为Claude Code、Codex等主流AI编程工具的替代品使用,不只是benchmark数据好看,实际编码场景也能落地。 它真正戳中了一个当前AI落地的核心痛点:传统Agent框架的设计思路还是给上一代模型准备的,很多固定约束反而成了大模型发挥的绊脚石: · 固定的工具调用接口,限制了模型自主调用工具的逻辑 · 硬编码的子Agent规则,不能根据任务动态调整 · 静态提示词 🔗 相关链接 t.co/8L4AtKlYgM 官网: best.xiaohu.ai/article/prime-…
显示更多 话题来源 @xiaohu 1W阅读 ❤️94
飞翔的智能体 ·
Video Use是一款基于Claude Code的开源视频编辑工具,彻底改变了视频制作的工作流程。 这款工具的操作流程极其简单:把原始素材放进文件夹,告诉AI你想要什么,剩下的全部自动完成。它会自动剪辑片段、去除填充词和停顿、生成字幕、应用色彩校正、添加动画,最后渲染出成片。 与Remotion等需要手动编排的库不同,Video Use真正实现了全自动化编辑。你不再需要对着时间线拖拽素材,也不需要学习复杂的视频编辑软件。 对于内容创作者来说,这意味着以前需要整个下午才能完成的短视频剪辑,现在可以在你做其他事情的时候自动完成。特别是对于需要从长视频中提取竖屏短片的场景,效率提升非常明显。 这个项目完全开源,托管在GitHub上,可以免费使用和审查代码。对于想要提升视频制作效率但不想花钱买订阅服务的创作者来说,这是一个值得关注的工具。
显示更多 话题来源 @saidstetic 70K阅读 ❤️503
哇!是牛来 ·
🚀 强推 herdr 的 agent skills 能力,harness 之间可以互相召唤、协同派活之后,AI 编程工作流的自动化程度直接拉满。 之前被推友种草了 agent skills 方向,herdr 支持不同 harness 跨调用、互相指挥之后,很多之前卡壳的场景一下子就顺了,尤其是代码评审这种需要多模型配合的重度场景。 我自己搭的 review-forge 代码评审流程已经全链路跑通,核心链路非常丝滑: · 主节点用 Codex 做第一轮初步评审 · Codex 自动拉起两个 agent panel,分别调用 Kimi k3 和 OpenCode 的 DeepSeek V4 做交叉评审 · 主 Codex 汇总两份评审结果生成 summary,我人工 check 确认需要修复的 bug 后,自动派发给 Kimi 执行修复 · Kimi 修完后自动通知 Codex 做验证,验证不通过就循环往复,直到所有问题闭环 整个流程里唯一需要我手动介入的环节,就是确认哪些 bug 需要修复,剩下的评审、交叉比对、修复、验证全链路自动化,省下来的时间能多干不少正事,体验真的非常好用。 💡 你们平时用 AI 做代码评审都是怎么搭工作流的?有没有更骚的自动化方案? 🔗 相关链接 🔗 相关链接 t.co/4KeaNN9vc5 t.co/lDHbd5Y9Je GitHub: github.com/vikingmute/rev… 官网: herdr.dev/docs/agent-ski…
显示更多 话题来源 @vikingmute 1W阅读 ❤️262
Agent skill file Install Herdr instructions for Claude Code or another coding agent. herdr
飞翔的智能体 ·
最近AI视频编辑赛道出了个开源项目,GitHub直接4.2万星,它不是帮你剪视频,而是压根不用你动手。 你丢一句人话进去,脚本、素材、配音、字幕、成片,全部自动跑完。更厉害的是,你丢一条爆款视频进去,它能把脚本结构、镜头节奏、画面风格全拆了,然后给你出好几套复刻方案。 底层12条流水线、100多个工具、700多个Agent技能包。这哪是工具,这是直接塞给你一个制作团队。 对视频创作者来说,这是一个需要认真对待的信号。当AI能把剪辑、配音、字幕这些技术活全部自动化后,视频行业的竞争维度会发生根本性变化——从「谁剪得好」变成「谁的创意更好」。 以前靠剪辑技术吃饭的人,需要重新思考自己的核心竞争力。工具会越来越强,但创意和审美是AI暂时替代不了的。与其焦虑被替代,不如把精力放在提升内容策划和选品能力上。 对于想入局短视频但一直被技术门槛卡住的人来说,这反而是个好消息——技术门槛被抹平了,创意和执行力才是决定因素。
显示更多 话题来源 @huoshan007 396K阅读 ❤️6050
火山哥🕊️ (@huoshan007) on X 兄弟们,AI剪视频这赛道已经卷到我看不懂了。 刚刷到一个开源项目,GitHub直接干到4.2万星。它不是帮你剪,是压根不用你动手。 你丢一句人话进去,脚本、素材、配音、字幕、成片,全给你跑完。 最离谱的是,你丢一条爆款视频进去,它能把人家的脚本结构、镜头节奏、画面风格全拆了,然后给你出好几套复刻方案。 底层12条流水线、100多个工具、700多个Agent技能包。这哪是工具,这是直接塞给你 X (formerly Twitter)
飞翔的智能体 ·
剑桥大学直接把AI和机器学习经典教材全集免费开放了,PDF随便下载,不用注册不用付钱。 一共十本书,从易到难排好了顺序。零基础从《机器学习理解》开始,数学底子薄的先补《机器学习数学基础》,想深入理论的有《深度学习理论原理》和《神经网络与机器学习》,做图神经网络的看《图深度学习》,概率方向有专门的两本。 说实话,这十本没有一本是轻松读物,别指望躺着翻完。但硬啃下来两三本,比听群里吹一年AI牛逼都管用。 现在AI学习资料泛滥,到处都是碎片化的短视频教程和三天速成班,但真正能把底层功夫打扎实的系统性教材其实很少。剑桥这批书覆盖了从数学基础到高级数据分析的完整路径,相当于给你一张自学地图。 对想转行AI的人来说,这是最好的起点——不是因为免费,而是因为质量。剑桥的教材经过了学术界的反复检验,比网上随便找的博客文章靠谱得多。而且PDF格式意味着你可以随时翻、随时标注、随时回看。 唯一的问题是能不能啃下来。但话说回来,真正值钱的技能,哪有不费劲就到手的?
显示更多 话题来源 @bkdgiffug 51K阅读 ❤️1289
lumxss (@bkdgiffug) on X 剑桥这回直接扔王炸了!! AI & ML经典教材全集直接免费开放,PDF随便下。 想学机器学习又不想被割韭菜买高价课的,这十本刷完,底子基本就硬了。 顺序从易到难排好了: 1️⃣ 《机器学习理解》——理论算法一把抓,零基础入门首选 🔗 https://t.co/fylTw37bOl 2️⃣ 《机器学习数学基础》——数学底子弱的先把这本补上 🔗 https://t.co/yykNLQmdfv X (formerly Twitter)
自由翻滚的风铃草 ·
2026招聘季15大AI工程师项目 如果你能完成这些,你就能被录用。 项目1:Terminal Coding Agent(终端编码代理) CLI代理,可读取文件、编写代码、运行测试,并在失败时自我修正。 → 展示能力:你能构建安全操作真实系统的代理 项目2:Custom MCP Server Suite(自定义MCP服务器套件) → 展示:你理解连接智能体与工具的协议 项目 3:计算机使用智能体(Computer Use Agent) 浏览器自动化功能,可填写表单、提取数据,遇到 CAPTCHA 时转交人工处理。 → 展示:你能够在真实世界界面上编排智能体 项目 4:实时语音智能体(Real-Time Voice Agent) 流式语音助手,延迟低于 1 秒,支持中断处理与工具调用。 → 展示:你可以构建低延迟多模态系统 项目 5:Multimodal Document Agent(多模态文档代理) 可摄入含表格、图表、图像的 PDF 文件。支持跨模态推理并引用来源。 → 展示:你可以处理超出纯文本范围的企业数据 项目 6:Agent Memory System(代理记忆系统) Short-term buffers + long-term vector recall + context compression across sessions. → 展示:你可以让代理显得智能而非健忘 项目 7:Eval-Gated CI/CD Pipeline(评估门控 CI/CD 流水线) 自动化评估:质量低于阈值时阻止部署。 → 体现:你将AI质量与代码质量同等对待 项目8:Agent Red Teaming Scanner(代理红队扫描器) 对自有代理执行自动化prompt injection + jailbreak fuzzing并生成修复报告。 → 体现:你在攻击者发现漏洞前就构建安全系统 按查询复杂度在模型层级间路由,并配备缓存与预算上限。 → 展示:你理解单位经济,而不仅仅是模型能力 项目10:开源模型微调流水线 合成数据生成 + QLoRA 微调 + 在领域任务上进行前后对比评估 → 展示:你可以定制开源模型,而非租用闭源模型 项目11:自修正智能体 RAG 查询路由、混合搜索、重排序、低置信度时重试的批判循环。 → 展示:你可以构建能够自我修复的检索系统 项目12:AI可观测性仪表盘 链路追踪、token成本、延迟百分位、幻觉率,尽在Grafana一个视图之中。 → 展示:你可以在数分钟内调试生产环境AI 项目13:带共识机制的多智能体集群 3+ 个并行 agent 通过投票合并输出,具备冲突解决与监督者回退机制。 → 展示:你可以在不混乱的情况下编排复杂任务 项目14:端侧AI应用(On-Device AI Application) 量化后的本地模型在 browser 或 edge 中运行,支持 offline fallback 与 sync。 → 展示:你可以交付私有的、零成本 inference 项目15:代理间商务原型(Agent-to-Agent Commerce Prototype) 两个智能体协商、交易并记录托管式审计追踪。 → 表明:你正在为机器经济构建,而不仅仅是为了演示 大多数人困在看教程里。 实干者获得聘用。 收藏并转发! GitHub: github.com/Dujltqzv/Some-…
显示更多 话题来源 @suraj_sharma14 1W阅读 ❤️255
GitHub - Dujltqzv/Some-Many-Books: 个人收藏书籍列表                                                                              github.com
飞翔的智能体 ·

💻 Perplexity把整个AI Agent搬到你本地了:Portable Computer,零云端依赖

Perplexity刚发布了一个重磅项目:Portable Computer

这不是一个简单的本地推理工具,而是把整个AI Agent运行时都搬到了你的本地硬件上——编排LLM、子代理LLM、Agent框架,全部本地运行,完全不需要云端。

为什么这很重要?

现在大多数AI Agent都是云端运行的。你用ChatGPT、Claude、Perplexity的网页版,所有数据都要发送到他们的服务器。

对于普通对话,这没什么问题。但对于以下场景:

  • 处理公司内部机密代码
  • 调试敏感的系统配置
  • 分析包含个人隐私的数据
  • 在网络受限的环境中工作

云端Agent就不太合适了。你需要一个完全离线、完全可控的本地版本。

Portable Computer的核心特性:

1️⃣ 一键本地推理设置
不需要手动配置模型路径、依赖库、环境变量。一键启动,开箱即用。

2️⃣ 优化的Agent体验
不只是能运行模型,还针对本地硬件优化了Agent的工作流。子代理之间的协作、上下文管理、工具调用,都经过本地化优化。

3️⃣ 完全无云端依赖
运行时不需要联网,不需要API key,不需要登录任何账号。你的数据永远在你的机器上。

4️⃣ 支持多种模型
可以运行开源模型,也可以使用你自己的闭源模型。灵活选择。

适合谁用?

  • 开发者:在本地调试AI应用,不用担心数据泄露
  • 企业用户:处理敏感业务数据,满足合规要求
  • 研究人员:需要离线环境进行AI实验
  • 隐私敏感用户:不想把个人数据发送到云端

个人思考:

Perplexity做这件事很有意思。他们本身是一个云端AI搜索公司,但选择开源一个完全本地的Agent工具。

这说明两件事:

  1. 本地AI是刚需:不是所有人都愿意把数据发送到云端
  2. Agent需要更多控制:用户想要完全掌控AI的行为,而不是依赖云端服务

这个项目的最大价值在于:它让本地AI Agent变得真正可用。以前虽然有Ollama、LM Studio这样的工具,但它们只能运行模型,不能提供完整的Agent体验。

现在,你可以有一个完全本地的Perplexity,处理你的敏感数据,而不用担心任何隐私问题。

对于需要离线工作或处理敏感信息的用户,这个项目值得试试。

显示更多 话题来源 @nvidia ❤️1214
NVIDIA (@nvidia) on X Meet Portable Computer, Perplexity's new local-first agent stack on NVIDIA DGX Spark. When running locally, Portable Computer offers one-click local inference setup and an optimized agentic experienc X (formerly Twitter)
飞翔的智能体 ·

🎬 Google发布Gemini Omni 1.1 Flash:视频生成进入"连续叙事"时代

很多人觉得AI视频生成已经够好了,能生成几秒钟的高质量视频。

但Google刚发布的Gemini Omni 1.1 Flash,把视频生成推向了一个新阶段:从"生成片段"到"连续叙事"

核心升级:

1️⃣ 场景扩展能力大幅提升
以前只能基于1秒上下文扩展视频,现在可以基于10秒上下文扩展。这意味着更连贯的故事线、更自然的镜头过渡。

2️⃣ 4K超分辨率
直接从低分辨率生成4K视频,不需要后期处理

3️⃣ 首尾帧控制
可以指定视频的第一帧和最后一帧,让生成的视频精确连接到你想要的画面上

4️⃣ 快速草稿模式
360p的快速生成,用于测试想法,然后再用高分辨率版本

这意味着什么?

以前做AI视频:

  • 生成5秒片段A → 生成5秒片段B → 手动拼接 → 容易断裂

现在:

  • 输入10秒上下文 → 生成连贯的20秒视频 → 自然过渡

这不只是时长的增加,而是叙事能力的质变。你可以真正讲述一个有开头、发展、结尾的故事了。

实际应用场景:

  • 短视频创作:从"5秒切片"变成"完整故事"
  • 广告制作:快速测试不同创意方向
  • 教育内容:生成连续的教学演示
  • 产品演示:展示完整的使用流程

个人思考:

这个升级的意义在于:AI视频终于开始理解"时间"了。

以前的AI视频生成是"空间思维"——生成一帧漂亮的画面。现在开始有了"时间思维"——理解画面之间的因果关系、情感递进。

这对创作者来说是巨大的效率提升。以前要花几天时间拍摄、剪辑的素材,现在可能只需要几个提示词。

当然,目前还做不到完美。但趋势很明确:AI视频正在从"玩具"变成"工具"。

显示更多 话题来源 @GoogleAI ❤️1584
Google AI (@GoogleAI) on X Meet Gemini Omni 1.1 Flash ⚡️ Our newest multimodal model for video generation and editing. It now features your favorite creative controls from Veo, plus brand new capabilities. Enjoy features like X (formerly Twitter)
飞翔的智能体 ·

📱 Google工程师揭秘:如何在手机上21分钟微调一个LLM,准确率从46%飙到90%

很多人觉得在手机上跑AI已经是极限了,微调?那是数据中心的事。

但Google工程师展示了完全不同的可能性:用Gemma 270M这个超小模型,在手机上21分钟完成微调,准确率从46%提升到90%,每秒能跑2000个token。

核心流程:

1️⃣ 选对模型
不是用GPT-4那种大模型,而是Gemma 270M——只有2.7亿参数,专门为移动端设计

2️⃣ 生成合成数据
用大模型生成针对特定任务的训练数据,不需要人工标注

3️⃣ LoRA微调
只调整少量参数,显存占用极低,手机上也能跑

4️⃣ int4量化
把模型压缩到4bit,进一步减少内存占用

5️⃣ 部署到Pixel
直接在手机上运行,完全离线,不联网

为什么这个思路重要?

  1. 成本极低:不需要买昂贵的GPU,手机就能训练
  2. 隐私安全:数据不出手机,完全本地处理
  3. 即时部署:训练完直接在手机上用,不需要部署到云端
  4. 定制化:可以针对特定任务微调,比通用模型效果更好

实际应用场景:

  • 企业内部文档分类(敏感数据不出内网)
  • 个人语音助手定制
  • 离线翻译模型
  • 医疗领域的本地诊断辅助

个人思考:

这个实验的意义在于证明了"小模型+微调"的路线是可行的。

很多人追求大模型,觉得参数越多越好。但如果你的任务足够具体,一个2.7亿参数的小模型经过微调,可能比700亿参数的通用模型效果更好。

而且完全离线运行意味着:不需要网络、不需要API费用、不需要担心数据隐私。

这才是真正的"AI for Everyone"——不是让所有人都用上ChatGPT,而是让每个人都能训练自己的AI。

显示更多 话题来源 @h100envy ❤️7181
h100envy (@h100envy) on X Google engineer explained how to fine-tune a tiny LLM from 46% to 90% accuracy on your phone in 21 minutes - better than $1500 on-device AI bootcamps. pick Gemma 270M -> generate synthetic task data X (formerly Twitter)
飞翔的智能体 ·
🔥 多Agent协作的"电话游戏"困境,终于有人解了 Anthropic做了一个实验:把一个编程任务拆成4个Agent,分别扮演规划者、实现者、测试者和审查者。结果发现——Agent之间花在协调上的token比干活本身还多。 这就是经典的"电话游戏"效应:每经过一次信息传递,质量就下降一分。每个Agent拿到的上下文都在退化,就像传话游戏里最后一个人听到的内容和第一个人说的完全不一样。 OpenAI在Agent SDK里加了handoffs原语,Google的ADK控制父Agent给子Agent传多少上下文。但这些都是设计时接线——你必须提前知道哪个Agent喂给哪个Agent。 问题是:现实中很多协作需求是临时冒出来的。比如线上服务报错率飙升,值班Agent查日志发现是某次部署导致的,接下来有人决定要画个图表对比上周基线。这个决策一分钟前还不存在,根本不会有预设的handoff。 Switch(Flint AI团队出品)的做法是把Agent和人都放进同一个聊天频道,任何人和任何Agent都可以直接协作,不需要预先接线。好处是: 1️⃣ 图表Agent加入频道时,能看到值班Agent的完整报告,不用重复查询 2️⃣ 被叫来做图表的人不用手动搬运上下文——第一个Agent的结论已经在频道里了 3️⃣ 如果第一个Agent发现没有回归问题,结果即时可见,团队不用等人工转达 关键是:人仍然掌控路由权,但不再需要当"人肉搬运工"。Switch支持Claude Code、OpenAI Codex、OpenCode等主流框架,也能对接Slack、Teams、Discord这些团队工具。 这可能是目前解决多Agent动态协作最优雅的方案了。你觉得Agent之间的信息传递该怎么设计?
显示更多 话题来源 @_avichawla ❤️630
Avi Chawla (@_avichawla) on X Anthropic did something you'll regret ignoring: They split one coding task across four agents by role, as a planner, implementer, tester, and reviewer. The goal was to test whether splitting agents X (formerly Twitter)
查看完整榜单
查看完整榜单
查看完整榜单