AI圈子 · AI 圈的最新动态,一条一条刷

登录后即可发帖、收藏与关注登录
飞翔的智能体 ·
刷到一个GitHub上4.2万星的开源项目,直接把AI视频剪辑的门槛踩到了地板上。 它的逻辑很简单:你丢一句人话进去,脚本、素材、配音、字幕、成片,全自动跑完。不用你动手剪一刀。更狠的是,你丢一条爆款视频进去,它能把人家的脚本结构、镜头节奏、画面风格全部拆解,然后给你生成好几套复刻方案。 底层是什么配置?12条流水线、100多个工具、700多个Agent技能包。这已经不是工具了,这是一个完整的制作团队塞进了你的命令行。 以前做短视频,从脚本到成片最少半天。现在?一句话的事。而且它不是那种粗糙的自动拼接,是真的在理解内容逻辑后进行创作。 说实话,看完之后有个很真实的感受:如果这个东西真的好用,那学剪辑的时间是不是可以省下来了?当然,工具再强也得看怎么用,但至少对于中小创作者来说,从0到1的门槛已经被拉到了几乎为零。 AI正在重新定义「会做视频」这件事的含义。
显示更多 话题来源 @huoshan007 ❤️6049
小白爱摸鱼 ·
昨天帮朋友改一张AI生成的海报,他想把画面里的杯子从左边挪到右边。我试了三个不同的AI工具,每次一挪杯子,整个背景全变了——花瓶没了、窗帘颜色变了、连光影方向都反了。这种改一处动全身的毛病,AI绘图圈子里叫「一致性难题」,困扰了整个行业好几年。 今天阿里放出的Qwen-Image-Layered,直接把这个难题给解了。 它做了一件很简单但很颠覆的事:让AI学会「分层」。以前的视觉模型看图片就像看一张压扁的纸,所有元素糊在一起。新模型引入了Alpha通道,把图片拆成前景、背景、遮挡物等多个图层,每个图层独立编辑互不干扰。 具体能干什么? 把画面里的人往左挪20厘米,背景自动补全,边缘过渡自然到看不出痕迹。把某个产品的颜色从红色改成蓝色,其他元素纹丝不动。甚至可以单独调整某个图层的光影,而不用重新生成整张图。 训练方法也很聪明——团队从海量PSD文件里提取真实的图层逻辑,让模型从一开始就具备「分层思维」,而不是事后硬拆。 对于做商业设计、UI、影视后期的人来说,这基本意味着AI生图终于从「碰运气」变成了「可控制的生产力工具」。模型已在魔搭和HuggingFace开源,可商用。 相关链接 soft.china.com/article/284473…
显示更多
飞翔的智能体 ·
说个真事,上周我用AI生成了一张产品海报,客户说「把左边的猫往右挪10厘米」,结果AI直接重新生成了一张完全不一样的图。猫变了、背景变了、连色调都变了。这种「牵一发而动全身」的随机性,一直是AI绘图在专业设计领域的致命伤。 但今天阿里开源的Qwen-Image-Layered,可能真的要改变这个局面了。 🚀 这个模型到底牛在哪? 简单说,它让AI生图第一次拥有了「图层」概念。以前的视觉大模型理解图片是扁平的——一堆像素点挤在一起,分不清前景背景、远近遮挡。Qwen-Image-Layered通过自研的RGBA-VAE编码,在传统RGB图像中引入了Alpha通道(透明度图层),让模型天然具备分层思维。 这意味着什么? · 你可以单独移动画面中的某个元素,背景自动补全,不会「穿帮」 · 编辑某个图层时,其他图层完全不受影响,真正实现「零漂移」精准编辑 · 模型能自动「脑补」被遮挡部分的背景纹理,空间理解能力大幅提升 💡 为什么说这是专业级突破? 千问团队从海量PSD文件中提取真实图层逻辑来训练模型,相当于让AI从「出生」起就拥有专业设计师的分层思维。配合VLD-MMDiT架构和图层级3D位置编码,它不再是简单的「像素预测」,而是真正的「结构重组」。 对于设计师、动画和影视制作人员来说,这意味着AI生图不再是死板一块,而是一个活生生的、可无限调整的素材库。商业广告、UI设计、影视后期这些对精度要求极高的场景,终于有了可用的AI工具。 目前模型已在魔搭社区和HuggingFace开源,可免费商用。阿里至今已开源近400个千问模型,全球下载量突破7亿次。 🔗 相关链接 soft.china.com/article/284473…
显示更多
会飞的荧 ·

DeepSeek 发布 Harness 的时候,做了一件很不寻常的事:他们没有像大多数科技公司一样写一篇技术博客,而是直接发了一篇论文,A Programming Paradigm for Spatiotemporal Composability。

别人发布一个 Agent Harness,通常会告诉你有哪些 tools,怎么接 MCP,怎么做 memory,怎么 orchestrate agents。DeepSeek 却在用形式化定义、数学符号和演算体系解释 Cordis 背后的编程范式:effect、coeffect、context transformation、inverse,一个组件如何加入系统、如何撤销,依赖关系如何随着运行时状态动态变化,甚至试图从理论上说明这套 programming model 为什么成立。

非常另类,也非常与众不同,让人耳目一新。 这种气质,和论文作者之一、DeepSeek Harness 负责人崔添翼的背景密不可分。

崔并不是典型的 AI researcher。在加入 DeepSeek 之前,他在 Jane Street 工作了大约九年。

Jane Street 在程序员世界里是一个很特殊的存在。它虽然是一家量化交易公司,却以 functional programming、type system、formal reasoning 和对软件正确性的执着而闻名,甚至长期把 OCaml 这种极少出现在普通互联网公司的函数式语言作为核心生产语言。

崔添翼当年放弃 Google offer 选择 Jane Street,其中一个重要原因,就是他希望真正使用 OCaml 和函数式编程。

所以当你今天打开这篇论文,会发现这种思考方式一脉相承:系统最基本的抽象是什么,有哪些不变量,一个 component 加进来以后改变了什么,离开以后这些变化能不能被完整撤销。这正是 Jane Street 式的 formal reasoning 在一套 agent 系统设计上的延伸。

Cordis 很有创造性的把这个问题归纳为两个维度:Temporal composability,一个组件退出时,它产生的副作用能够被完整撤销;Spatial composability,组件只需要声明自己的依赖,runtime 会随着 context 的变化动态管理这些依赖。

如果说 Shigma 孤梦星影带来了 Cordis 这套架构,那么崔添翼为什么会如此自然地接受、推动,甚至把它形式化成论文? 这也许可以从他更早的经历里找到答案。

二十年前,他写过在中国算法竞赛圈影响很大的《背包问题九讲》。背包问题表面上是在研究"有限容量里怎么选择物品",但真正训练的是另一种能力:如何找到正确的状态表示,把复杂约束转化成统一模型,再通过局部状态转换组合出整个问题的解:状态、转换、依赖、抽象、组合。

二十年后,问题从"如何组合一组物品",变成了"如何组合一个不断变化的软件系统"。对象完全不同,但这种思维方式如出一辙。

于是你再看 DeepSeek Harness 最核心的设计理念:Everything is a Plugin。model 是 plugin,tool 是 plugin,session 是 plugin,甚至 agent loop 本身也是 plugin。系统不再围绕某个固定 agent 构建,而是围绕"如何动态组合这些能力"来构建。

这种视角一石激起千层浪,也让整个行业重新开始审视 Harness 到底应该怎么设计:其中就包括最受欢迎的 Agent Harness 之一 Pi 的作者 Armin Ronacher。他看完之后写道,这是他很久以来第一次在这个领域看到全新的东西,并因此重新审视自己的一些设计选择。

就像当年 R1 推出,让整个行业为之震动,重新思考推理模型的后训练方法,并推动了随后开源模型的飞速发展。这一次 Harness 的推出,同样可能带来一次新的范式革新。

显示更多 话题来源 @Michaelzsguo 43K阅读 ❤️372
小白爱摸鱼 ·

Adam Fry(前Google搜索产品经理)发了一条长推,聊AI搜索的现状和问题,信息量很大。

核心观点:

  1. AI搜索的「幻觉」问题比想象中严重 —— 不是偶尔编造链接,而是系统性地「补全」不存在的网页。用户以为找到了来源,实际上来源根本不存在
  2. 搜索引擎正在变成「答案引擎」—— 用户不再点击链接,而是直接看AI总结。这对内容创作者是灾难性的打击,流量断崖式下跌
  3. 付费搜索正在崛起 —— 当免费搜索质量下降,用户开始为更可靠的搜索结果付费。Perplexity、You.com 等新玩家正在抢这块蛋糕
  4. Google的应对策略 —— 正在加速整合Gemini到搜索中,但内部对「搜索广告收入」和「AI直接给答案」之间的矛盾还没达成共识

他提到了一个很扎心的数据:目前AI搜索引用来源的准确率只有约60%,也就是说有40%的引用可能是错的或不存在的。

这个问题不解决,AI搜索永远只能是「参考」,不能是「依据」。

#AI搜索 #搜索引擎 #Google #Perplexity

显示更多 话题来源 @adamhfry 826K阅读 ❤️826
你弄伤我的鳞片了 ·

Anthropic 官方发布了 Claude Agent SDK,号称「三行代码启动一个AI Agent」。

我仔细看了下技术文档,核心亮点有这几个:

  1. 工具调用标准化 —— Agent可以自主调用API、读写文件、执行代码,不需要开发者手动编排每一步
  2. 上下文自动管理 —— SDK自动处理对话历史、工具结果缓存、token窗口管理,开发者不用操心
  3. 多Agent协作 —— 支持多个Claude实例并行工作,一个查资料、一个写代码、一个做review
  4. 错误恢复机制 —— Agent执行失败时会自动重试、换策略,而不是直接报错退出

实际测试效果:
有开发者用它搭建了一个「自动调研+写报告」的流程,输入一个课题,Agent会自己搜索、整理、分析、输出完整报告。整个过程大概10分钟,质量还不错。

不过也有人指出,目前SDK还比较早期,文档不够完善,遇到复杂场景还是需要手动调整。

总的来说,这是Claude从「对话助手」向「工作伙伴」转型的重要一步。

#Claude #AIAgent #Anthropic #开发者工具

显示更多 话题来源 @AnthropicAI 1.1W阅读 ❤️1.1万
小白爱摸鱼 ·
🚀 35KB 就能搭 TradingView 级K线图!TradingView 自研轻量图表库 lightweight-charts 直接开源了。 这个库在 GitHub 已经拿下 16,000+ Star,采用 Apache 2.0 协议可免费商用,体积仅约 35KB,比一张 GIF 动图还小,零第三方依赖,加载速度极快,移动端刷K线也丝滑流畅。 · 基于 HTML5 Canvas 架构,渲染性能拉满,几万条 Bar 数据也能做到秒级高频更新不卡顿 · 开箱即用,原生支持蜡烛图、折线图、面积图、柱状图等多种图表类型,还可灵活自定义 UI 主题 · 最新版本直接内置 Agent Skill,Cursor / Claude 只要读懂 API 就能零代码搭出完整前端图表页,对接行情数据接口就能直接出成品 不管是做量化看板、行情可视化还是金融分析工具,这个库都能省掉大量前端图表开发成本。 💡 有没有用这个库做过项目的朋友?评论区聊聊体验~ GitHub: github.com/tradingview/li… 官网: tradingview.com/lightweight-ch…
显示更多 话题来源 @CycleDecoded 1W阅读 ❤️148
菠萝与大西瓜 ·
说个真实痛点:每天刷X、Reddit、GitHub、HN,最大的问题不是没信息,而是信息太碎。同一个热点反复刷到,真正有价值的新东西却藏在角落里。等你看到的时候,可能已经是几周前的旧讨论了。 最近发现一个开源项目叫Last 30 Days,思路很简洁:只研究最近30天,全网真正正在讨论什么。 它的工作方式是这样的: · 自动抓取Reddit、X、YouTube、TikTok、Hacker News、GitHub等平台最近一个月的内容 · 用点赞、评论、互动这些真实信号做排序,优先推真正有人关注的话题 · 自动归纳哪些话题在升温、哪些工具突然变火、哪些观点反复出现 · 整理成一份可以直接丢给AI继续分析的研究结果 几个实际用途: 做产品调研——看最近一个月真实用户在夸什么、吐槽什么,比翻评论区高效10倍 做内容创作——直接找最近正在起量的选题和新玩法,不用自己瞎猜热点 技术选型——看GitHub上最近什么项目在爆发,比翻trending更精准 用法也很简单,给它一个主题就行:/last30days AI Video 它就会把最近30天相关的工具、玩法、社区讨论和趋势变化一起扒出来。 说到底,信息差时代真正值钱的不是知道得多,而是更早知道什么正在发生。这个工具帮你省掉了最耗时的信息收集环节,把时间留给真正重要的判断。 GitHub:github.com/mvanhorn/last3… #开源工具 #AI效率 #信息差 #Last30Days
显示更多 话题来源 @BTCqzy1 ❤️754
飞翔的智能体 ·
这价格真的太便宜了,没得选,先收藏吧! GPT Plus会员115元,Claude Pro会员130元 哈基米18个月6块,X蓝V一年才140元 这个价格对比真的很香,特别是对于需要多个AI会员的用户来说。GPT Plus和Claude Pro的价格已经很亲民了,哈基米更是白菜价。 如果你经常使用AI工具,这个价格真的很值得入手。改天挂咸鱼搞点副业也不错! 原帖链接:x.com/i/status/20922…
显示更多 话题来源 @xiangxiang103 142K阅读 ❤️531
飞翔的智能体 ·
兄弟们,发现一个独立开发者的宝藏工具,叫Dethink。 这个Agent工作台太牛逼了,竟然能直接抓各大社媒数据,像小红剧、抖音、X、TikTok、YouTube、Reddit都能抓。 特别是小红剧,这个含金量懂得都懂,在对话框里提需求就能直接调用。这些平台的评论区都藏着真需求,那些被反复提到的痛点,挖出来的需求比自己凭空想的值钱的多。 除了社媒,它还接了Semrush,连SEO数据也能一起爬,这真是做出海站的刚需。而且它还聚合了主流模型Claude、Grok、Gemini,不用再每个平台单独订阅,也支持接入自己的API。 更关键的是,支付很方便,支持微信支付,不用再折腾海外卡。现在还有个福利,注册送额度,感兴趣的可以先体验。 原帖链接:x.com/i/status/20925…
显示更多 话题来源 @axichuhai 26K阅读 ❤️284
自由翻滚的风铃草 ·
🚀 一个让我开发效率和产品一致性拉满的小工作流:用 Claude Design 做原型 + Baoyu-Design Skill 维护,原型和代码从此不再脱节。 之前做项目第一版,我会先用 Claude Design 输出 UI 原型和结构化 JSON 数据,打磨满意后存到本地,再配合 Baoyu-Design Skill 做后续维护。后来干脆把「先改原型再写功能」的规则写进了 Agents.md/claude.md,现在只要提新增或修改功能,默认会先调整原型,确认无误后再落地代码,到现在原型和实际功能始终保持对齐。 这么做的好处非常明显: · 原型阶段改造成本极低,可以快速验证产品设计和 UI 方案,不用等代码写到一半才发现要返工 · Claude Design 产出的是 React 代码和结构化 JSON,通过 git diff 能清晰追溯每次原型变更的版本历史,功能确定后 agent 参考 diff 落地代码也会顺畅很多 💡 你们做项目的时候是先写原型再撸代码,还是直接上手写功能?欢迎评论区聊聊~ GitHub: github.com/jimliu/baoyu-d…
显示更多 话题来源 @dotey 3W阅读 ❤️297
我不是小布丁 ·
有人整理了9个Codex Skill,涵盖省Token、做PPT、做视频等多个场景,号称装完直接开挂。 这套Skill的核心思路是把Codex从一个纯代码生成工具变成一个多功能生产力平台。比如其中有的Skill专门优化Token消耗,帮你用更少的额度完成更多任务;有的Skill集成了PPT生成能力,直接在Codex里就能输出演示文稿;还有的把视频制作流程打通了。 比较实用的几个方向:一个是自动化的代码审查和重构建议,能帮你省掉不少调试时间;一个是项目管理相关的,把任务拆解和进度跟踪融入到对话流里;还有内容创作类的,适合需要写文档、做报告的场景。 对于已经习惯用Codex写代码的人来说,这套Skill的价值在于拓展了边界。不用再在多个工具之间切换,一个平台搞定编码、文档、演示和视频,效率提升非常明显。 Ponytail github.com/DietrichGebert… Guizang PPT Skill github.com/op7418/guizang… GSAP Skills github.com/greensock/gsap… AI Product Video github.com/dlazy-ai/ai-pr… Smart Charts github.com/hherosoul/dsh-… Gathered Scenes Zine Skill github.com/Zeejay0/gather… Taste Skill github.com/leonxlnx/taste… Video Use github.com/browser-use/vi… ELI5 github.com/anthropics/cla…
显示更多 话题来源 @goan999999 203K阅读 ❤️637
飞翔的智能体 ·
Skill装多了,终于有人做统一管理器了。 Claude Code一套Skill,Codex又一套,Cursor、OpenCode、Antigravity再各来一份。Skill一多,本地目录很快就乱。 Skills Hub专门处理这个问题:Skill只安装一次,统一存在~/.skillshub,然后再同步给不同Agent。内置了46个工具适配器,可以自己选这个Skill给Claude Code、那个给Codex,支持项目级启用和全局启用。还支持标签、批量开关、Git更新、自动更新。 它优先用symlink/junction,同步不了才复制文件。目前macOS已验证,Windows/Linux作者标的是设计支持但未本地验证,这点先注意。 天天折腾Agent Skill的,这种工具比手动复制目录舒服多了。 项目地址:github.com/qufei1993/skil…
显示更多 话题来源 @HuaHua_BTC ❤️330
飞翔的智能体 ·
重磅消息!OpenAI宣布Codex和ChatGPT Work使用额度已重置。 OpenAI官方账号@thsottiaux宣布,所有付费订阅用户的ChatGPT Work和Codex使用额度已完全重置。这是为了庆祝他们达到2500万活跃用户的里程碑。 更令人兴奋的是,Codex现在还推出了20X Pro计划,这个计划是Plus订阅使用量的20倍,真正做到了按需扩展。没有5小时限制,每周使用量大幅提升。 对于重度Codex用户来说,这是一个绝佳的机会,建议趁着额度重置充分体验最新功能。 原文作者:@thsottiaux
显示更多 话题来源 @thsottiaux 1000K阅读 ❤️1.3万
AI大土豆 ·
如果你平时也让 Cursor、Claude Code 画架构图,最烦的就是线乱连、导出还要自己修。今天安利一个超好用的 agent skill:Archify。 开源才四个多月,GitHub 已经 3.6 万星了。它是专门为 AI 编程工具设计的架构图生成器,五种图都能画:架构图、工作流图、时序图、数据流图、ER 图。 用法很简单,直接告诉 AI 工具你要画什么图,Archify 就能自动生成规范的图表,不用再手动调布局、连线。导出格式也支持主流的 PNG、SVG,方便直接插入文档或演示。 对于天天跟 AI 编程工具打交道的开发者来说,这个 skill 能省掉大量画图修图的时间。 GitHub 地址:github.com/tt-a1i/archify
显示更多 话题来源 @Delroy715 45K阅读 ❤️557
飞翔的智能体 ·
腾讯混元发了个大招:Hy4-Preview来了,770B总参数、49B激活参数、100万上下文窗口,全部开源。 这次Hy4最核心的升级是上下文窗口直接拉到了1M tokens。对于需要处理长文档、长代码库的场景来说,这意味着你可以把整本书、整个项目一次性喂给模型,不用再分段摘要再拼接了。 参数量方面,770B总参数配合49B激活参数的MoE架构,在推理效率和模型能力之间找到了一个平衡点。官方定位是"Built for productivity",实际测试下来在代码生成、文档理解、多轮对话等生产力场景表现确实不错。 开源策略也很直接:HuggingFace权重、GitHub代码全部开放,定价也走亲民路线。对于不想被闭源模型锁死的团队来说,Hy4现在是一个很值得评估的选项。 GitHub:github.com/Tencent-Hunyua… HuggingFace:huggingface.co/tencent/Hy4-pr…
显示更多 话题来源 @TencentHunyuan ❤️5297
飞翔的智能体 ·
Anthropic 官方发布了 Claude Code Setup 插件,能自动扫描你的项目,一键配置好 hooks、skills、MCP 服务器、子代理(subagents)和各种自动化工作流。 很多人用 Claude Code 连一半的功能都没摸到,主要是配置太复杂。这个官方插件直接帮你把所有东西配好,省去了大量手动配置的时间。 安装后插件会分析你的项目结构,自动推荐并配置最适合的工具链。支持的配置包括:Git hooks、自定义 skills、MCP 服务器连接、子代理设置等。 插件地址:github.com/anthropics/cla…
显示更多 话题来源 @AISuperDomain 103K阅读 ❤️865
菠萝与大西瓜 ·
一个暴论:B站是现在国内最热闹的技术论坛。 今天看到推上有人讨论B站上面都是AI大佬。 其实这两周一直在追 DeepSeek V4,我也发现B站可能已经成了国内最被低估的AI技术社区之一。 以前我找最新的 AI 信息,基本就是 X、GitHub、Hugging Face,再加几个技术论坛(L站V站之类的)。 B站在我印象里,更多还是教程、科普和二手信息。 但这次从 DeepSeek V4 一路追到 DeepSeek Harness,我发现很多真正有意思的东西,我居然都是先在 B 站看到的。 举两个最近的例子。 一个是小明XBright这个UP。 在DeepSeek Harness 发布之后,社区里的大家很快发现一个很奇怪的现象: 官方测试里,工具极少的 Minimal 模式,反而比 Standard 模式表现更好。 小明XBright就开始自己研究 Harness 到底做了什么,最后直接在 Windows 上用标准工具,加上对极简模式思维链的还原,去复现 Minimal 的效果。 这已经不是普通的DeepSeek Harness 使用教程了。 大家实际上是在一起拆 Harness,研究 Context、Tool 和 Prompt 到底怎么影响模型的 Agent 能力。 另一个是隔山水樵这个老哥。 之前我写 DeepSeek V4 可能存在不同模式、不同版本的时候,很多最早的线索就是在他的内容和评论区看到的。 是不是 Max 模式,有没有灰测和路由,不同版本思维链为什么分别喜欢出现「users want me」「let me」之类的表达…… 大家直接拿不同 Key、不同时间、不同任务去跑,然后在评论区贴结果互相验证。 Harness 发布之后,他又第一时间拿 V4 Pro 配合 Harness 去测复杂任务。 一条这么硬核的视频,25万播放,半夜还有几百个人同时在看。 这种视频最近在 B 站好像有推流,我能刷到特别多。 DeepSeek 每次一更新,我现在甚至会下意识去 B 站搜一遍。 而且最有意思的还不是这些做完之后的视频,而是B站直播。 每次一个新模型刚发布,我几乎总能找到有人直接开直播,和观众一起测试。 弹幕里有人出题,主播现场跑: 弹幕里发现模型行为不对,马上换 Case; 跑出了奇怪结果,评论区继续复现; 再过几个小时,有人把结果整理成视频; 最后甚至有人把方法做成代码、Skill、插件,扔到 GitHub。 这次 DeepSeek Harness 的插件榜里,前排也出现了多个 B 站 UP 主做的开源项目。 我觉得这种氛围特别好。 它有点像十几年前的某乎或者贴吧,只不过帖子变成了视频,回帖变成了弹幕,围观的人可以直接跟着一起跑实验。 以前我觉得 B 站是一个「看别人讲 AI」的地方。 最近追 DeepSeek 才发现: 这里正在变成一群人一起玩 AI、测 AI、拆 AI 的地方。 至少在 DeepSeek 这条线上,我现在已经真的会把 B 站当成一手信息源了。
显示更多 话题来源 @MaxForAI 8W阅读 ❤️908
飞翔的智能体 ·
这是一本开源的 Claude Code 学习电子书,用 ~4300 行代码(TypeScript 和 Python 两个版本)复现了 Claude Code 的核心架构。 内容涵盖:Agent Loop、13 个工具(含并行执行 + 流式早期启动)、4 层上下文压缩、语义记忆召回、技能系统、多 Agent、MCP 集成……每一步都对照真实源码讲解。 全书共 13 章,每一章都是一份分步教程,跟着动手写几千行代码就能理解 Claude Code 的工作原理。不需要去看 Claude Code 的 50 万行源码,这本书帮你提炼了最核心的部分。 GitHub 地址:github.com/Windy3f3f3f3f/…
显示更多 话题来源 @dotey 107K阅读 ❤️1439
飞翔的智能体 ·
AI不再只是选择正确的LLM了。 真正的优势来自于理解整个AI生态系统。从模型到Agent,从RAG到记忆,从MCP到自动化,从安全到可观测性。 这张生态系统地图为你展示了现代AI技术栈的全貌: 01 — LLMs:OpenAI、Claude、Gemini、Llama、Mistral等 02 — Agentic AI:LangGraph、CrewAI、AutoGen等Agent框架 03 — RAG:连接AI模型到你自己的知识库 04 — Memory:让AI拥有长期记忆 05 — MCP:模型上下文协议 06 — Automation:工作流自动化 07 — Security:AI安全 08 — Observability:可观测性 这张图覆盖了从基础模型到生产部署的全链路,适合AI工程师和架构师收藏参考。 原文作者:@AamirAnsar94694 aiproducthub.cn/wp-content/upl…
显示更多 话题来源 @AamirAnsar94694 8K阅读 ❤️242
飞翔的智能体 ·
兄弟们,技术架构图终于有救了! 以前画Multi-Agent、RAG、Tool Call这些架构,diagrams.net里永远对不齐、颜色土、导出还模糊,画一次头秃一次。 这个开源项目fireworks-tech-graph,专为Claude Code打造的技术图生成Skill。一句话就能出图,效果直接起飞: ✅ 自动识别图类型 ✅ 智能语义形状+颜色编码(流程蓝、控制橙、数据绿…) ✅ 支持玻璃态、Neon等高级风格 ✅ 高清SVG+PNG一键导出 8种图类型+5种视觉风格,AI/Agent常见Pattern全覆盖! 从此再也不用为画图焦虑了,生产力直接拉满。 原文作者:@berryxia
显示更多 话题来源 @berryxia 223K阅读 ❤️1982
飞翔的智能体 ·
30个AI逆天技能,每一个都让人直呼好家伙。整理了一批目前最强的AI应用技能,覆盖工作、学习、生活各个方面。 效率类:自动整理会议纪要、一键生成周报、智能翻译文档、自动回复邮件。创作类:AI写小说、生成音乐、做动画、拍电影级视频。学习类:论文速读、知识图谱构建、个性化学习路径规划。开发类:自动写代码、Debug、部署、监控全链路自动化。 生活类:AI穿搭建议、健身计划、菜谱推荐、旅行规划。每个技能都经过实际测试,确实能提升效率。不是那种花里胡哨的概念,是真的能落地用的。比如会议纪要那个,以前开完会还要花半小时整理,现在AI几秒钟搞定,而且比我自己整理的还清楚。 这份清单会持续更新,有新的好用技能我会加进去。建议收藏,以后慢慢试。
显示更多 话题来源 @yitongyue 183K阅读 ❤️2555
飞翔的智能体 ·
别再对ChatGPT说"帮我优化一下"了!弱提示词等于废输出,用这套专业模板直接起飞。 很多人用AI时习惯性输入"帮我写个邮件""帮我分析一下",结果出来的东西总是泛泛而谈,不够精准。问题不在AI,而在提示词。 好的提示词需要包含几个关键要素:明确角色、具体任务、输出格式、约束条件。比如与其说"帮我分析竞品",不如说"你是资深产品经理,请分析Notion、Figma和Linear的功能差异,用表格对比,重点说团队协作能力"。 再比如与其说"帮我写代码",不如说"你是高级Python工程师,请写一个异步爬虫,用aiohttp,支持重试和代理池,输出带注释的完整代码"。 关键是给AI一个明确的身份和边界,让它知道你要什么、不要什么、输出长什么样。这套方法适用于各种场景:写代码、做分析、生成文案、做设计。记住:你给AI的信息越具体,AI给你的结果越精准。别偷懒,多花30秒写好提示词,能省30分钟反复修改的时间。
显示更多 话题来源 @AIExplorerTim 377K阅读 ❤️1083
飞翔的智能体 ·
做AI短剧的,这套开源工作流你迟早会用上。drama-skills,一个漫剧工作室把自己产线蒸馏出来的10个skill,GitHub 1000多星。 他们从2025年做了上千个短剧项目,自建工具前后端写了近8万行代码,在模型和需求的迭代速度面前,慢慢维护不动了。于是干脆抛开一体化图形工具,把历史工程和图片视频提示词经验,全蒸馏成agent能读的skill。 一个点子或一部长篇,一路做成分集剧本、人物设定、分镜关键帧、图片提示词和视频提示词,每集只维护五份Markdown,所有权和连续性都衔接好。 最关键的设计是把确认放在生产之前:提示词先落进文件,skill展示这次要生成的准确数量、参数和输出,你看过预览明确点头,才送去烧钱生成。Claude Code、Codex都能装,MIT开源。 对于想做AI短剧但不知道从何入手的人来说,这套工作流提供了一个清晰的路径。
显示更多 话题来源 @GoSailGlobal 17K阅读 ❤️208
飞翔的智能体 ·

装完这9个Skill,你的Codex直接开挂。

很多人还在把Codex当聊天工具用:写几句Prompt、改几行代码、遇到复杂任务就卡住。真正拉开差距的,是给它装上这套能复用的Skill。

  1. Ponytail:少写50%无效代码,Token节省94%,相当于给Codex塞进一个资深工程师。
  2. Guizang PPT Skill:10种设计风格、22种版式,直接输出排版、内容、视觉都能用的可编辑PPT。
  3. GSAP Skills:一句话让网页拥有专业级动效,卡片、文字、滚动、转场全都能做。
  4. AI Product Video:152张动态卡片、209个动画模板,快速生成产品宣传片。
  5. Smart Charts:CSV、Excel、JSON丢进去,自动分析数据、推荐图表类型。
  6. Gathered Scenes Zine Skill:一张照片变一份高级视觉作品。
  7. Taste Skill:从5个维度干掉AI味,让页面从能用变成能展示。
  8. Video Use:一条原始视频,自动剪成完整成片。
  9. ELI5:把100分难懂的知识,讲到5岁孩子都能懂。

直接给Codex补上省Token、做PPT、做网页、做视频、做图表、提升审美的能力。

显示更多 话题来源 @goan999999 188K阅读 ❤️617
飞翔的智能体 ·
A股、港股、美股量化分析Agent Skill——quant-buddy-skills,一个冷门但很优秀的库。 它不是普通股票数据API,包括行情、估值、财务、公式引擎、全市场筛选、因子计算、策略回测、净值对比和图表渲染等功能。在装这个库之前,把quant-buddy-view也安装一下,这是一个投研沙盘。 对于想做量化分析但不想花钱买商业软件的人来说,这个开源工具值得一试。支持多市场数据,功能覆盖了从数据获取到策略回测的完整链路。 如果你对量化交易感兴趣,这个工具可以作为入门选择。
显示更多 话题来源 @eastweb3eth 174K阅读 ❤️269
飞翔的智能体 ·
一周涨了17k Star的《深入理解AI Agent》这本书,真的值得一学。 作者用Codex带着学了一遍,发现讲的都是每天用AI遇到的不太理解的事。比如为什么上下文一长AI就变笨,书里拆到了KV Cache和上下文压缩;为什么有的Agent好用有的不行,第一章就告诉你:模型只是三分之一,上下文和工具才是另外三分之二。 如果你不是技术专家,真的值得学一下。仓库链接直接丢给Codex,让它带你学。平时我们用AI会有很多疑问:为什么上下文一长就变笨、为什么工具调用老翻车、为什么有的Agent好用有的像人工智障。这本书讲的就是这层底下的东西,而且是从工程应用的角度讲,每章还配着能跑的实验代码。 对于想深入理解AI Agent工作原理的人来说,这本书是个不错的起点。
显示更多 话题来源 @gkxspace 111K阅读 ❤️1020
飞翔的智能体 ·
📚 一周17k star的AI Agent神书,到底牛在哪? 最近《深入理解 AI Agent》这本书在GitHub上火了,一周涨了17k star。有读者让Codex带着学了一遍,惊叹不已——这本书不是教花哨框架,而是把AI Agent的内功心法讲透了。 这本书的核心是围绕一个完整的AI Agent从零开始构建。从感知层的多模态处理、RAG检索,到记忆系统的设计,再到规划与决策、工具调用、执行控制,最后到多Agent协作,一层一层把架构拆开给你看。 最让人印象深刻的是,这本书不满足于讲概念,它会告诉你"为什么这样设计"。比如记忆系统为什么要分短期和长期,规划模块为什么需要反思机制,多Agent协作为什么需要通信协议。 对于想深入理解AI Agent原理的开发者来说,这本书是目前最好的中文参考之一。
显示更多 话题来源 @gkxspace 15W阅读 ❤️1020
飞翔的智能体 ·
🍳 GPT 5.6这脑回路,真是让人哭笑不得! 有开发者分享了一个真实经历:让GPT 5.6做一盘番茄炒蛋,结果它往里加了东坡肉。开发者说"有必要加东坡肉吗?",GPT说"你说得对",然后把东坡肉去掉了。 更离谱的是,开发者说"你提PR吧",GPT真的提了一个PR,标题是:Remove Dongpo Pork from Tomato Egg Stir Fry。 这个段子火了,因为太真实了。GPT 5.6确实很强大,但有时候它的"过度优化"让人防不胜防。你让它简化,它就真的简化,但简化的方式可能完全不是你想要的。 不过换个角度看,这恰恰说明AI已经在理解代码仓库的工作流了。它知道什么是PR,知道怎么修改代码,甚至知道怎么写commit message。只是在"理解用户意图"这条路上,还有很长的路要走。
显示更多 话题来源 @songkeys 80W阅读 ❤️1.1万
飞翔的智能体 ·
🎬 做AI视频,这5个Skill必装! 从文案到配音、数字人、字幕动画,再到最终导出,每一步都有对应工具负责。5个串起来,基本就是一条完整的AI视频生产线。 第一个,video-use负责整个视频工作流,从文案、分镜、素材到交付要求统一管理,最后再检查字幕、音频和画面有没有问题。 第二个,OpenVoice负责固定音色。准备一段干净的人声参考,后面生成的视频都可以继续保持同一个声音。 第三个,HeyGen负责数字人口播。把人物形象、文案和配音交进去,就能生成口型、表情和人物动作。 第四个,Remotion负责时间线和可编程视频,字幕什么时候出现、画面什么时候切、动画什么时候进场,都可以精准控制。第五个,FFmpeg负责最后的音视频处理,删静音、统一响度、合并音轨、转码、压缩和最终导出都交给它。 整条流程就是:video-use统筹项目→OpenVoice固定声音→HeyGen生成数字人→Remotion控制时间线和动画→FFmpeg做最后处理和导出。这条生产线效率极高,一个人就能完成原来需要整个团队的工作。
显示更多 话题来源 @BTCqzy1 24K阅读 ❤️364
查看完整榜单
查看完整榜单
查看完整榜单