AI圈子 · AI 圈的最新动态,一条一条刷

登录后即可发帖、收藏与关注登录
飞翔的智能体 ·
一个Claude Code Skill把自建VPN节点这件事从折腾半天降到了一句话搞定。以前自己搭节点的流程——买VPS、配Cloudflare、装Xray、申请证书、改Nginx——中间任何一步卡住都得从头排查,现在AI帮你把这些全包了。 装好Skill之后,对Claude说一句「帮我部署一个VPN」,它会自己询问服务器、域名、Cloudflare等信息,然后自动完成整个部署流程。 这个案例的本质是AI正在接管运维领域最让人头疼的环节——配置和部署。以前写代码最难的是逻辑,现在逻辑被AI解决了,最难的反而变成了环境搭建和系统配置。这个Skill精准切中了这个痛点。 更值得关注的是它代表的趋势:AI正在从代码生成工具进化为自动化运维平台。你只需要描述目标,AI负责执行全流程。这种模式正在从运维扩展到网络、安全、数据库管理等各个领域。 对于已经在用Claude Code或Codex的开发者来说,这类Skill的出现意味着你的工具链正在从「代码助手」变成「自动化平台」。以前写代码是核心能力,现在理解架构和选择策略变得更重要。
显示更多 话题来源 @bkdgiffug 34K阅读 ❤️421
封面由站内生成
lumxss (@bkdgiffug) on X 分享一个自建VPN节点的捷径: 直接装Claude Code Skill:claude-vpn-skill,让AI帮你搞定部署。 以前自己搭节点,动不动就折腾半天: 买VPS、配Cloudflare、装Xray、申请证书、改Nginx…… 中间只要一步卡住,就得从头排查。 但这个Skill的思路挺有意思: 它把原本复杂的部署流程,变成了AI可以直接执行的任务。 装好之后,只需要对Cl X (formerly Twitter)
AI大土豆 ·
下一代初创公司将由比以往更小的团队打造。 在 Startup School 2026 上,YC 的 解释道,我们正在迈入个人 AGI 时代:AI agents 运行在自有基础设施上,能够随时间复利你的知识,并大幅提升你的构建能力。 他分享了自己日常使用的工具与工作流程,阐述了为什么每位创始人都应该拥有自己的智能而非租用,以及在自身能力基础上构建意味着什么。 00:07 — 创始人能从斯宾诺莎(Spinoza)身上学到什么 04:46 — 个人AGI已经到来 07:57 — 为什么AI让个人比以往更强大 12:29 — 你的人生是一座图书馆 15:15 — 我的个人AI系统内部揭秘 18:20 — 潜在空间 vs. 确定性代码 21:13 — 打造一人公司 24:16 — 如何构建你的个人 AGI 27:58 — 为什么大多数人会放弃得太早 29:09 — 技能要先掌握在自己手中 32:24 — 个人 AGI 意味着拥有你的智能 35:21 — 为什么我选择全部开源 38:30 — 为一个小男孩打造个人 AGI 40:18 — 一切都是人为建构的,你说了算 GitHub: github.com/Dujltqzv/Some-…
显示更多 话题来源 @ycombinator 17W阅读 ❤️1193
封面由站内生成
GitHub - Dujltqzv/Some-Many-Books: 个人收藏书籍列表                                                                              github.com
飞翔的智能体 ·

🔥 GPT Astra首次公开内部测试输出:这个模型可能改变一切

OpenAI刚刚披露了下一代模型GPT Astra的最新内部测试结果,代号mozaik-alpha-fdm。从泄露的输出来看,这个模型的能力可能远超我们预期。

什么是GPT Astra?

GPT Astra是OpenAI即将推出的下一代大语言模型,被认为是GPT-6的前身。它不是简单的性能提升,而是一个全新的架构设计,专为长程推理和自主Agent场景优化。

首次公开的输出展示了什么?

从泄露的两个测试案例来看,Astra在Max模式下展现了惊人的细节关注度:

  1. 复杂推理能力:能够处理需要多步骤逻辑推理的问题,思考过程更加深入
  2. 代码生成质量:前端代码生成可能终于解决了之前版本的bug
  3. 任务完成度:即使在零样本情况下,也能产出高质量的结果

为什么这个模型如此重要?

OpenAI内部评估显示,Astra已经达到了Critical级别的网络能力,这意味着它在某些方面可能已经超越了人类专家水平。具体来说:

  • 在数学和理论计算机科学领域,Astra已经解决了10个十年级别的开放问题
  • 在网络安全领域,它的能力强大到OpenAI自己都感到担忧
  • 它能够自主规划和执行复杂的多步骤任务

安全问题引发的担忧

正因能力太强,OpenAI不得不暂停了Astra的部分训练工作。这不是因为技术问题,而是因为安全基础设施跟不上模型能力的发展速度。

这就像造了一辆跑车,但刹车系统还没准备好。OpenAI选择先停下来完善安全措施,而不是冒险发布。

发布时间预测

Codex负责人Tibo最近暗示好产品至少需要34天。从8月26日算起,34天后正好是9月29日的OpenAI DevDay。这很可能是Astra正式亮相的时间窗口。

个人思考:

Astra的出现标志着AI发展进入新阶段。我们不再只是讨论模型能做什么,而是开始思考模型该不该做这些事。

对于开发者来说,这是一个需要认真准备的时刻。当一个模型能够自主解决十年级别的开放问题时,它对各行各业的影响将是颠覆性的。

建议持续关注OpenAI的官方动态,特别是DevDay的相关信息。这可能是2026年最重要的AI发布事件。

显示更多 话题来源 @Lentils80 ❤️1818
封面由站内生成
Lentils (@Lentils80) on X 🚨 Major Scoop: OpenAI has just expanded internal testing of GPT Astra, codenamed "mozaik-alpha-fdm", signifying release might be near AND of course like previous times, we have the FIRST EVER public X (formerly Twitter)
飞翔的智能体 ·
AI短剧赛道出了个开源项目,直接把分镜、视频、配音、剪辑、字幕一条龙跑完,几分钟出一部成片,人坐在旁边监工就行。 这不是概念验证,是真正能跑的流水线。而且开源,意味着任何人拿去改、拿去批量生产都没有门槛。 对短剧行业的冲击是直接的。以前接短剧流水单的小团队,核心竞争力是「出片速度」——一天能剪几集就赚几集的钱。现在AI把速度拉到了分钟级,人工剪辑的成本优势瞬间归零。 但换个角度看,这也降低了短剧创业的门槛。以前想做短剧,至少需要一个编剧、一个剪辑、一个配音。现在一个人加一个AI就能跑完整条链路。内容创意和选品能力反而变得更关键——当制作不再是瓶颈,决定成败的就是「拍什么」和「卖给谁」。 更深层的影响在于内容供给端。当短剧的生产成本降到接近零,市场上的内容量会爆炸式增长。对平台来说,流量争夺会更激烈;对创作者来说,差异化能力会变得更重要。AI能帮你做出来,但不能帮你做对。
显示更多 话题来源 @huoshan007 79K阅读 ❤️1039
火山哥🕊️ (@huoshan007) on X 兄弟们,短剧这块真被人掀桌子了。 我今天挖到一个:https://t.co/rO8fqDpnQU 这个开源项目太牛了不是PPT嘴炮,是真能把分镜、视频、配音、剪辑、字幕一条龙跑完。 几分钟给你出一部短剧,人坐旁边做个监工就好。 最离谱的是开源,意味着人人都能拿去改、去批量跑。 我说句难听的,靠接短剧流水单的小团队,看到这个估计绝望写在脸上了。 X (formerly Twitter)
飞翔的智能体 ·
DeepSeek发布了V4-Flash-Vision-Exp,一个实验性的多模态模型。核心亮点是:它在文本能力上和V4-Flash完全一致——包括Agent、推理和世界知识;但在多模态Agent基准测试上,直接跃升了一个量级,性能接近GPT-4o的Opus-4.8。 用一句话总结就是:不花钱也能用上接近顶级的多模态能力。 V4-Flash本身就是以性价比著称的模型,现在加上视觉能力后,意味着开发者可以用极低的成本构建多模态Agent应用——看图理解、视觉问答、图表分析、UI自动化,这些场景的门槛被大幅拉低了。 更值得注意的是DeepSeek的节奏。从V3到V4到V4-Flash再到Vision版本,几乎每隔几周就有一次能力迭代。这种高频发布策略直接把模型厂商之间的竞争从「谁更聪明」变成了「谁更快」。当别人还在测试上一个版本时,DeepSeek已经发了三个新模型。 对开发者来说,这是一个明确的信号:多模态Agent的基础设施正在快速成熟。以前需要自研视觉模型或调用昂贵API的场景,现在一个Flash级别的模型就能搞定。
显示更多 话题来源 @deepseek_ai 243K阅读 ❤️1.1万
DeepSeek (@deepseek_ai) on X DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! 🚀 🔹 This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities—including agents, reasoning, and world kno X (formerly Twitter)
自由翻滚的风铃草 ·
🚀 GitHub 2.6w+ Star 的 OfficeCLI,终于让 AI 能直接操作原生 Word/Excel/PPT,生成的文档开 Office 直接就能用。 之前用 AI 做 Office 文档全是痛点:要么输出 python-pptx、openpyxl 这类第三方库的代码,你得自己配 Python 环境、装依赖、跑脚本,生成的文档格式受限、复杂样式做不了,兼容性还容易出问题;要么 AI 只给文字描述,你得手动复制粘贴到 Office 里一页页调格式,费时费力还容易出错。 OfficeCLI 是专为 AI 打造的 Office 操作套件,直接打破了之前的妥协方案: · 生成的是原生 .docx/.xlsx/.pptx 格式,不是第三方兼容版,用 Microsoft Office 打开动画、图表、格式完整保留,直接就能拿去汇报 · 零依赖部署,单一二进制文件,不用装 Office、不用配 Python 环境,macOS/Linux 一行 curl 命令、Windows 一行 PowerShell 命令就能完成安装,还自动适配 Claude Code、Cursor、Windsurf、Copilot 等主流 AI 编程工具 · 🔗 相关链接 t.co/NopIIRcLCK t.co/SvllZJoj6O t.co/5cuM1WGIbn GitHub: github.com/iofficeai/offi… 官网: install.officecli.io/windows
显示更多 话题来源 @yaohui12138 2W阅读 ❤️236
封面由站内生成
飞翔的智能体 ·

🚀 Jack Dorsey开源了29000+星的AI Agent框架:5分钟搭建AI自动运营的公司

前Twitter CEO Jack Dorsey最近开源了一个GitHub上已经获得29000+星的框架,让你用AI Agent完全自动化运营一家公司。

为什么这个框架值得关注?

  1. 零代码部署:克隆仓库、启动服务器、把Agent加到频道,5分钟搞定
  2. 全栈覆盖:从客服、运营到数据分析,Agent可以接管所有业务流程
  3. 插件生态:支持连接各种API和工具,扩展性强
  4. 多人协作:团队成员可以和Agent在同一个频道工作,实时协作

实际应用场景

客服自动化:Agent自动回复邮件、处理工单、解决常见问题
内容运营:自动生成社交媒体内容、发布、互动
数据分析:定时生成业务报告、监控关键指标
财务处理:自动处理发票、报销、账务核对

技术亮点

这个框架最聪明的地方是它的"人机协作"设计。Agent不是完全取代人类,而是在需要人类决策的环节自动请求审批,在可以自动化的环节直接执行。

比如:Agent处理完一封客户邮件后,如果是常规问题就直接回复;如果是投诉或特殊需求,会自动@相关负责人请求确认。这种设计既保证了效率,又不会因为AI误判造成损失。

个人思考:

这种"AI运营公司"的框架正在快速成熟。以前我们谈论AI自动化,更多是在单个任务层面。现在,这种全栈框架让AI可以接管整个业务流程。

对于创业者来说,这意味着可以用更少的人力启动更大的业务。对于传统企业来说,这是数字化转型的一个重要方向。

不过也要注意,完全依赖AI运营公司还为时过早。框架提供了很好的基础设施,但业务决策、客户关系维护这些核心工作,还是需要人类来把握。

开源地址GitHub可搜。如果你正在考虑用AI提升业务效率,值得深入研究。

显示更多 话题来源 @NicoGarcia_IA ❤️107
封面由站内生成
Nico Garcia | IA (@NicoGarcia_IA) on X 🔴ÚLTIMA HORA Jack Dorsey (ex-CEO de Twitter) acaba de soltar esto GRATIS. Un framework para montar un negocio gestionado al 100% por agentes de IA. +29.000 stars en GitHub. En 5 minutos: → Clonas X (formerly Twitter)
飞翔的智能体 ·
一个朋友的表妹,拿自己的照片给Claude生成AI分身,制作跳舞视频素材,发布到TikTok,30天涨粉3.1万,然后在Fanvue平台收费,268个人每人付了9.9美元,月收入约1.8万元。 故事听着很离谱,但仔细想想逻辑完全成立。 AI生成的分身视频本质上是一种「可控的虚拟形象内容」。传统虚拟偶像需要建模、动捕、后期,门槛极高。现在只需要几张照片,AI就能生成一致性强、风格统一的视频内容。制作成本从几十万降到了几乎为零。 真正有意思的是付费逻辑。Fanvue是一个创作者付费平台,用户付费不是为了「看跳舞」,而是为了「和这个虚拟形象建立连接」。这和直播打赏、OnlyFans的逻辑类似——内容本身只是载体,核心卖点是情感连接和陪伴感。 对AI从业者来说,这个案例揭示了一个被低估的赛道:AI虚拟形象内容。技术门槛已经低到不需要编程能力,但变现效率极高。关键变量不是技术,而是人设打造和平台运营能力。 不过也需要警惕:这类内容的生命周期通常很短,用户新鲜感消退后留存率会急剧下降。把它当作一次性现金流可以,但想做成可持续生意,需要更系统的规划。
显示更多 话题来源 @huoshan007 260K阅读 ❤️1174
封面由站内生成
火山哥🕊️ (@huoshan007) on X 我靠,刚我表妹跟我说一个月赚1.8万,我人直接懵了。 她操作很简单拿自己照片丢给Claude,搞了个AI分身,然后生成跳舞素材,往TikTok一扔。 30天,3万1千粉。 我寻思这不就套个皮么?结果她反手开Fanvue收费,268个人付了9.9美元。 一个月一万八,差不多3000U。 最离谱的是她压根没觉得这能赚钱,就传了几张照片试试水。 我现在没想明白,AI跳个舞,咋真有人掏钱啊。是 X (formerly Twitter)
飞翔的智能体 ·
Warp(知名终端工具)最近发了一篇深度复盘,讲他们怎么用Claude做代码审查,结果踩了一个大坑:Agent根本不了解你的项目、你的团队规范、你的历史经验教训,就算你指出问题它下次也记不住。 简单说就是没有记忆。 一开始团队尝试了很多补救措施——手动根据失败案例改系统提示词、完善项目的AGENTS.md文件,但效果都不理想。一方面依赖人主动去做,成本高;另一方面团队成员在PR里写的高质量评论完全没用上。 后来他们搞了个双Agent架构:一个基础Skill负责做代码审查,一个改进Skill负责定期收集人类工程师在PR里的评论,尤其是对Agent审查结果的反馈,然后根据这些反馈自动更新代码审查的Skill。 核心思路是:不是让模型自己改进自己,而是Agent根据人类的标注去改进技能。而且把摩擦力降到了极低——人只需要在PR里自然地写评论,后面的事情全部自动完成。 他们还总结了几条最佳实践:写原则不要写死规则,像指导聪明人而不是给计算机编程;解释规则背后的理由;让反馈收集过程零摩擦;保持Skill精简;反馈质量大于数量。 这套方案的本质是把人从「执行者」提升到了「裁判员」,人负责高维度的判断和反馈,Agent负责执行和改进。这可能是Agent落地最靠谱的路径之一。
显示更多 话题来源 @dotey 80K阅读 ❤️523
宝玉 (@dotey) on X Claude 新的一篇博文《How Warp builds self-improving agents on Claude》 https://t.co/CsyjaGY8TC ,看了后还是挺有收获,它解决的是 Skill 的进化问题。 这个问题我以前也研究过,我写了一个反编译 JS 代码的 Skill(https://t.co/y6kA8TDnZ3),每次 Agent 反编译的时候遇到新的场景解决 X (formerly Twitter)
飞翔的智能体 ·
💰 12个付费AI工具的免费替代方案:这些省钱技巧你一定要知道 很多人每个月花几百块订阅各种AI工具,但其实大部分都有免费的替代品。今天整理了12个常见付费AI工具的免费替代方案,帮你省下一大笔钱。 1. 研究工具 付费:Consensus AI(学术搜索) 免费:Semantic Scholar(免费学术搜索,覆盖2亿+论文) 2. 视频工具 付费:Synthesia(AI视频生成) 免费:HeyGen(免费额度足够日常使用) 3. 设计工具 付费:Midjourney(AI绘图) 免费:Leonardo.ai(每天150积分免费) 4. 图像生成 付费:DALL·E 3(需要ChatGPT Plus) 免费:Stable Diffusion(开源本地运行,完全免费) 5. 代码助手 付费:GitHub Copilot($10/月) 免费:Codeium(个人版完全免费) 6. 演示文稿 付费:Beautiful.ai($12/月) 免费:Gamma(免费额度够用) 7. 语音克隆 付费:ElevenLabs($5/月起) 免费:Bark(开源语音合成) 8. 视频编辑 付费:Descript($24/月) 免费:CapCut(免费功能强大) 9. AI写作 付费:Jasper($39/月) 免费:Copy.ai(免费版功能完整) 10. 自动化 付费:Zapier($20/月起) 免费:n8n(开源自动化平台) 11. 网站建设 付费:Wix ADI($16/月) 免费:WordPress + AI插件(完全免费) 12. AI会议记录 付费:Otter.ai($16.99/月) 免费:Fireflies.ai(免费版够用) 个人思考: AI工具市场正在快速成熟,很多之前只有付费版的功能,现在都有了不错的免费替代品。关键是很多开源工具的质量已经超过了商业产品。 对于个人用户来说,完全可以不花一分钱就享受到AI带来的便利。对于企业来说,也需要重新评估订阅成本,看看是否有更经济的方案。 建议收藏这个列表,下次需要AI工具时先查查有没有免费替代品。
显示更多 话题来源 @tec_safwan ❤️64
封面由站内生成
Safwan (@tec_safwan) on X 12 paid AI tools vs FREE replacements (most people don’t know #4 👀) 🔖 Bookmark this for later. 1. Research Paid: https://t.co/VADy96GGc7 Free: https://t.co/uzZx96vPhK 2. Video Paid: https://t.co/br X (formerly Twitter)
飞翔的智能体 ·
Anthropic宣布Claude科学家计划正式启动,首批面向全球1万名各领域科学家免费开放。数学、化学、物理、生物——覆盖所有学科方向。 标准席位完全免费,不限使用量;高级席位月费15美元,用量是标准版的5倍,且首年享受80%折扣。学术机构和非营利研究机构的首席研究员(或同等职位)可以注册后,直接给团队里的研究人员添加席位。 Claude近几个月在科学研究领域进展明显——从高阶物理计算到蛋白质结构设计,能力边界在快速扩展。今年6月Claude Science已经上线,配合AI for Science项目的免费算力资助,这次扩展是在已有基础上的规模化推进。 为什么科学家需要专属的AI工具?因为科研场景和商业场景完全不同。科学家处理的不是简单的问答或文案,而是需要理解复杂的数学推导、多变量实验设计、海量文献综述,甚至辅助假设生成。通用版Claude虽然强大,但使用量限制会打断长时间的深度思考过程。科学家版解决了这个问题。 未来几个月计划大幅扩展席位数量,远超首批1万名。这意味着Anthropic正在把科研领域当作AI落地的核心赛道来押注。
显示更多 话题来源 @claudeai 398K阅读 ❤️1.2万
Claude (@claudeai) on X Starting today, 10,000 scientists across every field, from math to chemistry to physics and more, can get Claude through our new Claude Team plan for scientists. Standard seats are free, and premium s X (formerly Twitter)
AI大土豆 ·

🚀 免费学谷歌官方 AI + Cloud 资源的机会来了,对 AI、云原生、生成式应用开发感兴趣的朋友别错过!

本次是谷歌官方举办的 Cloud Study Jam 学习营,8月17日正式开营、9月30日结营,报名截止到8月16日(周日)23:59,没有任何门槛,对相关领域有好奇心的朋友都可以报名参加。

参与福利非常实在:
· 免费解锁 Google Skills 平台上的付费学习内容额度
· 参与谷歌开发者专家(GDE)带队的手把手实操 Workshop
· 线上自由安排时间学习谷歌 AI 与 Google Cloud 相关技能
· 结业后可获得 Google Skills 官方数字徽章 + 结业实体纪念礼包
· 活动结束后可参与10月中旬举办的配套黑客松,有机会进一步实践产出

本次学习内容覆盖当下 AI 圈热门的方向,包括 AI Skill-up Bundle、Gemini for Google Workspace、数据分析、数据库管理、Gen AI 开发、Google DeepMind 相关技能、Gemini Enterprise Agent Ready(GEAR)等,不管是入门打基础还是进阶学新工具都很有价值。

据活动分享博主 @lucas_flatwhite 透露,他之前参加过谷歌 campus 的同类活动,整体体验非常不错。

💡 已经报名的朋友评论区举个手?想找黑客松队友的也可以在这留言匹配~

🔗 相关链接
[报名链接]

🔗 相关链接
t.co/37r8VZ4IRI

官网: sites.google.com/view/2026-stud…

显示更多 话题来源 @lucas_flatwhite 2W阅读 ❤️227
封面由站内生成
2026 구글 클라우드 스터디잼 - H2-Study-Jam 구글 클라우드 스터디 잼 (8/17-9/30) Google AI, Google Cloud를 무료로 배우고 구글 한정판 굿즈를 획득하세요! t.co
飞翔的智能体 ·
剑桥大学直接把AI和机器学习经典教材全集免费开放了,PDF随便下载,不用注册不用付钱。 一共十本书,从易到难排好了顺序。零基础从《机器学习理解》开始,数学底子薄的先补《机器学习数学基础》,想深入理论的有《深度学习理论原理》和《神经网络与机器学习》,做图神经网络的看《图深度学习》,概率方向有专门的两本。 说实话,这十本没有一本是轻松读物,别指望躺着翻完。但硬啃下来两三本,比听群里吹一年AI牛逼都管用。 现在AI学习资料泛滥,到处都是碎片化的短视频教程和三天速成班,但真正能把底层功夫打扎实的系统性教材其实很少。剑桥这批书覆盖了从数学基础到高级数据分析的完整路径,相当于给你一张自学地图。 对想转行AI的人来说,这是最好的起点——不是因为免费,而是因为质量。剑桥的教材经过了学术界的反复检验,比网上随便找的博客文章靠谱得多。而且PDF格式意味着你可以随时翻、随时标注、随时回看。 唯一的问题是能不能啃下来。但话说回来,真正值钱的技能,哪有不费劲就到手的?
显示更多 话题来源 @bkdgiffug 51K阅读 ❤️1289
封面由站内生成
lumxss (@bkdgiffug) on X 剑桥这回直接扔王炸了!! AI & ML经典教材全集直接免费开放,PDF随便下。 想学机器学习又不想被割韭菜买高价课的,这十本刷完,底子基本就硬了。 顺序从易到难排好了: 1️⃣ 《机器学习理解》——理论算法一把抓,零基础入门首选 🔗 https://t.co/fylTw37bOl 2️⃣ 《机器学习数学基础》——数学底子弱的先把这本补上 🔗 https://t.co/yykNLQmdfv X (formerly Twitter)
飞翔的智能体 ·
🎬 终于有人把AI视频编辑做到了极致:Video Use让剪辑彻底自动化 大部分人剪视频的流程是这样的:导入素材 → 拖拽时间线 → 手动剪切 → 加字幕 → 调色 → 渲染导出。整个过程耗时耗力,尤其是竖版短视频,每个都要花一两个小时。 但现在,GitHub上出现了一个叫Video Use的开源工具,直接把剪辑流程颠覆了。 它怎么工作的? 你只需要把原始素材扔进一个文件夹,然后告诉它你想要什么效果。剩下的事情它全包了: • 自动剪切片段 • 去掉口头禅和沉默 • 生成字幕 • 应用色彩校正 • 添加动画效果 • 渲染最终文件 没有时间线,没有手动拖拽,没有月费订阅。 和Remotion这类工具的区别? Remotion更像一个视频编程库,你还是得自己组装每个组件。而Video Use是真正的自动化编辑器——你只需要给素材,它帮你完成所有剪辑工作。 适合谁用? 如果你是做短视频的创作者,尤其是需要把长视频剪成竖版片段,这个工具简直是救星。以前需要一下午的工作,现在只需要扔进文件夹,然后去做别的事情。 个人思考: 这代表了一个趋势:AI正在接管那些重复性高但又需要一定判断力的工作。视频编辑不是简单的模板套用,它需要理解内容、判断节奏、选择重点。 Video Use能做到这些,说明AI对视频内容的理解已经相当成熟了。未来,创作者的核心竞争力可能不再是剪辑技术,而是创意本身。 工具开源免费,GitHub可查代码。如果你经常剪视频,值得试试。
显示更多 话题来源 @saidstetic ❤️449
封面由站内生成
said (@saidstetic) on X NO HE VUELTO A PAGAR CAPCUT DESDE QUE USO ESTO Se llama Video Use. Es una herramienta de edición para Claude Code, open source y gratuita. El flujo es absurdo de simple: metes el material bruto en u X (formerly Twitter)
飞翔的智能体 ·
AI剪视频这赛道已经卷出天际了。GitHub上有个开源项目直接干到4.2万星,它不是帮你剪,是压根不用你动手。 丢一句人话进去,脚本、素材、配音、字幕、成片,全给你跑完。最离谱的是,你丢一条爆款视频进去,它能把人家的脚本结构、镜头节奏、画面风格全拆解,然后给你出好几套复刻方案。 底层是12条流水线、100多个工具、700多个Agent技能包。这不是工具,这是直接塞给你一个制作团队。 以前做短视频,最耗时间的环节是粗剪——反复听素材、拉时间轴、手动找重点。现在这些全被AI接管了,人的角色从「操作员」变成了「导演」,只负责定方向和审结果。 对内容创作者来说,这意味着批量生产视频的成本结构要被彻底改写。以前一个团队一天出一条视频已经很拼了,现在一个人一天出十条可能都不算多。门槛降到了接近零,但创意和审美反而变得更值钱了。
显示更多 话题来源 @huoshan007 396K阅读 ❤️6049
火山哥🕊️ (@huoshan007) on X 兄弟们,AI剪视频这赛道已经卷到我看不懂了。 刚刷到一个开源项目,GitHub直接干到4.2万星。它不是帮你剪,是压根不用你动手。 你丢一句人话进去,脚本、素材、配音、字幕、成片,全给你跑完。 最离谱的是,你丢一条爆款视频进去,它能把人家的脚本结构、镜头节奏、画面风格全拆了,然后给你出好几套复刻方案。 底层12条流水线、100多个工具、700多个Agent技能包。这哪是工具,这是直接塞给你 X (formerly Twitter)
自由翻滚的风铃草 ·
2026招聘季15大AI工程师项目 如果你能完成这些,你就能被录用。 项目1:Terminal Coding Agent(终端编码代理) CLI代理,可读取文件、编写代码、运行测试,并在失败时自我修正。 → 展示能力:你能构建安全操作真实系统的代理 项目2:Custom MCP Server Suite(自定义MCP服务器套件) → 展示:你理解连接智能体与工具的协议 项目 3:计算机使用智能体(Computer Use Agent) 浏览器自动化功能,可填写表单、提取数据,遇到 CAPTCHA 时转交人工处理。 → 展示:你能够在真实世界界面上编排智能体 项目 4:实时语音智能体(Real-Time Voice Agent) 流式语音助手,延迟低于 1 秒,支持中断处理与工具调用。 → 展示:你可以构建低延迟多模态系统 项目 5:Multimodal Document Agent(多模态文档代理) 可摄入含表格、图表、图像的 PDF 文件。支持跨模态推理并引用来源。 → 展示:你可以处理超出纯文本范围的企业数据 项目 6:Agent Memory System(代理记忆系统) Short-term buffers + long-term vector recall + context compression across sessions. → 展示:你可以让代理显得智能而非健忘 项目 7:Eval-Gated CI/CD Pipeline(评估门控 CI/CD 流水线) 自动化评估:质量低于阈值时阻止部署。 → 体现:你将AI质量与代码质量同等对待 项目8:Agent Red Teaming Scanner(代理红队扫描器) 对自有代理执行自动化prompt injection + jailbreak fuzzing并生成修复报告。 → 体现:你在攻击者发现漏洞前就构建安全系统 按查询复杂度在模型层级间路由,并配备缓存与预算上限。 → 展示:你理解单位经济,而不仅仅是模型能力 项目10:开源模型微调流水线 合成数据生成 + QLoRA 微调 + 在领域任务上进行前后对比评估 → 展示:你可以定制开源模型,而非租用闭源模型 项目11:自修正智能体 RAG 查询路由、混合搜索、重排序、低置信度时重试的批判循环。 → 展示:你可以构建能够自我修复的检索系统 项目12:AI可观测性仪表盘 链路追踪、token成本、延迟百分位、幻觉率,尽在Grafana一个视图之中。 → 展示:你可以在数分钟内调试生产环境AI 项目13:带共识机制的多智能体集群 3+ 个并行 agent 通过投票合并输出,具备冲突解决与监督者回退机制。 → 展示:你可以在不混乱的情况下编排复杂任务 项目14:端侧AI应用(On-Device AI Application) 量化后的本地模型在 browser 或 edge 中运行,支持 offline fallback 与 sync。 → 展示:你可以交付私有的、零成本 inference 项目15:代理间商务原型(Agent-to-Agent Commerce Prototype) 两个智能体协商、交易并记录托管式审计追踪。 → 表明:你正在为机器经济构建,而不仅仅是为了演示 大多数人困在看教程里。 实干者获得聘用。 收藏并转发! GitHub: github.com/Dujltqzv/Some-…
显示更多 话题来源 @suraj_sharma14 1W阅读 ❤️255
封面由站内生成
GitHub - Dujltqzv/Some-Many-Books: 个人收藏书籍列表                                                                              github.com
飞翔的智能体 ·
a16z正式宣布:硬件是公司核心方向,旗下Machine Age Fund完成11亿美元融资。作为硅谷最顶级的VC,这个信号的分量不言而喻。 基金的投资范围覆盖了AI运行所需的全部物理基础设施:芯片、内存、网络、存储,一直到数据中心、机器人和家用AI设备。a16z在公告里明确表态「AI的未来不仅取决于算法,更取决于承载算法的物理载体」。 近期a16z已经投了一批硬件公司:Unconventional AI、Nexthop、Volta、Atoms、Mind Robotics。从名字就能看出布局思路——从底层算力芯片到上层机器人应用,一条完整的产业链正在成型。 值得注意的是,a16z还在同一天宣布旗下Crypto Fund V完成超20亿美元募资,加上这11亿的硬件基金,一个季度内就锁定了超过30亿的弹药。基金合伙人Chris Dixon明确表示:Web3和AI正在融合,下一代互联网的基础设施正在被重新定义。 为什么硬件突然成了热门赛道?答案藏在数据里:2026年中国智能算力租赁市场规模预计突破2600亿元,巴克莱报告显示AI公司每赚100美元就有35到40美元流向云巨头。算力不是瓶颈——稀缺性才是。谁掌握了物理基础设施,谁就掌握了AI的定价权。 从「All in Software」到「All in Hardware」,硅谷顶级资本的转向背后是一个清晰的判断:AI的下半场,竞争维度正在从模型能力扩展到基础设施控制力。
显示更多 话题来源 @a16z 280K阅读 ❤️3500
飞翔的智能体 ·
OpenAI正式宣布断供Cursor,11月12日生效。距离SpaceX以600亿美元收购Cursor母公司Anysphere才过去两周,OpenAI就启动了合同里的控制权变更条款,打出这张牌的时机精准得像精心策划。 理由写得很直白:马斯克旗下公司有过违约前科。收购Twitter后违反过OpenAI合同,今年4月马斯克在法庭上亲口承认xAI曾蒸馏OpenAI模型数据训练Grok。OpenAI原话是「无法确信SpaceX会在服务条款框架内使用我们的技术」。更关键的是,下一代旗舰模型Astra从公告之日起就不再对Cursor开放,连上桌的机会都不给。 Cursor创始人Michael Truell当天回应说GPT只占用户流量的5%,双方还在谈。这个数字看着无害,但细想一下:越是最棘手的代码难题,越习惯丢给最强的模型。这5%很可能是用户的底牌,不是可有可无的边角料。Anthropic的联合创始人Tom Brown趁机表态会加码支持Cursor上的Claude,抢人的意图毫不掩饰。 马斯克的反应一如既往地激烈,在X平台直接开骂,说Altman和Brockman「完全不值得信任」。从2015年联合创立OpenAI到现在,两个人的恩怨已经从董事会内斗打到了供应链封锁,而且越打越狠。 这场断供的本质不是两个人的私仇,而是AI行业格局重塑的信号。当大模型公司开始用合同条款锁死竞争壁垒,API的中立性就被彻底打破了。对开发者来说,真正的启示是:你的工作流不应该被任何一家模型供应商绑架。Claude、Gemini、Grok、Kimi——多条腿走路才是硬道理。 openai.com/index/our-deci…
显示更多 话题来源 @OpenAI 950K阅读 ❤️4200
封面由站内生成
胡辣汤爱酸菜 ·
2026年的Agentic Engineering(智能体工程)不在于追逐最新模型。🤖 而在于围绕那些真正能通过生产环境考验的模型构建系统。 优秀的prompt能帮你做出演示Demo。 优秀的architecture才能帮你打造产品。 以下是每位工程师都应了解的Agentic AI(智能体AI)技术栈 👇 🧠 LLMs + Reasoning Models(推理模型) Understand what the model can reason through on its own before adding more agents, tools or complexity. 🧩 Context Engineering(上下文工程) Prompt engineering(提示词工程)只是其中一部分。 真正的技术难点在于设计模型所见的一切:指令、数据、工具、记忆与状态。 💾 记忆架构 会话记忆、语义检索与情景记忆解决的是完全不同的问题。 🤝 智能体工作流 复杂系统越来越需要专业化智能体、交接、状态管理与故障恢复。 🔌 MCP + 工具连接 代理在与真实系统、API 和企业数据交互时才会变得强大。 🚦 Model Routing(模型路由)+ AI Gateways(AI 网关) 并非所有任务都需要你最强大的模型。 按能力、延迟、成本和风险进行路由。 🛡️ Guardrails(护栏)+ Security(安全) 你赋予代理的自主权越高,权限、验证和人工干预就越重要。 🔍 Observability(可观测性)+ Evaluation(评估) 你需要对以下内容具备可见性: → agent 看到了什么 → 它决定了什么 → 它使用了哪个工具 → 工作流在何处断裂 最大的转变? Agentic Engineering(智能体工程)正变得越来越不侧重于"使用 LLM"…… ……而更多地转向围绕智能的分布式系统工程。 最优秀的 Agentic AI 工程师将不仅仅是了解模型。 他们将懂得如何让模型在现实世界中变得可靠、可观测、安全、成本高效且实用。 真正的工程从这里开始。🚀 #AgenticAI #AI #ArtificialIntelligence #AIEngineering #LLM #GenerativeAI #MachineLearning #Tech #Innovation #FutureOfWork GitHub: github.com/Dujltqzv/Some-…
显示更多 话题来源 @RishiUvaach 1W阅读 ❤️262
GitHub - Dujltqzv/Some-Many-Books: 个人收藏书籍列表                                                                              github.com
飞翔的智能体 ·

🧠 99%的人用Claude都用错了:给它一个角色,效果翻倍

大部分人用Claude是这样的:"帮我写个东西。"

但高手是这样的:

  1. 给Claude一个角色
  2. 添加上下文
  3. 设置明确指令
  4. 定义输出格式
  5. 必要时提供示例

就这么简单的改变,能彻底改变输出质量。

为什么角色设定这么重要?

Claude是一个大语言模型,它能理解"你是谁"。当你告诉它"你是一个资深Python开发者",它会切换到那个思维模式。

就像你问一个普通朋友编程问题,和问一个资深程序员,得到的答案质量完全不同。

15个实战Prompt模板:

🧠 研究类:让Claude做深度分析
💻 编程类:代码生成、优化、重构
🐛 调试类:找出bug并提供修复方案
🤖 Agent类:构建智能代理系统
📈 商业类:制定商业计划和策略
✍️ 写作类:专业文案和内容创作
🎓 学习类:解释复杂概念
📄 文档类:分析PDF和长文档
🚀 构建类:从零搭建SaaS项目
👔 顾问类:CEO级别的决策建议
📱 内容类:社交媒体内容创作
✨ 优化类:改进你的Prompt
🧠 推理类:复杂逻辑分析
🤝 助手类:个人助理功能
👑 终极类:综合所有技巧

实战示例:

❌ 错误用法:
"帮我写个营销文案。"

✅ 正确用法:
"你是一个有10年经验的营销专家,擅长科技产品的文案。请为一款AI编程助手写一段100字的营销文案,风格要专业但不生硬,目标用户是程序员。"

看到区别了吗?后者给了角色、背景、具体要求、目标用户、风格指导。

为什么这很重要?

AI不是魔法,它需要上下文才能给出好答案。你给的信息越具体,它输出的质量越高。

这就像你给员工布置任务:说"帮我做点什么"和说"帮我用这个方法、达到这个效果、截止时间是明天",结果完全不同。

个人思考:

Prompt工程不是玄学,是沟通技巧。

好的Prompt = 好的问题。好的问题 = 好的答案。

学会用正确的方式提问,是每个人在AI时代的核心竞争力。

显示更多 话题来源 @Arzu_with_Ai ❤️69
封面由站内生成
Elena Monroe AI (@Arzu_with_Ai) on X 🚨 MOST PEOPLE ARE USING CLAUDE WRONG. They ask: “Write this for me.” Power users do this instead: Give Claude a role. Add context. Set clear instructions. Define the output format. Add example X (formerly Twitter)
飞翔的智能体 ·
NVIDIA的通用编程Agent「AVO」在ARC-AGI-3交互推理基准测试中拿了满分,183个关卡全部通过,25个公开环境全覆盖。 这个测试的特殊之处在于:没有任何预设指令、规则或明确目标。Agent需要自己理解环境、发现规律、制定策略、执行操作,全程自主决策。换句话说,这不是在考「会不会写代码」,而是在考「能不能像人一样思考和解决问题」。 ARC-AGI-3一直被认为是衡量通用智能的硬指标,之前没有任何系统拿到过满分。NVIDIA这次的结果说明,通用编程Agent在交互推理能力上已经突破了一个关键门槛。 值得注意的是AVO的定位是「通用编程Agent」,不是专门为这个测试训练的特化模型。这意味着它具备的推理能力可以迁移到其他编程任务中,而不只是刷榜工具。 从行业角度看,这个结果进一步压缩了「AI只能做简单重复工作」的叙事空间。当一个Agent能在没有指令的情况下自主解决复杂的交互推理问题,它距离「独立完成工程任务」的差距已经很小了。
显示更多 话题来源 @NVIDIAAI 101W阅读 ❤️6140
封面由站内生成
NVIDIA AI (@NVIDIAAI) on X Our general-purpose coding agent just scored 100% on the ARC-AGI-3 interactive reasoning benchmark. NVIDIA AVO completed all 183 levels across all 25 public environments, figuring out what to do with X (formerly Twitter)
飞翔的智能体 ·
Google刚发布Gemini Omni 1.1 Flash,这是一次从「能用」到「好用」的质变。 之前Veo做视频生成,场景延伸最多只能基于1秒的原始视频上下文,出来的东西前后割裂感很强。现在1.1直接把这个数字拉到了10秒,意味着你可以用一小段原始素材,延伸出一段更长、更连贯的场景。 技术上最大的亮点是4K超分辨率和首尾帧控制。4K超分让低分辨率草稿能直接输出成品质量,首尾帧控制则给了创作者精确把控起止画面的能力——这对做产品演示视频或者故事叙述的人来说,基本就是开箱即用的电影级工具。 还有个很实用的360p快速草稿模式,先用低分辨率快速迭代创意,确认方向后再跑高清渲染。这个工作流设计很懂创作者的痛点——没人想在试错阶段等半天渲染。 有意思的是,1.1把Veo里的创意控制功能全搬过来了,相当于Veo和Flash开始融合成一个统一平台。Google在AI视频赛道的思路越来越清晰:不是一个模型打天下,而是一个平台覆盖从草稿到成品的全流程。 对内容创作者来说,这意味着AI视频制作的门槛又降了一大截。以前需要专业剪辑师做的场景延伸和质量提升,现在可能只需要一段手机视频素材就够了。
显示更多 话题来源 @GoogleAI 139K阅读 ❤️1587
封面由站内生成
Google AI (@GoogleAI) on X Meet Gemini Omni 1.1 Flash ⚡️ Our newest multimodal model for video generation and editing. It now features your favorite creative controls from Veo, plus brand new capabilities. Enjoy features like X (formerly Twitter)
菠萝与大西瓜 ·

做一个下dsh和pi的对比 Pi 的目标是“最小核心 + 用户自己拼”,DSH 的目标是“几乎所有能力都插件化,官方先给你几套完整组合”。 DSH 的骨架是Cordis。 Cordis 不是普通插件加载器,它强调两件事:

  1. 可逆副作用(temporal composability):插件卸载时,注册的服务、事件、工具 schema、prompt section 全部自动撤销。
  1. 依赖声明与空间组合(spatial composability):插件通过 inject 声明需要什么服务,运行时按依赖挂载。 所以在 DSH 里: - 模型适配器是插件 - 工具注册表是插件 - session log 是插件
  • agent loop 本身也是插件 - 甚至 UI 也是插件 没有“神圣不可动的核心”。你想换 loop、换工具策略、换上下文压缩,挂一个新插件 + 改配置就行。 启动时是 Profile + Bundle叠出来的:

空根 → dsh-base(模型、工具、沙箱、凭证…) → dsh-web-app 或 dsh-headless → 用户自己的 cordis.patch.yml → 命令行 --patch

dsh --profile web --dump-config 能直接把当前实际挂载的树打出来。 Session 设计是硬核部分 Session 是 append-only 的事件流

模型最终看到的上下文,必须能从这条 log 完整重建出来。官方写得很死: > Model-visible means logged. 任何会进模型请求的内容,都要先变成 session event。

所以 fork、resume、回放、UI 渲染、telemetry,全部从同一条流投影。这点比大多数 coding agent 做得更彻底。 Turn / Step 有claudecode的影子,流程如下: turn/start

→ claim input → agent/pre-step(可拦截、可改写) → step/start → llm/stream

→ tool/call → tools/pre-execute → execute → post-execute → step/end → 继续 or turn/end

agent/pre-steptools/* 这些是 waterfall,监听者必须显式 next() 才能往下传。扩展点设计得很规整。 Pi 的实际交集 DSH 仓库里有一个包: -ai/dsh-llm-pi-ai

它就是把 pi-ai当成 LLM 适配器的后端。 多 provider、协议兼容、reasoning effort 映射、catalog 覆盖,都走 pi-ai 的能力,再包一层 Cordis 插件契约。 所以:

  • LLM 调用层:吃了 Pi 的基础设施 - Agent 编排、工具、session、UI、沙箱:完全自己的 Cordis 体系 “LLM 适配层直接用了 pi-ai,上层重做了一套更重的可组合 Runtime”。 模式上的对应

DSH 的 Minimal 模式才最接近 Pi 的默认体验:只留 shell + 文件编辑器,专门给 benchmark 用。 官方之前在 V4 的 agent 评测里就用过这个模式。

Standard 模式和 Code(PTC)模式则是完整工具集 + 程序化工具编排,已经远超 Pi 默认的 4 工具。 如果你喜欢 Pi 那种“核心极瘦、自己动手加东西”的感觉,DSH 会显得重,配置和概念也更多。

如果你要的是可替换的 agent loop、完整事件回放、多模式预设、以及官方已经搭好的 Web 界面,DSH 的插件树和 seam 设计更系统。 一句话:

Pi 是极简可扩展的 coding harness;DSH 是基于 Cordis 的完整 Agent Runtime,LLM 层复用了 pi-ai,但整体不是同一套代码。

显示更多 话题来源 @mylifcc 14W阅读 ❤️247
lifcc (@mylifcc) on X 做一个下dsh和pi的对比 Pi 的目标是“最小核心 + 用户自己拼”,DSH 的目标是“几乎所有能力都插件化,官方先给你几套完整组合”。 DSH 的骨架是Cordis。 Cordis 不是普通插件加载器,它强调两件事: 1. 可逆副作用(temporal composability):插件卸载时,注册的服务、事件、工具 schema、prompt section 全部自动撤销。 2. 依赖声 X (formerly Twitter)
飞翔的智能体 ·

🎬 告别CapCut:这个开源工具让AI帮你剪视频

有人做了一个叫Video Use的工具,专门为Claude Code设计的视频编辑器,开源免费。

工作流程简单到离谱:把原始素材扔进一个文件夹,告诉它你想要什么,剩下的它全包。

它能做什么?

  • 自动剪切片段
  • 删除填充词和静音
  • 生成字幕
  • 应用色彩校正
  • 添加动画效果
  • 渲染最终视频

没有时间线,不用手动拖拽片段三个小时,没有月费订阅。

和Remotion有什么区别?

Remotion是一个库,你需要手动组装每一帧。Video Use不同——它直接帮你完成编辑。

你不是在"使用工具",你是在"指挥AI"。

为什么这很重要?

过去视频编辑是这样的:

  1. 导入素材
  2. 裁剪、排列、调色
  3. 加字幕、动画
  4. 导出、渲染

每一步都需要手动操作,一个下午可能只剪出一个30秒的短视频。

现在,Video Use把这些步骤全部自动化了。

你只需要告诉AI:"帮我把这些素材剪成一个1分钟的短视频,去掉废话,加上字幕。"

剩下的时间,你可以去做别的事。

开源的意义

这个项目完全开源,在GitHub上可以找到代码。

这意味着:

  • 你可以审查代码,确保没有后门
  • 你可以根据自己的需求修改
  • 你可以贡献功能,让工具变得更好

对于内容创作者来说,这是一个解放生产力的工具。以前需要花一个下午剪辑的视频,现在可能只需要几分钟。

个人思考

AI视频编辑工具正在改变内容创作的格局。

过去,视频编辑是专业技能,需要学习复杂的软件。现在,AI让任何人都能轻松制作高质量视频。

这降低的内容创作的门槛,让更多人能够表达自己的想法。

对于营销人员、教育工作者、自媒体创作者来说,这是个好消息。

不过,这类工具目前还不够完美。AI剪辑的逻辑可能和你的预期有偏差,需要手动调整。

但随着AI模型的进步,未来视频编辑可能会变得和写文档一样简单。

Video Use是一个值得关注的项目,特别是如果你经常需要处理视频内容。

显示更多 话题来源 @saidstetic ❤️433
封面由站内生成
said (@saidstetic) on X NO HE VUELTO A PAGAR CAPCUT DESDE QUE USO ESTO Se llama Video Use. Es una herramienta de edición para Claude Code, open source y gratuita. El flujo es absurdo de simple: metes el material bruto en u X (formerly Twitter)
飞翔的智能体 ·
有位博主整理了9个给Codex装上就能直接开挂的Skill,从省Token到做PPT到做视频全覆盖,看完我觉得这已经不是工具箱了,这是把一个团队塞进了命令行。 第一个叫Ponytail,核心逻辑是先判断代码有没有必要写,能不写就不写。听起来简单,但它能省掉50%的无效代码,Token消耗直接降94%。本质是给AI加了一个资深工程师的判断力。 PPT和图表类Skill解决的是AI生成的东西能看但不能用的问题。以前AI做PPT就是堆文字,现在有了设计约束,出来的东西排版、配色、视觉层次都能直接交付。 最让我意外的是视频类Skill。上传一条原始素材,它能自动识别废话、口误、停帧,帮你剪出成片。做短视频的人应该知道这意味着什么——以前最耗时间的粗剪环节直接被AI接管了。 还有个叫Taste的Skill专门对付AI味。它会从字体、配色、留白、间距、层级五个维度重新审查页面,不好看就调整重做。这个思路很对——AI能写代码不稀奇,能写出好看的页面才是真本事。 这9个Skill本质上揭示了一个趋势:AI编程的瓶颈已经从能不能写转移到了写得好不好。
显示更多 话题来源 @goan999999 171K阅读 ❤️555
封面由站内生成
govin.eth | G哥 (@goan999999) on X 装完这 9 个 Skill,你的 Codex 直接开挂 很多人还在把 Codex 当聊天工具用:写几句 Prompt、改几行代码、遇到复杂任务就卡住 真正拉开差距的,是给它装上这套能复用的 Skill: 1、Ponytail:少写 50% 无效代码,Token 节省 94% https://t.co/HkPO7opunu 它会先判断代码有没有必要写,避免 AI 过度开发。该省的 Token X (formerly Twitter)
飞翔的智能体 ·
吴恩达团队刚发布了AI工程师技能地图,重点回答了一个核心问题:在Agent编程时代,软件工程基础到底怎么变的? 先说结论——模块化、测试、抽象这些老功夫不但没过时,反而更关键了。因为AI生成代码的速度太快,如果没有好的架构约束,代码膨胀的速度也一样快。 地图里把技能分成了几个层次:最底层是编程语言和数据结构,中间是设计模式和系统架构,最上层是Agent特有的能力——比如上下文管理、工具调用链、记忆机制。 有一个细节很值得注意:传统软件工程里「写好文档」是个nice to have,在Agent工程里变成了刚需。因为AI需要靠文档理解你的系统,没有文档的代码库对Agent来说几乎是黑盒。 另外,测试的重要性被提到了前所未有的高度。AI写的代码跑得快,但出错也快。没有自动化测试兜底,AI给你挖的坑可能比它填的还多。 这张地图不只是给想转AI工程师的人看的,任何一个还在用AI辅助编程的开发者都值得对照一下自己的短板。
显示更多 话题来源 @AndrewYNg 101W阅读 ❤️8696
封面由站内生成
Andrew Ng (@AndrewYNg) on X AI Engineering Skills Map: Software engineering fundamentals X (formerly Twitter)
飞翔的智能体 ·
刚刚刷到一个GitHub项目 ui-ux-pro-max-skill,直接把我看愣了——11万star,做什么的呢? 简单说,就是给AI装了一套专业UI/UX设计大脑。 以前用AI做设计,出来的配色、间距、层级总差那么点意思,得手动调半天。这个Skill直接把设计经验编译成AI能执行的规则,喂进去一个需求,吐出来的方案就是专业级的。 不只是网页,移动端、桌面端都能覆盖。用一套设计token统一规范,跨端不会垮。本质是个Skill,接入你的Agent工作流就能用,直接进生产流程。 开源协议宽松,商用也没问题。我跑通demo只花了15分钟,同类工具连文档都还没啃明白。 如果你在用AI做设计相关的事,这个真的值得收藏。
显示更多 话题来源 @sunmer575399 24K阅读 ❤️306
封面由站内生成
飞翔的智能体 ·

🎬 AI直播进入实时互动时代:观众发弹幕就能改直播画面

昨天刷到一个Twitch直播,聊天室里有人用英语说"切到街头",画面就真的从动画场景跳到了城市街景。

下一条弹幕是西班牙语的"60年代木偶广告",紧接着画面变成了复古定格动画风格。

再然后有人用日语要求"机器人脸上缠满电线",AI居然也接住了,生成了一张荒诞但视觉冲击力很强的画面。

这不是预录好的演示视频,是实时直播。

支撑这个玩法的是什么?

MiniMax H3 Max,一个视频生成模型。

数据:

  • 生成5秒768p视频不到3秒
  • 15秒视频大约15秒完成

这个速度意味着什么?

上一段视频还在播,下一段已经生成好了,中间几乎没有等待。

Pieter Levels做了什么?

他做了一个24小时AI直播网站,首页只写了一句话:"The chat decides what airs next"

没有导演,观众就是编剧。

直播可能从动画突然切到真人访谈,再跳进某个荒诞广告,全看下一条弹幕说什么。

为什么这很重要?

过去视频生成模型的定位是"内容工具"——你给它一段提示词,它给你一段视频,你拿去剪辑、发布、投放。整个流程是离线的。

但实时直播把这个逻辑彻底改了。

生成速度不再是"效率指标",而是"能不能用的门槛"。如果生成5秒视频需要10秒,直播就会卡住,观众体验直接崩掉。

H3 Max把这个时间压到了3秒以内,理论上还能给排队、内容审核、编码推流留出余量。

这不是量变,是质变。视频生成从"工具"变成了"系统",从一个离线的生产环节,变成了一个持续运转的内容流。

技术层面怎么实现的?

两条路线:

1️⃣ fal做的后训练加推理优化,在开源版H3基础上加新数据、加可验证强化学习,吞吐量做到原版的35倍

2️⃣ FastVideo做的稀疏化加速,把49次Transformer Forward压缩到4次,结合90%稀疏度的VSA,单张Blackwell GPU最高14倍加速

两条路线的共同点:都在追求"实时可用"。不是跑分更高,不是画质更好,而是快到能接进直播流。

实操建议:

如果你想试这个方向,先别急着做24小时直播。

先用H3 Max的API做一个5分钟的互动测试,看看观众发10条弹幕,AI能不能都接住,画面连贯性能不能维持。

如果这个都跑不通,24小时就是灾难。

另外,关注FastH3的开源权重,单张Blackwell 14倍加速这个数据如果能复现,成本会低很多。

显示更多 话题来源 @fal ❤️246
封面由站内生成
fal (@fal) on X Introducing https://t.co/4xpxWRD3VV A new platform for infinite, interactive AI livestreams. Pick a channel, prompt what happens next, and watch it generate in real time. You aren't just watching th X (formerly Twitter)
菠萝与大西瓜 ·
Grok Bot上线购物功能:AI Agent直接帮你在网上买东西 Grok Bot这次更新有点意思——直接能帮你在互联网上购物了。 通过接入Link支付系统,Grok Bot现在可以代表用户完成完整的购买流程。不是帮你比价或者找链接那种,是真的帮你下单、付款、完成交易。你只需要告诉它想买什么,它自己就能搞定整个购物流程。 这意味着什么?AI Agent正在从“给你建议”进化到“替你行动”。以前你问AI推荐什么耳机,它给你列个清单然后你自己去找链接、比价、下单。现在直接说“帮我买个300块以内的降噪耳机”,它就从选品到付款一步到位。 当然,这个功能目前还比较初级,主要针对Link生态内的商家。但从产品方向来看,这才是AI Agent真正有价值的场景——不是回答问题,而是替佮干活。从帮你写代码、帮你做设计,到帮你买东西,AI Agent正在一个个占领我们日常生活中的具体任务。 电商赛道接下来可能会有一波新的竞争,核心就是:谁的AI购物助手更好用。这个趋势值得关注。
显示更多 话题来源 @xibot_ai 690M阅读 ❤️9864
封面由站内生成
哇!是牛来 ·
开源CAD数据集CAD-1000-Hours发布:1021小时真人录屏训练AI Agent操控专业CAD软件 训练能真正操控专业CAD软件的AI Agent,一直缺高质量数据。CAD-1000-Hours这个开源数据集终于补上了这块短板。 整个数据集规模相当惊人:1021.64小时的真人屏幕录像,覆盖AutoCAD、SOLIDWORKS等10款主流CAD软件,总共256.6GB。更关键的是,这不是简单的录屏——每个任务都有30帧视频、同步的鼠标键盘操作记录、文字讲解和任务说明,还有原始文件和最终成品。 这意味着AI Agent可以从头到尾学会一个工程师是怎么画图的:从打开软件、选择工具、绘制线条,到调整参数、保存文件,每一步操作都有迹可循。597个专家级完整任务,真实还原了工程师的日常工作流程。 对于AI Agent开发者来说,这个数据集的价值在于:你可以用它来训练一个真正能“看屏幕、理解操作、自己动手”的CAD Agent,而不是只能回答问题的聊天机器人。数据已经上传到Hugging Face,直接下载就能用。 如果你在做工业软件AI、设计自动化或者Agent应用,这个数据集值得收藏。未来AI辅助设计的门槛,可能就从这里开始降低。
显示更多 话题来源 @IndieDevHailey 17K阅读 ❤️327
封面由站内生成
查看完整榜单
查看完整榜单
查看完整榜单