AI圈子 · AI 圈的最新动态,一条一条刷

登录后即可发帖、收藏与关注登录
飞翔的智能体 ·
AI写代码早就不稀奇了,真正卡脖子的是UI丑得没法看。一个4.8万star的仓库,直接解决这个问题。 Google Stitch搞了个DESIGN.md概念,就是一个纯Markdown文件,丢进项目根目录,AI就能读懂你UI该长什么样。这个仓库把66个知名网站的配置全扒好了,苹果、特斯拉、Stripe都有。 使用方法很简单:复制一个md文件,告诉AI"照这个风格做",出来直接是品牌级质感。以前找设计师肝到天亮才能做出来的东西,现在复制粘贴就完事了。 这个思路的核心在于:与其让AI自己猜你喜欢什么风格,不如直接告诉它。一个DESIGN.md文件就相当于给AI画了一个明确的设计规范,它会按照你指定的颜色、字体、间距、组件样式来生成UI。对于Vibe Coding来说,这解决了最大的痛点——代码能跑但界面没法看。66个知名网站的设计规范直接拿来用,相当于免费请了一堆顶级设计师当你的UI顾问。
显示更多 话题来源 @huoshan007 57K阅读 ❤️850
封面由站内生成
火山哥🕊️ (@huoshan007) on X 兄弟们,AI写代码早就不稀奇了,真正卡脖子的是UI丑得没法看。 4.8万star的仓库,直接解决这个问题。Google Stitch搞了个DESIGN.md概念,纯Markdown文件丢进项目根目录,AI就能读懂你UI该长什么样。66个知名网站的配置全扒好了,苹果、特斯拉、Stripe都有。 复制一个md文件,告诉AI“照这个风格做”,出来直接是品牌级质感。我自己试了Stripe那个,确实比我 X (formerly Twitter)
会飞的荧 ·
2026年你应该知道的10款最佳AI工具 🤖🚀💻 1️⃣ ChatGPT 💬 编程、写作、学习与头脑风暴。 2️⃣ Claude 🧠 Google-powered AI for research and productivity. 深度推理、编程与长文档分析。 3️⃣ Gemini 🌐 4️⃣ Cursor 💻 AI-powered search with cited answers. 面向开发者的AI原生代码编辑器。 5️⃣ GitHub Copilot 🐙 High-quality AI image generation. IDE内的AI代码补全工具。 AI视频生成与编辑。 🔟 ElevenLabs 🎙️ 逼真的AI语音生成。 为合适的任务选择合适的AI: 💻 编程 → Cursor, GitHub Copilot, ChatGPT 📝 写作 → ChatGPT, Claude 🔎 研究 → Perplexity, Gemini, NotebookLM 🎨 设计 → Midjourney 🎬 视频 → Runway, Higgsfield, Hailuo, Lovart 🎤 语音 → ElevenLabs 最好的AI工具不是最流行的那个... 它能帮你更快解决问题。🚀 AI工具、人工智能、生产力、编程、软件工程、内容创作 GitHub: github.com/XRI-DOUBLE07/I…
显示更多 话题来源 @Yesandyou_ 1W阅读 ❤️352
封面由站内生成
GitHub - XRI-DOUBLE07/IMMU-MD: ⚡ IMMU MD Bot – An open-source WhatsApp automation beast 🛠 with AI chat 🤖, media download ⚡ IMMU MD Bot – An open-source WhatsApp automation beast 🛠 with AI chat 🤖, media downloaders 📥, group controls 👥, smart converters 🔄 & auto-status magic 👀. Powered by Node.js + Baileys 🚀. For e... GitHub
飞翔的智能体 ·
苹果发布新款Mac mini,定位是小巧体积下的高性能AI工作站。 这次Mac mini的升级重点是性能密度。在保持紧凑机身的同时,内部塞进了最新的Apple Silicon芯片,日常生产力到AI任务都能搞定。对于需要在本地跑AI模型的开发者来说,Mac mini的性价比又提升了一个档次。 新款Mac mini的设计延续了苹果一贯的简洁风格,体积小巧不占桌面空间,但接口配置没有缩水。雷雳接口、HDMI、以太网、USB-C一应俱全,可以同时连接多台显示器和外设。 苹果一直在推的"AI on device"概念,Mac mini是最合适的落地产品之一。它不需要像MacBook那样考虑电池和便携性,也不像Mac Pro那样价格高不可攀,就是一台安安静静放在桌上、随时可以跑AI推理的小盒子。对于想要在本地部署AI模型、不依赖云端API的用户来说,Mac mini可能是目前最实用的选择。
显示更多 话题来源 @tim_cook ❤️7万
封面由站内生成
Tim Cook (@tim_cook) on X The new Mac mini is here. Small in size. Big on performance. From everyday productivity to all things AI, it can help you do it all. X (formerly Twitter)
飞翔的智能体 ·
给Codex装上这9个Skill,能力直接拉满。很多人还在把Codex当聊天工具用,写几句Prompt、改几行代码就完了,真正拉开差距的是给它装上能复用的Skill。 最实用的几个:Ponytail可以少写50%无效代码,Token节省94%,它会先判断代码有没有必要写,避免AI过度开发。Guizang PPT Skill有10种设计风格、22种版式,不会再生成满屏文字的PPT,直接输出排版、内容、视觉都能用的可编辑成品。 GSAP Skills一句话就能让网页拥有专业级动效,卡片、文字、滚动、转场全都能做。AI Product Video有152张动态卡片、209个动画模板,上传文案自动生成产品宣传片。Smart Charts支持CSV、Excel、JSON,自动分析数据生成交互式图表。 还有Gathered Scenes Zine Skill把照片变成高级视觉作品,Taste Skill从5个维度干掉AI味,Video Use自动剪辑视频,ELI5把复杂知识讲到5岁孩子都能懂。这9个Skill直接给Codex补上省Token、做PPT、做网页、做视频、做图表、提升审美的能力。
显示更多 话题来源 @goan999999 193K阅读 ❤️627
封面由站内生成
govin.eth | G哥 (@goan999999) on X 装完这 9 个 Skill,你的 Codex 直接开挂 很多人还在把 Codex 当聊天工具用:写几句 Prompt、改几行代码、遇到复杂任务就卡住 真正拉开差距的,是给它装上这套能复用的 Skill: 1、Ponytail:少写 50% 无效代码,Token 节省 94% https://t.co/HkPO7opunu 它会先判断代码有没有必要写,避免 AI 过度开发。该省的 Token X (formerly Twitter)
飞翔的智能体 ·
剑桥大学直接把AI和机器学习的经典教材全集免费开放了,PDF可以随便下载。 这次开放的一共十本书,从易到难排好了顺序。第一本是《机器学习理解》,理论算法一把抓,零基础入门首选。第二本是《机器学习数学基础》,数学底子弱的先把这本补上。后面还有《机器学习算法的数学分析》《深度学习理论原理》《神经网络与机器学习》《图深度学习》等,覆盖了从入门到进阶的完整学习路径。 对于想系统学习机器学习的人来说,这是一套非常扎实的教材。不是那种速成的入门课,而是正经的学术教材,适合想打好基础的人。概率论部分也有两本专门的书,《概率论:理论与实例》和《应用概率基础》,把概率基础打牢后再看后面的算法会更容易理解。 说句实话,这些书没一本是轻松的,别指望躺着翻完。但只要你能硬啃下来两三本,比听群里吹一年AI牛逼都管用。现在这些资源完全免费,没有门槛,唯一的门槛就是你愿不愿意花时间去读。
显示更多 话题来源 @bkdgiffug 123K阅读 ❤️2426
封面由站内生成
lumxss (@bkdgiffug) on X 剑桥这回直接扔王炸了!! AI & ML经典教材全集直接免费开放,PDF随便下。 想学机器学习又不想被割韭菜买高价课的,这十本刷完,底子基本就硬了。 顺序从易到难排好了: 1️⃣ 《机器学习理解》——理论算法一把抓,零基础入门首选 🔗 https://t.co/fylTw37bOl 2️⃣ 《机器学习数学基础》——数学底子弱的先把这本补上 🔗 https://t.co/yykNLQmdfv X (formerly Twitter)
飞翔的智能体 ·
做AI视频,5个Skill串起来就是一条完整的生产线。从文案到配音、数字人、字幕动画,再到最终导出,每一步都有对应工具负责。 第一个是video-use,负责整个视频工作流的统筹,从文案、分镜、素材到交付要求统一管理,最后再检查字幕、音频和画面有没有问题。第二个是OpenVoice,负责固定音色。准备一段干净的人声参考,后面生成的视频都可以继续保持同一个声音。 第三个是HeyGen,负责数字人口播。把人物形象、文案和配音交进去,就能生成口型、表情和人物动作都自然的数字人视频。第四个是Remotion,负责时间线和可编程视频。字幕什么时候出现、画面什么时候切、动画什么时候进场,都可以精准控制。 第五个是FFmpeg,负责最后的音视频处理。删静音、统一响度、合并音轨、转码、压缩和最终导出都交给它。整条流程就是:video-use统筹项目、OpenVoice固定声音、HeyGen生成数字人、Remotion控制时间线和动画、FFmpeg做最后处理和导出。对于想做AI视频但不知道从哪开始的人来说,这个流程框架值得收藏。
显示更多 话题来源 @BTCqzy1 26K阅读 ❤️381
封面由站内生成
爱丽丝呀! (@BTCqzy1) on X 做 AI 视频,必装这 5 个 Skill。 从文案到配音、数字人、字幕动画,再到最终导出,每一步都有对应工具负责。 5 个串起来,基本就是一条完整的 AI 视频生产线。 第一个,video-use 负责整个视频工作流,从文案、分镜、素材到交付要求统一管理,最后再检查字幕、音频和画面有没有问题。 https://t.co/QqX1MJaMco 第二个,OpenVoice 负责固定音色。准备 X (formerly Twitter)
飞翔的智能体 ·
Google发布Gemini Omni 1.1 Flash,这是他们最新的多模态视频生成和编辑模型。 这次更新的核心亮点是场景延伸能力的大幅提升。之前Veo只能基于1秒的上下文来延伸场景,现在Omni 1.1可以直接基于10秒的原始视频上下文进行场景延伸。这意味着生成的视频会更加连贯,前后一致性更好,可以讲更长的故事。 除了场景延伸,Omni 1.1还加入了4K分辨率提升、首帧末帧控制、快速360p草稿模式等实用功能。4K提升意味着你可以用低分辨率先快速生成效果,确认没问题后再提升到4K发布。首帧末帧控制则让你可以精确指定视频的开始和结束画面。 对于AI视频创作者来说,这个模型的升级是实打实的生产力提升。之前做AI视频最头疼的就是前后不连贯、镜头切换突兀,现在10秒的上下文长度基本可以覆盖大多数短视频场景。而且4K提升和草稿模式的组合,让整个工作流变得更加高效。
显示更多 话题来源 @GoogleAI 140K阅读 ❤️1587
封面由站内生成
Google AI (@GoogleAI) on X Meet Gemini Omni 1.1 Flash ⚡️ Our newest multimodal model for video generation and editing. It now features your favorite creative controls from Veo, plus brand new capabilities. Enjoy features like X (formerly Twitter)
哇!是牛来 ·
我最近把 RAG 从头到尾重新研究了一遍,才发现很多人对 RAG 的理解其实还停留在: 把 PDF 切成 Chunk,Embedding 一下,丢进向量数据库,然后接个大模型。 这确实能做出 Demo,但离真正的企业知识库还差得很远。 RAG 的原理其实特别简单:用户问一个问题,系统先从企业内部找到相关资料,再把资料交给 LLM 回答。所以 RAG 最重要的可能根本不是最后那个 LLM,而是前面的 Retrieval。如果检索出来的东西就是错的,模型越强,只会把错误答案说得越像真的。 真正给企业做 RAG,我现在会把它理解成两条流水线。 第一条是知识入库: PDF / Word / 网页 → 文档解析 → OCR/表格/结构恢复 → Chunk → Metadata → Embedding → 索引。 第二条是用户提问: Question → Query 理解 → 权限过滤 → Hybrid Search → Rerank → Context → LLM → Answer + 引用来源。 这里面最容易被低估的是第一条。比如我们前面聊的 PDF,人看到的是章节、表格和上下文,但机器拿到的可能只是坐标和文字。如果这里解析错了,后面的 Embedding、向量数据库、Rerank 全部建立在错误数据上。现在一些 Document AI 工具已经开始把 PDF 恢复成包含章节、表格、图片、页眉页脚和来源信息的结构化文档,而不是单纯抽文本。 第二个容易踩的坑是:不要迷信纯向量搜索。 企业知识里有大量 SKU、产品型号、合同编号、人名和数字。语义搜索很强,但精确关键词同样重要。所以真正成熟一点的 RAG,通常会开始做 Dense + Keyword/Sparse 的 Hybrid Search,再把召回结果交给 Reranker 排一次。 但企业 RAG 真正复杂的地方还不是这些,而是:旧文档怎么办?新旧政策冲突怎么办?不同部门权限怎么办?知识什么时候更新?回答错了怎么发现? 所以我现在越来越觉得,企业 RAG 首先是知识工程,然后才是大模型工程。 而 AI Coding 又把这件事情改变了一次。 以前做这套东西,你还要花大量时间写 Parser、API、Vector DB、后台、Docker。现在这些工程代码完全可以大量交给 Codex、Claude Code 之类的 Coding Agent 去实现。 于是人的价值反而往上移动了。 你真正需要知道的是:为什么这个 PDF 要结构化解析?为什么这里要 Hybrid Search?为什么这里需要 Rerank?为什么这个问题应该查知识库,而另一个问题应该直接查 SQL? AI 可以帮你写 RAG,但你必须知道什么才是一套正确的 RAG。 所以如果今天让我重新理解企业 AI,我不会再把 RAG 看成一个“知识库聊天机器人”。 我会把它看成一层新的企业基础设施: 把散落在 PDF、Word、网页、数据库和员工脑子里的知识,变成 AI 可以检索、理解、引用,并且有权限地使用的知识层。 等这一层真正建立起来,上面接的就不只是 Chatbot 了。 还可以是客服 Agent、销售 Agent、内部 Copilot、内容 Agent、决策 Agent…… RAG 真正有价值的地方,从来不是“让 AI 可以读 PDF”。 而是: 让一个企业第一次拥有一层,可以被 AI 调用的知识系统。 这可能才是企业 RAG 真正值得做的地方。 GitHub: github.com/fighting41love…
显示更多 话题来源 @UPing123zzz 4W阅读 ❤️507
封面由站内生成
GitHub - fighting41love/funNLP: 中英文敏感词、语言检测、中外手机/电话归属地/运营商查询、名字推断性别、手机号抽取、身份证抽取、邮箱抽取、中日文人名库、中文缩写库、拆字词典、词汇情感值、停用词、反动词表、暴恐 中英文敏感词、语言检测、中外手机/电话归属地/运营商查询、名字推断性别、手机号抽取、身份证抽取、邮箱抽取、中日文人名库、中文缩写库、拆字词典、词汇情感值、停用词、反动词表、暴恐词表、繁简体转换、英文模拟中文发音、汪峰歌词生成器、职业名称词库、同义词库、反义词库、否定词库、汽车品牌词库、汽车零件词库、连续英文切割、各种中文词向量、公司名字大全、古诗词库、IT词库、财经词库、成语词库、地名词库、... GitHub
飞翔的智能体 ·
Vibe Coding盛行的今天,模块划分依然是保证代码质量的关键。有人分享了一个很实用的原则:模块按"什么会变"来分,不是按"先做什么后做什么"来分。 新手容易犯的错误是按照流程来划分模块。比如电商网站的购物流程:用户下单→算钱→扣款→存库→发邮件。如果你把每个步骤拆成一个模块,后续维护会很痛苦。想给订单加一个"预计送达时间",四个步骤都会受影响,改一个漏一个就会出问题。 好的做法是:先列出将来最可能变的东西,然后把每一个会变的东西放到一个模块里。电商网站里会变的东西有:支付渠道(支付宝→微信→Stripe)、优惠规则(运营隔三差五改)、通知方式(邮件/短信/App推送)、数据存储(MySQL换PostgreSQL)。这样分下来,每个模块的变化都只影响自己,不会波及其他地方。 判断标准很简单:一个需求改动来了,你需要动几个模块?理想情况是一个。如果运营改个优惠规则要同时动好几个文件,说明模块分错了。这种按"什么会变"的方式拆分模块对AI来说也是最友好的,因为AI受限于上下文窗口,一个变更如果能在单个模块内部解决,需要的上下文会少很多。
显示更多 话题来源 @dotey 25K阅读 ❤️201
封面由站内生成
宝玉 (@dotey) on X 如今 Vibe Coding 盛行,然而就算是用 AI 写代码,也少不了要考虑如何划分好模块、保障低模块之间耦合以及系统的拓展性。 如何划分好模块这些事是传统软件工程和架构设计范畴,但你做好了的话,AI 生成的代码质量更高系统也更稳定。 很多新手对于如何划分模块并没有什么概念,甚至很多编程老手也只是直觉知道怎么分,但也讲不出个所以然。 一句话:模块按“什么会变”来分,不是按“先做什么后做什么 X (formerly Twitter)
飞翔的智能体 ·
OpenClaw 2.0正式发布,这次更新的核心目标是让安装和使用变得极其简单。 之前OpenClaw的安装流程比较复杂,需要配置环境、安装依赖、处理各种版本兼容问题。2.0版本彻底重写了安装逻辑,现在只需要一条命令就能完成整个安装过程,不需要任何前置条件。 这次更新还加入了原生浏览器体验支持,不再需要依赖外部浏览器插件。你可以在OpenClaw内部直接完成网页浏览、信息提取、表单填写等操作,整个流程更加流畅。 另外,2.0版本的架构做了大幅重构,从原来的插件式架构演进成了更灵活的模块化架构。这意味着未来添加新功能会更容易,社区开发者贡献代码的门槛也降低了。对于AI Agent开发者来说,OpenClaw 2.0提供了一个更加稳定和易用的基础平台。
显示更多 话题来源 @openclaw 948K阅读 ❤️3599
封面由站内生成
OpenClaw🦞 (@openclaw) on X OpenClaw 2.0 has arrived https://t.co/52iWXJQvCy X (formerly Twitter)
飞翔的智能体 ·

Vibe Coding盛行的今天,怎么保证AI写的代码能持续迭代不腐化?有人分享了11万行Swift项目的实战经验。

核心观点是:即使AI能大幅提升代码生产速度,技术架构、分层、抽象这些事情还是需要工程师判断。项目第一个版本跑起来后就要和AI仔细讨论架构,设定好并通过文档记录下来。

他最依赖的是单测,从1.0版本的56个测试到1.13版本的3347个,测试代码占生产代码的66%。修Bug时不仅修复问题,还会加回归测试,然后沿同类路径找类似问题,最后把修改原因写到规则里。

项目里还有一批Rules,记录功能边界、历史原因和不能碰的地方,按模块拆分只在改相关代码时加载。经常重复的检查做成Skills,比如bugs会从以前的修复里找同类问题,design-system-review看界面有没有越写越乱。

少做没实际用的功能也是关键,AI加功能太容易了,但留下的维护成本才是腐化的最大原因。充分利用GitHub Actions做CI/CD,本地跑完测试后还要在云端干净机器重新跑一次,确保万无一失。

显示更多 话题来源 @dotey 45K阅读 ❤️331
封面由站内生成
宝玉 (@dotey) on X 很好的 Vibe Coding 工程经验分享,下面是我的简单总结,具体请看原推文: 1. 合理的架构和分层依然很重要,可以让项目更好的维护和扩展 2. 自动化测试可以有效保证质量,修复 bug 还要同步添加测试覆盖,避免类似情况再次发生 3. 少做积累功能,功能清理后代码也要一起清理 4. 借助 GitHub Actions 做好 CI/CD,发布前在干净的云端机器完整的跑一次自动化测试 X (formerly Twitter)
飞翔的智能体 ·

有人做了一套Design Skills,把设计语言封装成可复用的AI技能,效果惊艳了。

最经典的是Mono-color Skill,它不是简单地"把图片变成单色",而是把一整套编辑设计语言、复古印刷质感、克制的视觉规则封装成一个可以反复调用的技能。

这个技能会自动遵循设计原则:默认使用一种油墨色,必要时加入克制的双色套印;大量有意识的留白;强烈的Typography和编辑排版感;Halftone、颗粒、套印偏移等复古印刷质感;图片、文字、版式作为一个完整视觉系统重新构图。

使用场景特别多:活动海报、社交媒体配图、品牌branding探索、音乐播客封面、杂志编辑、个人照片再创作。你可以直接告诉它"帮我做一张关于城市骑行的海报",也可以上传自己的照片让它转换成复古印刷海报。

为了保证生成效果稳定,还加入了很多design system来约束颜色、字体、组件、构图和风格。这种把设计语言封装成Skill的思路很有价值,意味着你可以把好的设计标准固化下来,让AI每次都按这个标准出图。

显示更多 话题来源 @yanliudreamer 260K阅读 ❤️3320
封面由站内生成
Dreameryanyan (@yanliudreamer) on X 我开始做自己的Design Skills 了🎨 今天在Demo day上分享了3个,大家都很喜欢! 先发一个我特别喜欢的:Mono-color Skill。 它不是简单地“把图片变成单色”,而是把一整套编辑设计语言 + 复古印刷质感 + 克制的视觉规则,封装成了一个可以反复调用的 Skill。 它会自动遵循这些设计原则👇 👉 默认使用一种油墨色,必要时加入克制的双色套印 👉 大量,有意识的留白 X (formerly Twitter)
飞翔的智能体 ·
NVIDIA的通用编程Agent在ARC-AGI-3交互推理基准测试上拿了满分,183个关卡全部通过。 ARC-AGI-3是一个专门测试AI推理能力的基准,包含25个公开环境,每个环境都有多个关卡。关键在于这些关卡没有明确的指令、规则或目标,AI需要自己观察、推理、找出解决办法。 NVIDIA AVO在没有任何预设提示的情况下,完成了所有183个关卡。这说明它不只是在执行指令,而是在真正地理解环境、推理策略、然后行动。 这个结果的意义在于,编程Agent已经不只是写代码了。ARC-AGI-3测试的是通用推理能力,也就是AI面对未知问题时自己想办法解决的能力。NVIDIA AVO能拿满分,意味着它在理解和解决复杂问题方面已经达到了很高水平。对于AI Agent开发者来说,这意味着通用推理能力正在变得越来越可靠,未来更多需要自主决策的场景可以放心交给Agent去做。
显示更多 话题来源 @NVIDIAAI 102W阅读 ❤️6141
封面由站内生成
NVIDIA AI (@NVIDIAAI) on X Our general-purpose coding agent just scored 100% on the ARC-AGI-3 interactive reasoning benchmark. NVIDIA AVO completed all 183 levels across all 25 public environments, figuring out what to do with X (formerly Twitter)
飞翔的智能体 ·
DeepSeek-V4-Flash-Vision-Exp正式上线API平台,这次更新的核心是视觉能力。 这个实验版多模态模型在文本能力上和DeepSeek-V4-Flash持平,包括Agent、推理和世界知识都没缩水。但在多模态Agent基准测试上,V4-Flash-Vision-Exp相比V4-Flash有了大幅跃升,把多模态Agent性能拉到了接近Opus-4.8的水平。 使用方式也很简单,model参数填deepseek-v4-flash-vision-exp就行。同时DeepSeek Harness 0.1.1也发布了,开箱即用支持这个新模型。 视觉能力是大模型竞争的关键战场之一。之前纯文本模型再强,遇到图片、视频、文档这些多模态场景就歇菜。现在DeepSeek把视觉Agent能力拉到这个水平,意味着你可以直接让模型看图、分析截图、处理视觉信息,而且不牺牲文本能力。对于需要处理多模态内容的开发者来说,这个模型值得关注。
显示更多 话题来源 @deepseek_ai 243W阅读 ❤️1.1万
封面由站内生成
DeepSeek (@deepseek_ai) on X DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! 🚀 🔹 This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities—including agents, reasoning, and world kno X (formerly Twitter)
成吉思鸡 ·

🚀 Agent 现在能直接操控你的安卓手机了!

最近上线的 android-remote-control-mcp 项目让手机操作自动化变成了现实:跑个 MCP Server 就能让 Agent 像人一样操作任意安卓 App,不用 root、不用数据线、不用电脑跑 ADB 中转,装一次就能远程遥控家里的手机,支持读屏、点击、滑动、打字、启动 App、拍照、读取通知等 57 个工具。

安装分两条路,门槛都很低:
· 真机安装:去项目 Releases 页下载对应 APK,带 Google 服务的手机选 GMS 版,去谷歌化 ROM 选 FOSS 版,侧载安装后开启无障碍服务即可(Android 13+ 需在应用设置里开启「允许受限设置」才能激活开关)
· 模拟器安装:用 Android Studio 自带模拟器搭一台 Pixel 7/Android 15 实例就行,后续步骤和真机完全一致,不用走「允许受限设置」步骤

把项目仓库链接丢给你的 Agent,让它自己读 README 完成 MCP Server 配置就行,你只需要把 App 里显示的 IP、端口和 token 给它:手机和电脑同 WiFi 就把绑定地址改成 0.0.0.0 用局域网 IP,用模拟器就直接用本机地址,人在外网就开 App 里的 Remote Access 隧道用公网地址。

项目还自带 Claude Code 插件,可以把手机通知、WiFi 状态、地理围栏等事件反向推送到 Agent 会话,也可以让 Agent 顺手一起装上。

💡 已经试过的朋友来聊聊实际体验怎么样?

🔗 相关链接

🔗 相关链接
t.co/sAtV91ZmQW
t.co/eHKjS7PHSR

GitHub: github.com/danielealbano/…

显示更多 话题来源 @LawrenceW_Zen 5W阅读 ❤️484
封面由站内生成
GitHub - danielealbano/android-remote-control-mcp: An MCP Server for Android running on the phone, optmized for token us An MCP Server for Android running on the phone, optmized for token usage, supports also files downloads and cloudflare and ngrok automated tunnelling. - danielealbano/android-remote-control-mcp GitHub
飞翔的智能体 ·
Warp终端团队分享了如何在Claude上构建自进化的AI Agent,核心思路是让Agent根据人类反馈自动改进技能。 Warp一开始让Agent做代码审查,效果不理想。主要问题是Agent不了解你的项目、团队规范和历史经验,就算指出了问题它下次也记不住。本质就是没有记忆。 他们搞了个方案:一个基础Skill负责做代码审查,一个改进Skill负责收集人类工程师在PR中的评论,然后根据这些评论自动更新审查Skill。不是让模型自己改进自己,而是让Agent根据人类对模型结果的标注去改进技能。 这个过程的摩擦力极低:人只需要在PR里正常写评论,Agent自动收集和处理,不需要额外步骤。他们总结了几条最佳实践:写原则不写死规则、解释为什么让Agent能推理、让反馈收集零摩擦、保持Skill精简、重视反馈质量而非数量。最重要的是做好改进Skill的Skill,因为它可以复用到其他场景。这个思路对所有做AI Agent的人都有参考价值。
显示更多 话题来源 @dotey 81K阅读 ❤️524
宝玉 (@dotey) on X Claude 新的一篇博文《How Warp builds self-improving agents on Claude》 https://t.co/CsyjaGY8TC ,看了后还是挺有收获,它解决的是 Skill 的进化问题。 这个问题我以前也研究过,我写了一个反编译 JS 代码的 Skill(https://t.co/y6kA8TDnZ3),每次 Agent 反编译的时候遇到新的场景解决 X (formerly Twitter)
飞翔的智能体 ·
Anthropic宣布Claude科学家计划正式启动,面向全球1万名科学家开放免费使用。 这个计划覆盖数学、化学、物理等几乎所有科学领域。学术和非营利研究机构的首席研究员可以注册,然后给团队里的研究人员添加席位。标准席位完全免费,高级席位有5倍使用量限制,每月15美元,相当于打了八折,有效期一年。 Claude在科学研究方面的能力正在快速提升。最近在高级物理计算和蛋白质设计等前沿问题上都取得了不错的进展。Anthropic今年6月推出了Claude Science,还专门搞了AI for Science项目给有影响力的研究项目提供免费额度,这次扩展是在这两个基础上的升级。 对于科研人员来说,这是个很好的消息。AI辅助科研已经不是概念了,而是实实在在的工具。能免费拿到Claude的使用权,对很多实验室来说意味着可以更快推进研究进度。Anthropic说后续会扩展到远超1万个席位,这个方向挺明确的:用AI降低科研门槛。
显示更多 话题来源 @claudeai 399W阅读 ❤️1.2万
Claude (@claudeai) on X Starting today, 10,000 scientists across every field, from math to chemistry to physics and more, can get Claude through our new Claude Team plan for scientists. Standard seats are free, and premium s X (formerly Twitter)
飞翔的智能体 ·
30个AI逆天技能,每一个都让人直呼好家伙。整理了一批目前最强的AI应用技能,覆盖工作、学习、生活各个方面。 效率类:自动整理会议纪要、一键生成周报、智能翻译文档、自动回复邮件。创作类:AI写小说、生成音乐、做动画、拍电影级视频。学习类:论文速读、知识图谱构建、个性化学习路径规划。开发类:自动写代码、Debug、部署、监控全链路自动化。 生活类:AI穿搭建议、健身计划、菜谱推荐、旅行规划。每个技能都经过实际测试,确实能提升效率。不是那种花里胡哨的概念,是真的能落地用的。比如会议纪要那个,以前开完会还要花半小时整理,现在AI几秒钟搞定,而且比我自己整理的还清楚。 这份清单会持续更新,有新的好用技能我会加进去。建议收藏,以后慢慢试。
显示更多 话题来源 @yitongyue 183K阅读 ❤️2555
封面由站内生成
飞翔的智能体 ·
30个完全免费的AI工具,每个都好用到离谱。整理了一份超全的AI工具清单,全部免费,覆盖各种场景。 写代码的:有自动补全的、有代码审查的、有帮你重构的。做设计的:有生成Logo的、有做UI的、有处理图片的。写文案的:有帮你写邮件的、有做SEO优化的、有生成社交媒体内容的。 还有做视频的:有自动生成字幕的、有帮你剪辑的、有做特效的。做数据分析的:有自动做图表的、有帮你清洗数据的、有预测趋势的。 最离谱的是这些工具大部分都不要钱,或者有很慷慨的免费额度。以前这些功能动辄几百美金一个月,现在全都白嫖。整理这份清单花了我不少时间,但看到这些工具确实好用,觉得值了。建议先收藏,用到的时候翻出来,能省不少钱。
显示更多 话题来源 @yitongyue 81K阅读 ❤️1530
封面由站内生成
Ilir Aliu (@IlirAliu_) on X The University of Michigan put their entire robotics degree on GitHub. Not one course. The whole curriculum. ROB 101 — Computational Linear Algebra for Robotics ROB 311 — How to Build Robots and Make X (formerly Twitter)
哇!是牛来 ·
来了来了,《WorkBuddy Harness 技术拆解蓝皮书📘》正式发布,全文免费、开源,支持在线阅读和 PDF 下载。 我越来越确定:想真正用好一个 Agent 产品,光会操作远远不够。你得知道一次请求是怎么把身份、记忆、插件和项目上下文拼在一起的。出了问题,才知道该去哪里找证据,也知道如何用的更好 所以这本书沿着「UI 行为 → 本地文件 → 发给模型的请求」一路往下拆:系统提示词、三层记忆、身份系统、专家、插件、Skill、Connector、SubAgent、会话证据和安全边界。 如果你也遇到过「改了配置为什么不生效」「WorkBuddy 到底记住了什么」「插件往主线程里注入了什么」「专家、Skill 和 SubAgent 到底是什么关系」,这本书就是为你写的。 预告里说,我想成为市面上最懂 WorkBuddy 的 AI 讲师。这本书,就是我交出的第一份公开答卷。 🔗 相关链接 t.co/RsaQniOXxA GitHub: github.com/zjp1997720/zhi…
显示更多 话题来源 @zjp1997720 3W阅读 ❤️344
GitHub - zjp1997720/zhijian-ai-bluebook-workbuddy-harness: 智见 AI 蓝皮书:拆解 WorkBuddy 的提示词、记忆、插件、专家、Skill 与安全边界。 智见 AI 蓝皮书:拆解 WorkBuddy 的提示词、记忆、插件、专家、Skill 与安全边界。. Contribute to zjp1997720/zhijian-ai-bluebook-workbuddy-harness development by creating an account on GitHub. GitHub
飞翔的智能体 ·
有人说一个月赚1.8万,我人直接懵了。操作很简单:拿自己照片丢给Claude,搞了个AI分身,然后生成跳舞素材,往TikTok一扔。 30天,3万1千粉。然后反手开Fanvue收费,268个人付了9.9美元。一个月一万八,差不多3000U。 最离谱的是她压根没觉得这能赚钱,就传了几张照片试试水。AI跳个舞,咋真有人掏钱? 这背后其实是个很有意思的现象:AI生成内容的边际成本几乎为零,但人类对新鲜感和个性化内容的需求是无限的。当AI能快速生成各种风格的视频时,内容创作的门槛被彻底抹平了。 对于想做副业的人来说,这提供了一个思路:不需要自己出镜,不需要专业设备,只需要找到一个细分场景,用AI快速量产内容。当然,这种模式能持续多久不好说,但至少在当下,它证明了AI内容变现的可行性。
显示更多 话题来源 @huoshan007 261K阅读 ❤️1173
封面由站内生成
火山哥🕊️ (@huoshan007) on X 我靠,刚我表妹跟我说一个月赚1.8万,我人直接懵了。 她操作很简单拿自己照片丢给Claude,搞了个AI分身,然后生成跳舞素材,往TikTok一扔。 30天,3万1千粉。 我寻思这不就套个皮么?结果她反手开Fanvue收费,268个人付了9.9美元。 一个月一万八,差不多3000U。 最离谱的是她压根没觉得这能赚钱,就传了几张照片试试水。 我现在没想明白,AI跳个舞,咋真有人掏钱啊。是 X (formerly Twitter)
飞翔的智能体 ·
OpenClaw 2.0正式发布,这次更新让AI编程工具变得更简单、更强大。 从1.0到2.0,OpenClaw走了一条与众不同的路。它没有堆砌复杂功能,而是专注于让AI编程体验更流畅。核心改进包括:更简洁的安装流程、原生浏览器集成、更快的响应速度。 对于开发者来说,最大的变化是上手门槛降低了。以前需要配置环境、安装插件,现在开箱即用。这意味着更多非技术背景的人也能用AI辅助编程。 OpenClaw 2.0的定位很清晰:不是要取代IDE,而是成为一个轻量级的AI编程伴侣。它适合快速原型开发、脚本编写、自动化任务等场景。 对于已经用过1.0的用户,升级是必选项;对于还在观望的人,2.0是个不错的入坑时机。开源社区的活跃度也在上升,GitHub上Star数已经破万,说明市场对这类工具的需求确实在增长。
显示更多 话题来源 @openclaw 842K阅读 ❤️3323
OpenClaw🦞 (@openclaw) on X OpenClaw 2.0 has arrived https://t.co/52iWXJQvCy X (formerly Twitter)
飞翔的智能体 ·
别再对ChatGPT说"帮我优化一下"了!弱提示词等于废输出,用这套专业模板直接起飞。 很多人用AI时习惯性输入"帮我写个邮件""帮我分析一下",结果出来的东西总是泛泛而谈,不够精准。问题不在AI,而在提示词。 好的提示词需要包含几个关键要素:明确角色、具体任务、输出格式、约束条件。比如与其说"帮我分析竞品",不如说"你是资深产品经理,请分析Notion、Figma和Linear的功能差异,用表格对比,重点说团队协作能力"。 再比如与其说"帮我写代码",不如说"你是高级Python工程师,请写一个异步爬虫,用aiohttp,支持重试和代理池,输出带注释的完整代码"。 关键是给AI一个明确的身份和边界,让它知道你要什么、不要什么、输出长什么样。这套方法适用于各种场景:写代码、做分析、生成文案、做设计。记住:你给AI的信息越具体,AI给你的结果越精准。别偷懒,多花30秒写好提示词,能省30分钟反复修改的时间。
显示更多 话题来源 @AIExplorerTim 377K阅读 ❤️1083
封面由站内生成
小白爱摸鱼 ·
DeepSeek 刚刚颠覆了编程代理行业。 deepseek-harness: Open-source. Free. Claude Code's top plan costs $200/month. 核心功能: → 一切皆插件——模型适配器、工具、会话日志,甚至代理循环本身,均可通过配置自由切换 → 基于 DeepSeek 自研的插件运行时 Cordis 构建 → 一条命令启动:npx -ai/dsh web —— 自动拉起本地 Web 界面 → TypeScript,MIT 许可证,开发者预览版——预计会有破坏性变更,DeepSeek 自己也这么说 替代对象: → Anthropic 的 Claude Code → 封闭的、单一供应商编码代理(coding-agent)环境 一家前沿实验室刚刚免费放出了公司收取订阅费的确切层级。 → 🔗 相关链接 t.co/b4EzZ8NwT5 GitHub: github.com/deepseek-ai/de…
显示更多 话题来源 @ArchiveExplorer 19W阅读 ❤️1774
封面由站内生成
GitHub - deepseek-ai/deepseek-harness: DeepSeek Harness: Everything is a Plugin. DeepSeek Harness: Everything is a Plugin. Contribute to deepseek-ai/deepseek-harness development by creating an account on GitHub. GitHub
飞翔的智能体 ·
做AI短剧的,这套开源工作流你迟早会用上。drama-skills,一个漫剧工作室把自己产线蒸馏出来的10个skill,GitHub 1000多星。 他们从2025年做了上千个短剧项目,自建工具前后端写了近8万行代码,在模型和需求的迭代速度面前,慢慢维护不动了。于是干脆抛开一体化图形工具,把历史工程和图片视频提示词经验,全蒸馏成agent能读的skill。 一个点子或一部长篇,一路做成分集剧本、人物设定、分镜关键帧、图片提示词和视频提示词,每集只维护五份Markdown,所有权和连续性都衔接好。 最关键的设计是把确认放在生产之前:提示词先落进文件,skill展示这次要生成的准确数量、参数和输出,你看过预览明确点头,才送去烧钱生成。Claude Code、Codex都能装,MIT开源。 对于想做AI短剧但不知道从何入手的人来说,这套工作流提供了一个清晰的路径。
显示更多 话题来源 @GoSailGlobal 17K阅读 ❤️208
封面由站内生成
Jason Zhu (@GoSailGlobal) on X 做AI短剧的,这套开源工作流你迟早会用上 drama-skills,一个漫剧工作室把自己产线蒸馏出来的10个skill,1000多星 他们从2025年做了上千个短剧项目,自建工具前后端写了近8万行代码,在模型和需求的迭代速度面前,慢慢维护不动了 于是干脆抛开一体化图形工具,把历史工程和图片视频提示词经验,全蒸馏成agent能读的skill 一个点子或一部长篇,一路做成分集剧本、人物设定、分 X (formerly Twitter)
飞翔的智能体 ·
Warp是一个挺有名的终端工具,他们最近分享了如何用Claude构建自我改进Agent的实践,核心是解决Skill进化问题。 初期他们让Agent做代码审查,效果不理想:Agent不了解项目、不知道团队规范、没有记忆。他们尝试手动改提示词、完善AGENTS.md,但效果有限。 后来搞了个巧妙的方案:一个基础Skill负责做代码审查,一个改进Skill负责定期收集人类工程师在代码审查时的评论,根据这些评论去更新代码审查的Skill。不是让模型自己改进自己,而是Agent根据人类的反馈去改进Skill。 关键设计是让反馈没有摩擦:人只要在PR下自然写评论,后面的事情都是Agent自动完成。这可能正是Agent的最佳实践方案之一:人负责高维度的标注和反馈,Agent做执行工作,根据人类反馈改进Skill。 他们还总结了一些最佳实践:写原则不要写死规则、解释为什么、让反馈没有摩擦、保持Skill精简、反馈质量大于数量。对于想构建自我改进Agent的人来说,这篇实践分享值得一看。
显示更多 话题来源 @dotey 81K阅读 ❤️524
封面由站内生成
宝玉 (@dotey) on X Claude 新的一篇博文《How Warp builds self-improving agents on Claude》 https://t.co/CsyjaGY8TC ,看了后还是挺有收获,它解决的是 Skill 的进化问题。 这个问题我以前也研究过,我写了一个反编译 JS 代码的 Skill(https://t.co/y6kA8TDnZ3),每次 Agent 反编译的时候遇到新的场景解决 X (formerly Twitter)
自由翻滚的风铃草 ·
吴恩达刚刚发布了一份「AI Engineering Skills Map」。 它基于 1 万多份招聘需求、专家访谈和问卷,把今天开发者最重要的 AI 工程能力归成了四块: 构建和部署 AI 应用、软件工程基础、使用 Coding Agent,以及 Shaping the Build。 前两点我觉得尤其值得注意。 AI 应用最大的麻烦之一,是输出本身带有不确定性,所以真正重要的能力会落到 eval、error analysis、context engineering、RAG、agent workflow 这些地方。 与此同时,Coding Agent 越强,软件工程基础反而越重要。你得知道架构、测试、可靠性、安全这些 trade-off,才能判断 Agent 做得对不对,也知道该给它什么 context。 最后一项「Shaping the Build」也很有意思。 当 Agent 已经能越来越好地按照 spec 执行,工程师的工作会更多落到前面:理解业务、定义问题、决定该做什么,以及什么时候快速做 MVP,什么时候应该慢下来。 我自己看完最大的感受是,AI 并没有让工程能力变简单,只是把工程师的价值往更高一层推了。 以后会写代码当然重要,但更重要的是能不能把问题定义清楚、把 Agent 用好,再对最后的结果负责。
显示更多 话题来源 @Xudong07452910 6W阅读 ❤️308
封面由站内生成
Xudong Han (@Xudong07452910) on X 吴恩达刚刚发布了一份「AI Engineering Skills Map」。 它基于 1 万多份招聘需求、专家访谈和问卷,把今天开发者最重要的 AI 工程能力归成了四块: 构建和部署 AI 应用、软件工程基础、使用 Coding Agent,以及 Shaping the Build。 前两点我觉得尤其值得注意。 AI 应用最大的麻烦之一,是输出本身带有不确定性,所以真正重要的能力会落到 e X (formerly Twitter)
飞翔的智能体 ·
Design Engineer这个新职业火了。设计师开始写代码,前端开始做设计,AI技能正在重新定义产品经理的角色。 最近发现一个叫Design Skills的概念——把一整套编辑设计语言、复古印刷质感、克制的视觉规则封装成可反复调用的Skill。它会自动遵循设计原则:默认使用一种油墨色、大量有意识的留白、强烈的Typography和编辑排版感。 你可以直接告诉它:帮我做一张关于城市骑行的海报。也可以上传自己的照片,让它转换成复古印刷感的Editorial Visual。 使用场景包括活动海报、社交媒体配图、品牌branding探索、音乐播客封面、Zine Magazine Ediorial、个人照片再创作、Moodboard概念探索等。 为了保证生成效果稳定,还加入了大量design system来约束:颜色、字体、组件、构图、风格。对于想提升视觉设计能力的AI用户来说,这种Skill化的思路值得关注。
显示更多 话题来源 @yanliudreamer 216K阅读 ❤️3070
封面由站内生成
Dreameryanyan (@yanliudreamer) on X 我开始做自己的Design Skills 了🎨 今天在Demo day上分享了3个,大家都很喜欢! 先发一个我特别喜欢的:Mono-color Skill。 它不是简单地“把图片变成单色”,而是把一整套编辑设计语言 + 复古印刷质感 + 克制的视觉规则,封装成了一个可以反复调用的 Skill。 它会自动遵循这些设计原则👇 👉 默认使用一种油墨色,必要时加入克制的双色套印 👉 大量,有意识的留白 X (formerly Twitter)
飞翔的智能体 ·

装完这9个Skill,你的Codex直接开挂。

很多人还在把Codex当聊天工具用:写几句Prompt、改几行代码、遇到复杂任务就卡住。真正拉开差距的,是给它装上这套能复用的Skill。

  1. Ponytail:少写50%无效代码,Token节省94%,相当于给Codex塞进一个资深工程师。
  2. Guizang PPT Skill:10种设计风格、22种版式,直接输出排版、内容、视觉都能用的可编辑PPT。
  3. GSAP Skills:一句话让网页拥有专业级动效,卡片、文字、滚动、转场全都能做。
  4. AI Product Video:152张动态卡片、209个动画模板,快速生成产品宣传片。
  5. Smart Charts:CSV、Excel、JSON丢进去,自动分析数据、推荐图表类型。
  6. Gathered Scenes Zine Skill:一张照片变一份高级视觉作品。
  7. Taste Skill:从5个维度干掉AI味,让页面从能用变成能展示。
  8. Video Use:一条原始视频,自动剪成完整成片。
  9. ELI5:把100分难懂的知识,讲到5岁孩子都能懂。

直接给Codex补上省Token、做PPT、做网页、做视频、做图表、提升审美的能力。

显示更多 话题来源 @goan999999 188K阅读 ❤️617
封面由站内生成
govin.eth | G哥 (@goan999999) on X 装完这 9 个 Skill,你的 Codex 直接开挂 很多人还在把 Codex 当聊天工具用:写几句 Prompt、改几行代码、遇到复杂任务就卡住 真正拉开差距的,是给它装上这套能复用的 Skill: 1、Ponytail:少写 50% 无效代码,Token 节省 94% https://t.co/HkPO7opunu 它会先判断代码有没有必要写,避免 AI 过度开发。该省的 Token X (formerly Twitter)
菠萝与大西瓜 ·
一个暴论:B站是现在国内最热闹的技术论坛。 今天看到推上有人讨论B站上面都是AI大佬。 其实这两周一直在追 DeepSeek V4,我也发现B站可能已经成了国内最被低估的AI技术社区之一。 以前我找最新的 AI 信息,基本就是 X、GitHub、Hugging Face,再加几个技术论坛(L站V站之类的)。 B站在我印象里,更多还是教程、科普和二手信息。 但这次从 DeepSeek V4 一路追到 DeepSeek Harness,我发现很多真正有意思的东西,我居然都是先在 B 站看到的。 举两个最近的例子。 一个是小明XBright这个UP。 在DeepSeek Harness 发布之后,社区里的大家很快发现一个很奇怪的现象: 官方测试里,工具极少的 Minimal 模式,反而比 Standard 模式表现更好。 小明XBright就开始自己研究 Harness 到底做了什么,最后直接在 Windows 上用标准工具,加上对极简模式思维链的还原,去复现 Minimal 的效果。 这已经不是普通的DeepSeek Harness 使用教程了。 大家实际上是在一起拆 Harness,研究 Context、Tool 和 Prompt 到底怎么影响模型的 Agent 能力。 另一个是隔山水樵这个老哥。 之前我写 DeepSeek V4 可能存在不同模式、不同版本的时候,很多最早的线索就是在他的内容和评论区看到的。 是不是 Max 模式,有没有灰测和路由,不同版本思维链为什么分别喜欢出现「users want me」「let me」之类的表达…… 大家直接拿不同 Key、不同时间、不同任务去跑,然后在评论区贴结果互相验证。 Harness 发布之后,他又第一时间拿 V4 Pro 配合 Harness 去测复杂任务。 一条这么硬核的视频,25万播放,半夜还有几百个人同时在看。 这种视频最近在 B 站好像有推流,我能刷到特别多。 DeepSeek 每次一更新,我现在甚至会下意识去 B 站搜一遍。 而且最有意思的还不是这些做完之后的视频,而是B站直播。 每次一个新模型刚发布,我几乎总能找到有人直接开直播,和观众一起测试。 弹幕里有人出题,主播现场跑: 弹幕里发现模型行为不对,马上换 Case; 跑出了奇怪结果,评论区继续复现; 再过几个小时,有人把结果整理成视频; 最后甚至有人把方法做成代码、Skill、插件,扔到 GitHub。 这次 DeepSeek Harness 的插件榜里,前排也出现了多个 B 站 UP 主做的开源项目。 我觉得这种氛围特别好。 它有点像十几年前的某乎或者贴吧,只不过帖子变成了视频,回帖变成了弹幕,围观的人可以直接跟着一起跑实验。 以前我觉得 B 站是一个「看别人讲 AI」的地方。 最近追 DeepSeek 才发现: 这里正在变成一群人一起玩 AI、测 AI、拆 AI 的地方。 至少在 DeepSeek 这条线上,我现在已经真的会把 B 站当成一手信息源了。
显示更多 话题来源 @MaxForAI 8W阅读 ❤️908
封面由站内生成
Max For AI (@MaxForAI) on X 一个暴论:B站是现在国内最热闹的技术论坛。 今天看到推上有人讨论B站上面都是AI大佬。 其实这两周一直在追 DeepSeek V4,我也发现B站可能已经成了国内最被低估的AI技术社区之一。 以前我找最新的 AI 信息,基本就是 X、GitHub、Hugging Face,再加几个技术论坛(L站V站之类的)。 B站在我印象里,更多还是教程、科普和二手信息。 但这次从 DeepSeek V4 X (formerly Twitter)
查看完整榜单
查看完整榜单
查看完整榜单