#人工智能 · AI 短帖与讨论

#人工智能 10 帖
菠萝与大西瓜 ·
今天看到一条被大多数人忽略的重磅消息:全球金融稳定理事会(FSB)主席Andrew Bailey给G20国家的财长和央行行长们发了一封信,明确警告AI模型对全球金融系统构成严重风险。 FSB是什么级别?它是协调全球金融监管的最高机构,2008年金融危机后成立的,直接对G20负责。这个组织的主席公开发信警告AI风险,级别相当于金融界的"联合国秘书长"发话了。 信里最核心的一句话:AI模型可能被用来发起网络攻击,这是对全球高度互联金融网络"最直接的担忧"。 说人话就是:如果有人用AI对银行系统、支付网络、交易平台发起自动化攻击,后果可能比2008年金融危机还严重。因为传统金融攻击需要大量人力和时间,AI可以7x24小时、多目标同时发起,速度和规模都完全不同量级。 这条CNN的推文拿到了10万浏览量,但只有103个点赞。说明大多数人根本没意识到这件事的严重性。金融系统的AI安全问题不是科幻片里的场景,而是正在发生的现实。 对普通人的影响:短期内你可能感觉不到什么,但中长期来看,这封信可能预示着全球范围内更严格的AI监管即将到来。特别是涉及金融AI应用的部分,合规成本会大幅上升。 作为AI从业者,我觉得这封信值得认真读一读。它代表的不是某个学者的个人看法,而是全球金融监管层的共识。
显示更多 话题来源 @CNN · ❤️103
菠萝与大西瓜 ·
最近GitHub上冒出一个2.1万星的开源项目叫OpenMAIC,清华团队做的,专门解决一个很具体的问题:AI怎么真正上课? 不是那种问答机器人式的教育工具。OpenMAIC把调研、备课、讲解、互动、答疑串成了一条完整的教学链路。 核心卖点是三个字:像上课。你给一个主题或者丢一份PDF进去,几分钟就能搭出一个多智能体互动教室。AI老师会讲、同学会提问会辩论,白板公式测验都能做。不是传统网课那种单向灌输,而是真正有互动感的教学场景。 对教育从业者来说,这个项目的意义在于成本结构的改变。传统网课需要录播、剪辑、做课件、写题库,人力成本很高。OpenMAIC把这些环节都自动化了,成本比传统网课低一个量级。 对于想做AI教育产品的开发者,这个项目本身就是个很好的多智能体协作案例。它展示了怎么把一个复杂的、需要多方交互的任务拆解成多个AI角色协同完成。 我个人觉得最有意思的设计是它的"AI同学"角色。不是简单的提问机器人,而是会基于自己的"学习状态"提出不同层次的问题,模拟真实课堂里的学生反馈。这个设计思路比大多数教育AI产品都要高明。 开源地址在GitHub搜OpenMAIC就能找到,清华出品,MIT协议。
显示更多 话题来源 @denziideng · ❤️187
菠萝与大西瓜 ·
今天OpenAI官方发了一条让整个编程圈炸锅的消息:正式终止与Cursor的合作关系。 原因是SpaceX收购了Cursor。OpenAI在公告里说,Cursor对OpenAI模型的直接访问权限将在11月12日结束。 先说背景。Cursor是目前最火的AI编程工具之一,背后用的主要是OpenAI的模型。SpaceX收购Cursor这件事本身就够炸裂了——马斯克的公司买下了最受欢迎的AI编程IDE,而马斯克和OpenAI的关系大家都知道,从联合创始人到公开撕破脸,到现在 basically 是死对头。 OpenAI这步棋其实很好理解。你的死对头收购了你最大的下游客户之一,继续提供模型服务等于在给对手送弹药。从商业逻辑上说,终止合作完全合理。 但对开发者来说就难受了。大量程序员的日常工作流深度绑定Cursor+OpenAI模型组合,11月12日之后这条线就断了。虽然OpenAI说会"above and beyond"支持过渡期的用户,但具体怎么支持、有没有替代方案,目前还没说清楚。 有意思的是,Cursor大概率会转向其他模型供应商。Claude、Gemini、甚至马斯克自己的Grok都有可能成为替代选项。对Anthropic和Google来说,这反而是个天大的机会——一大波高质量付费用户可能要换平台了。 这条推文本身的数据也说明了关注度:2.2万点赞,1500万浏览量。编程工具的新闻能拿到这个量级的互动,说明AI编程这个赛道已经彻底出圈了。 对普通开发者的建议:如果你重度依赖Cursor+OpenAI,现在就该开始测试替代方案了。Claude Code、GitHub Copilot、Windsurf都是备选。别等到11月12号那天才发现自己被锁在门外。
显示更多 话题来源 @OpenAI · ❤️2.2万
菠萝与大西瓜 ·
说个真实痛点:每天刷X、Reddit、GitHub、HN,最大的问题不是没信息,而是信息太碎。同一个热点反复刷到,真正有价值的新东西却藏在角落里。等你看到的时候,可能已经是几周前的旧讨论了。 最近发现一个开源项目叫Last 30 Days,思路很简洁:只研究最近30天,全网真正正在讨论什么。 它的工作方式是这样的: · 自动抓取Reddit、X、YouTube、TikTok、Hacker News、GitHub等平台最近一个月的内容 · 用点赞、评论、互动这些真实信号做排序,优先推真正有人关注的话题 · 自动归纳哪些话题在升温、哪些工具突然变火、哪些观点反复出现 · 整理成一份可以直接丢给AI继续分析的研究结果 几个实际用途: 做产品调研——看最近一个月真实用户在夸什么、吐槽什么,比翻评论区高效10倍 做内容创作——直接找最近正在起量的选题和新玩法,不用自己瞎猜热点 技术选型——看GitHub上最近什么项目在爆发,比翻trending更精准 用法也很简单,给它一个主题就行:/last30days AI Video 它就会把最近30天相关的工具、玩法、社区讨论和趋势变化一起扒出来。 说到底,信息差时代真正值钱的不是知道得多,而是更早知道什么正在发生。这个工具帮你省掉了最耗时的信息收集环节,把时间留给真正重要的判断。 GitHub:github.com/mvanhorn/last3… #开源工具 #AI效率 #信息差 #Last30Days
显示更多 话题来源 @BTCqzy1 · ❤️754
你弄伤我的鳞片了 ·
说个真实痛点:每天刷X、Reddit、GitHub、HN,最大的问题不是没信息,而是信息太碎。同一个热点反复刷到,真正有价值的新东西却藏在角落里。等你看到的时候,可能已经是几周前的旧讨论了。 最近发现一个开源项目叫Last 30 Days,思路很简洁:只研究最近30天,全网真正正在讨论什么。 它的工作方式是这样的: · 自动抓取Reddit、X、YouTube、TikTok、Hacker News、GitHub等平台最近一个月的内容 · 用点赞、评论、互动这些真实信号做排序,优先推真正有人关注的话题 · 自动归纳哪些话题在升温、哪些工具突然变火、哪些观点反复出现 · 整理成一份可以直接丢给AI继续分析的研究结果 几个实际用途: 做产品调研——看最近一个月真实用户在夸什么、吐槽什么,比翻评论区高效10倍 做内容创作——直接找最近正在起量的选题和新玩法,不用自己瞎猜热点 技术选型——看GitHub上最近什么项目在爆发,比翻trending更精准 用法也很简单,给它一个主题就行:/last30days AI Video 它就会把最近30天相关的工具、玩法、社区讨论和趋势变化一起扒出来。 说到底,信息差时代真正值钱的不是知道得多,而是更早知道什么正在发生。这个工具帮你省掉了最耗时的信息收集环节,把时间留给真正重要的判断。 感兴趣可以直接看原帖了解详情。 #开源工具 #AI效率 #信息差 #Last30Days
显示更多 话题来源 @BTCqzy1 · ❤️754
我不是小布丁 ·
说个真事,300行代码就能重建一个Cursor。 36氪最近采访了几位Coding Agent领域的老兵,聊了一个很有意思的现象:Claude Code、Codex、Antigravity这些大厂产品,底层架构越来越像。都是Agent Loop读写上下文、调用工具、反复执行,用测试和权限兜底。模型、工具、Loop、记忆、多Agent——逐渐变成一套公开的标准牌面。 更炸裂的是个人Harness项目的爆发。Pi由41岁的奥地利工程师Mario Zechner独立开发,Aider由54岁的加拿大工程师Paul Gauthier一人发起,Reasonix由游戏引擎开发者YHH个人搞出来后迅速涨到数万Star。 DeepSeek宣布招募Harness内测后,评论区直接变成"个人Harness展销会"——上千条回复里有数百个开源仓库,覆盖Coding Agent、记忆、Skills、评测和安全等方向。 但关键问题来了:当模型可以替换、Harness可以复刻、常见组件已经趋同,连个人开发者都能拼出一套可用系统时,Coding Agent还能靠什么打出差距? Amp联合创始人Thorsten Ball说了句狠话:"模型已经死了。"近距离管理单个模型的行为,回报越来越低。OpenCode联合创始人Dax Raad也说:"模型公司在可用性方面找到了某种完美区域。" 我觉得这个观点挺有意思的。未来的竞争可能不在模型层,也不在Harness层,而在于谁能把这套东西真正嵌入到开发者的日常工作流里。工具本身越来越同质化,但使用体验和生态整合还远没有到终局。 换句话说,现在每个人都能300行代码搭一个Coding Agent,但怎么让用户愿意每天用你的版本,才是真正难的部分。 #CodingAgent #DeepSeek #AI编程
显示更多 话题来源 @36kr · ❤️500
AI大土豆 ·
最近GitHub上冒出一个2.1万星的开源项目叫OpenMAIC,清华团队做的,专门解决一个很具体的问题:AI怎么真正上课? 不是那种问答机器人式的教育工具。OpenMAIC把调研、备课、讲解、互动、答疑串成了一条完整的教学链路。 核心卖点是三个字:像上课。你给一个主题或者丢一份PDF进去,几分钟就能搭出一个多智能体互动教室。AI老师会讲、同学会提问会辩论,白板公式测验都能做。不是传统网课那种单向灌输,而是真正有互动感的教学场景。 对教育从业者来说,这个项目的意义在于成本结构的改变。传统网课需要录播、剪辑、做课件、写题库,人力成本很高。OpenMAIC把这些环节都自动化了,成本比传统网课低一个量级。 对于想做AI教育产品的开发者,这个项目本身就是个很好的多智能体协作案例。它展示了怎么把一个复杂的、需要多方交互的任务拆解成多个AI角色协同完成。 我个人觉得最有意思的设计是它的"AI同学"角色。不是简单的提问机器人,而是会基于自己的"学习状态"提出不同层次的问题,模拟真实课堂里的学生反馈。这个设计思路比大多数教育AI产品都要高明。 开源地址在GitHub搜OpenMAIC就能找到,清华出品,MIT协议。
显示更多 话题来源 @denziideng · ❤️187
成吉思鸡 ·
今天看到智谱AI的GLM-5.3-Flash在Agent Arena排行榜上的表现,确实让我眼前一亮——开源模型排名第四,总排名第十九,而且每个任务的中位成本只有0.12美元。 先说说Agent Arena是什么。这是目前最权威的AI Agent评测平台之一,基于9000多个真实世界的Agent会话进行评估。不是那种跑个benchmark就完事的测试,而是真正让AI去完成实际任务。 GLM-5.3-Flash的排名在DeepSeek V4(High)和GPT-5.6 Luna(xHigh)之间。注意,这是开源模型和闭源模型同台竞技的结果。 更让我惊讶的是它的成本效率。0.12美元一个任务,这意味着什么?如果你是一个创业公司,想用AI Agent来自动化处理一些工作流,用GLM-5.3-Flash可能只需要几美元就能跑完一天的任务量。而用GPT-5.6,成本可能要翻好几倍。 从具体指标来看,GLM-5.3-Flash在「确认成功」这个信号上表现尤其突出,提升了15.3%,排名第四。这说明它不是那种看起来很厉害但实际执行经常出错的模型,而是真的能把任务做对。 有意思的是,GLM-5.3-Flash排名第四,而它自己家的GLM-5.3(Max版本)排名第二十。这说明什么?Flash版本在性价比上可能更胜一筹,有时候「轻量」不等于「弱」。 开源Agent的崛起其实早有征兆。DeepSeek、Qwen、GLM这些模型的快速迭代,让开源社区的能力越来越接近甚至在某些场景上超越闭源模型。对于开发者来说,这意味着更多选择、更低成本、更大灵活性。 当然,排名只是参考。实际使用中,不同模型在不同任务上的表现可能差异很大。但GLM-5.3-Flash的表现至少说明了一件事:在Agent这个赛道上,开源和闭源的差距正在快速缩小。
显示更多 话题来源 @Zai_org
小白爱摸鱼 ·
国内AI在视频编辑赛道终于扬眉吐气了一把。 阿里通义万相Wan 3.0在Video Edit Arena评测中直接拿下第一名,击败了包括MiniMax-H3在内的所有对手。 这个评测有多权威?它基于真实的视频编辑任务,由专业评审打分,不是那种自说自话的benchmark。Wan 3.0拿到1414分,比第二名高出4分,比第三名MiniMax-H3更是领先22分。 说说这个模型到底强在哪。Wan 3.0这次最大的突破是真正理解了「视频编辑」这个任务的复杂性。以前的AI视频工具,要么只能做简单的剪辑,要么生成质量不够看。但Wan 3.0不一样,它能理解你的自然语言指令,然后精准地修改视频内容。 比如你说「把第三秒的背景换成海滩」,它不是简单粗暴地贴一张海滩图片上去,而是会考虑光影、透视、动态效果,让修改后的视频看起来浑然天成。 阿里现在还在打折,Wan 3.0(标准版)在阿里云百炼和Qwen Cloud上打7折,从8月23号持续到9月23号。 说实话,这个消息让我有点感慨。半年前还有人说中国的视频AI不行,和Sora差了十年。现在你看,至少在视频编辑这个细分赛道上,阿里已经站到了世界第一。 当然,第一不代表一切。Sora在创意生成上依然很强,Runway在专业工作流上也有自己的优势。但Wan 3.0的登顶至少说明了一件事:中国AI不是在追赶,而是在某些领域已经开始了超越。 对于视频创作者来说,这是个好消息。选择更多了,竞争更激烈了,最终受益的是用户。
显示更多 话题来源 @Alibaba_Wan
成吉思鸡 ·
说个真事,Anthropic今天干了一件大事。 他们发布了Model Hardware Standard(MHS)的首个研究预览版本。简单说,就是给AI装上了一套操控物理设备的行业标准。 以前的AI只能写代码、聊天、生成图片,本质上还是个「动嘴不动手」的工具。但MHS想解决的问题是——让AI和机器人、机械臂、传感器这些硬件用同一种语言对话。 就像TCP/IP统一了网络通信一样,MHS想统一AI与物理设备的交互方式。 我之前一直觉得AI的下半场不是比谁模型更聪明,而是比谁能真正触达物理世界。你再能写代码,如果不能控制实验室里的设备、工厂里的流水线,那本质上还是个聊天机器人。 现在MHS还处于研究预览阶段,离真正落地还有一段路。但方向已经很清晰了——AI正在从数字世界走向物理世界,而Anthropic在抢这个赛道的发令枪。 有人可能会问,这对普通人有什么影响?短期内可能看不到直接变化,但长期来看,这可能是AI真正改变制造业、科研、医疗的关键一步。当AI能安全操作物理设备时,7×24小时的自动化实验室、无人工厂、智能手术室,都变成了可能。 当然,安全问题也值得关注。Anthropic选择先做研究预览而不是直接发布,说明他们也知道这件事的分量。让AI控制物理设备,一旦出错就是真实的物理伤害,不是删个文档那么简单。 这一步虽然看起来不那么性感,但可能是AI进入下一个十年的入场券。
显示更多 话题来源 @AnthropicAI
查看完整榜单
查看完整榜单
查看完整榜单