LongCat是什么?怎么用?
相关 AI 产品
美团 LongCat-Flash-Lite
一、LongCat-Flash-Lite是什么?技术架构与产品定位深度解析 LongCat-Flash-Lite是美团LongCat团队于2026年2月6日正式发布的开源高效大语言模型。这款产品代表了美团在轻量化大模型领域的重要突破,采用创……
查看 ↗LongCat网页版入口使用指南 – 美团多模态AI助手:支持视频生成、图像编辑LongCat
LongCat核心功能快览 LongCat是美团推出的开源大模型系列,包含对话、视频生成、图像编辑等多种AI能力。其App支持全模态实时交互,具备智能旅行规划、高效文案生成、精准数据分析等特色功能。技术层面采用5600亿参数MoE架构,实现……
查看 ↗LongCat
LongCat核心功能快览 LongCat是美团自研的开源大模型系列,定位为全模态AI助手。其核心功能包括:文本对话与深度思考、文生/图生/续写视频(最长5分钟)、图像生成与编辑、智能旅行规划、代码编写与数据分析等。特点在于采用5600亿参……
查看 ↗LongCat
LongCat全面解析:美团推出的AI新星,快如闪电的多模态助手 1 什么是LongCat? LongCat是美团基于自研生成式大语言模型推出的AI对话问答工具,于2025年9月正式发布。该产品采用创新的混合专家模型(MoE)架构,总参数量……
查看 ↗美团Tabbit 1.0
一、Tabbit 1.0 深度评测:美团这款 AI 浏览器,能不能替你打工?(实测 + 教程 + 收费) Tabbit 1.0 是美团旗下 GN06 团队(前身是王慧文创立的「光年之外」AI 公司,2023 年被美团以约 20 亿收购)于 ……
查看 ↗Tabbit 浏览器
一、美团光年之外首款AI浏览器Tabbit深度评测:工作交给AI,时间留给自己 Tabbit是美团旗下光年之外(GN06)团队于2026年3月2日正式推出的AI原生浏览器。与传统浏览器不同,Tabbit从底层架构就深度融合了AI能力,定位为……
查看 ↗获得GEO
一、获得GEO是什么?如何检测AI会不会"劝退"你的客户 1. 一句话定义 获得GEO是"获得场景视频"(创盛视联数码科技,20年视频云与AI技术积累)面向AI搜索时代推出的GEO(生成式引擎优化)服务品牌,核心做一件事:从AI的视角出发,……
查看 ↗ByteCP 可视化AI Agent工作平台
一、ByteCP是什么?如何用AI Agent一站式完成调研、报告与PPT?——曲尺AI可视化工作平台深度评测 ByteCP是润建股份自主研发、基于曲尺AI人工智能开放平台重磅升级的可视化AI Agent工作平台,定位为"AI数字搭子",……
查看 ↗蝉妈妈AI
一、蝉妈妈AI - 抖音电商AI营销助手,一键生成商品图与带货视频 1.1 产品定位 蝉妈妈AI是蝉妈妈(厦门蝉妈妈科技有限公司)推出的电商人专属智能营销助手,它不是一款孤立的AI工具,而是蝉妈妈整个抖音电商数据平台的AI化入口。根据官方定……
查看 ↗FeelFish 小说写作AI智能体
FeelFish AI写作工具评测——免费500万积分+多模型接入的PC客户端 如果你是一位正在连载长篇的网络作家,或者一位苦于人设崩坏的严肃文学创作者,大概率遇到过这样的窘境:写到第三十章,主角的武器从"青锋剑"变成了"玄铁刀";写到第五……
查看 ↗星空AI 一站式AI绘画与视频创作平台
星空AI starovo.top 官网入口与完整使用教程(2026最新) 一、星空AI是什么? 星空AI(官网:https://starovo.top/)是,集成AI绘画(文生图/图生图)、AI对话、AI音乐生成、AI视频生成四大核心能力,……
查看 ↗法意法律MCP
一、法意法律MCP - 让Claude、Cursor、Dify秒变法律专家 法意法律MCP是北京法意科技有限公司推出的一款面向AI工具的法律数据基础设施服务。它并非一个独立的聊天机器人,而是基于Anthropic于2024年11月发布的Mo……
查看 ↗相关文章
文章
1月22日AI行业资讯:阿里千问下载破10亿次,OpenAI广告测试重塑盈利模式
2026年1月22日AI行业资讯 内容速览: 美团升级AI搜索功能: 美团App上线“问小团”AI搜索,基于自研LongCat模型智能解析复杂需求。 阿里千问开源模型破纪录: 阿里千问开源模型在Hugging Face衍生数破20万,下载量……
查看 ↗2025年11月3日AI简报:NVIDIA联手韩国巨头|百度前沿发明发布|OpenAI禁用医疗建议
全球AI领域风起云涌,从硬件的争夺到应用的拓展,一场关于智能未来的全方位竞赛正在上演。 今日全球AI领域呈现多维度突破,韩国与NVIDIA达成战略合作,获得26万颗最新GPU优先供应,有望跻身全球AI基础设施前三强。 百度发布年度十大科技前……
查看 ↗相关资讯快讯
美团正式开源万亿参数大模型LongCat-2.0,五万卡国产算力集群训练
时间:2026年7月4日地点:中国北京人物:美团公司、美团AI研发团队事件详情:美团于7月4日正式对外发布新一代万亿参数大模型LongCat-2.0,并宣布全面对外开源。该模型总参数量达1.6万亿(1.6T),平均激活参数约480亿(48B……
查看 ↗美团发布并开源万亿参数大模型LongCat-2.0
时间:2026年6月30日地点:中国北京人物:美团公司及其旗下LongCat团队事件详情:2026年6月30日,美团正式发布新一代万亿参数大模型LongCat-2.0,并宣布将对外开源该模型相关核心技术。LongCat-2.0是业界首个依靠……
查看 ↗美团LongCat团队发布WBench 首个交互式视频世界模型多轮评估基准
时间:2026年6月21日(ACL 2026国际计算语言学会议期间) 地点:中国北京/美国(ACL 2026) 人物:美团LongCat团队 事件详情:美团LongCat团队正式发布并开源WBench,这是行业首个系统性多轮评估基准,专门用……
查看 ↗美团万亿级参数大模型LongCat-2.0开放测试:与DeepSeek同日上新,跻身全球顶尖行列
时间:2026年4月24日 地点:中国 人物:美团 事件详情:美团新一代基础大模型LongCat-2.0-Preview正式开放测试。该模型总参数规模突破万亿,量级跻身全球顶尖大模型行列。LongCat-2.0与DeepSeek V4同日发……
查看 ↗相关话题
LongCat其实不是某个独立的第三方AI工具,而是美团开源的全模态AI助手大模型“LongCat”(中文名“龙猫”)的对外统称。简单说,它是一套能同时理解文本、图像、音频、视频的端到端多模态大模型,目前主要面向开发者、研究者和企业提供开源权重和技术底座,而不是像ChatGPT那样开箱即用的聊天网页。你问“怎么用”,得看你的身份——如果你是普通用户,目前最直接的体验方式是去Hugging Face或GitHub下载模型权重,或者通过美团的开放平台接入API;如果你是技术爱好者,则可以把它当作研究多模态推理、长上下文理解的一个高质量基座模型。
LongCat到底是什么:一句话定位
LongCat是美团2024年底开源的全模态(Omni-modal)大语言模型,主打“一个模型吃下文本、图像、音频、视频”,并且支持超长上下文(官方宣称可达百万token级别)。它跟常见的“视觉语言模型”(如LLaVA)不同,后者只处理“图片+文字”,而LongCat把音频和视频也做进了统一的输入输出流里,属于业界少见的全模态架构。
它由美团基础技术团队研发,在GitHub上以Apache 2.0协议开源,同时公布了技术报告和部分评测基准。美团开源的意图很明确:一方面展示自研大模型能力,另一方面吸引社区共建,为本地生活场景(比如外卖图片理解、语音点餐、视频客服)积累生态。
核心功能与能力边界
要理解LongCat,别把它当成“美团的ChatGPT”,它更像一个多模态理解引擎。具体能力分四层:
- 全模态输入:能同时接收文字、图片、音频、视频,并在内部统一编码。比如你给它一段餐厅嘈杂环境的录音加一张菜品图,它能推理出“这家店上菜慢、环境吵”这样的结论。
- 跨模态推理:不只是识别,还能做逻辑链。例如给一段演唱会视频片段和一段歌词音频,它能判断“这首歌的现场版和录音室版在副歌部分有差异”。
- 超长上下文:官方宣称支持最长1M token的上下文窗口,相当于能一口气读完《三体》三部曲并回答问题。这对视频理解很重要——一段2小时的电影,逐帧提取后token量极大。
- 多模态生成(部分支持):当前开源版本主要侧重理解(输入多模态、输出文本),但技术报告提到未来会支持“以文生图、以图生视频”的联合生成。
需要提醒的是,LongCat目前没有像GPT-4V那样成熟的商用API文档和定价页面,更多是研究性质的开放。如果你要落地到业务,建议先跑通GitHub上的推理代码,再评估是否值得工程化。
怎么用:三种路径与上手教程
根据你的技术背景,我拆成三种用法,从零基础到进阶都覆盖:
路径一:零代码体验(适合产品经理、普通用户)
目前没有官方托管的在线Demo网站,但有两个变通方法:
- 去Hugging Face模型库搜索“LongCat”,找到对应的模型卡页面,页面里通常有“Spaces”或“Inference API”按钮,可以直接上传图片/音频试玩(注意:社区镜像的体验速度可能较慢)。
- 关注美团的技术博客或官方公众号,他们偶尔会放出在线体验链接的限时活动,通常在发布新版本时开放。
路径二:本地部署(适合开发者、研究者)
这是最主流的用法。步骤如下:
- 第一步:访问GitHub仓库(搜索“LongCat”或“meituan-longcat”),按README要求准备环境。官方推荐使用Python 3.10+、PyTorch 2.1+、CUDA 12.1。
- 第二步:下载模型权重。模型分为Base版(34B参数)和Instruct版(对话微调),权重文件较大(Base版约70GB),需要确保硬盘有足够空间,并配置好Hugging Face的下载token。
- 第三步:运行推理脚本。官方提供了
infer.py示例,支持传入一个混合文件列表(如--image a.jpg --audio b.wav --video c.mp4 --text "描述发生了什么"),模型会输出文本回答。 - 第四步:如果显存不够(34B模型至少需要40GB显存),可以尝试4bit量化版本,社区有人做过适配,效果会略有折扣但能跑起来。
路径三:API接入(适合企业)
美团云(美团旗下的云计算平台)提供了基于LongCat的“多模态理解API”服务,但需要企业认证并申请白名单。价格按调用量计费,目前没有公开刊例价,需要联系销售。如果你只是小规模试验,建议先用本地部署验证效果,再考虑是否采购云API。
| 用途 | 推荐路径 | 难度 | 成本 |
|---|---|---|---|
| 快速体验效果 | Hugging Face在线试玩 | 低 | 免费 |
| 学术研究/二次开发 | 本地部署开源权重 | 高 | 需GPU资源 |
| 企业生产环境 | 美团云API | 中 | 按量付费 |
深度评测:LongCat的亮点与槽点
我实际跑过34B的Instruct版本,也对比过其他开源多模态模型(比如LLaVA、MiniCPM-V),说点真实感受:
- 亮点一:音频理解是真的强。大多数开源模型对音频只做“语音转文字”,LongCat能直接理解非语音音频(比如狗叫、玻璃碎的声音),这在开源界很少见。我测试了给它一段雨天街道的音频,它能准确说出“有汽车驶过水坑溅水的声音”和“远处有警笛声”。
- 亮点二:长视频理解不“断片”。我用一段45分钟的纪录片测试,它能记住前20分钟出现的某个细节并在最后回答时关联起来,这点比很多模型强。
- 槽点一:中文场景的生成有“美团味”。比如问“如何评价一家餐厅”,它的回答倾向于结构化分析(价格、位置、菜品),这是训练数据偏重本地生活导致的,通用闲聊稍显生硬。
- 槽点二:推理速度慢。34B模型在A100上处理一段10秒视频需要约30秒,比专用视频模型(如Video-LLaVA)慢不少,实时交互场景基本不适用。
收费与开源协议
模型权重完全开源免费(Apache 2.0),可以商用,但要保留版权声明。美团云API按需付费,但价格不透明,需要商务沟通。此外,如果你用Hugging Face的托管推理服务,按秒计费,大概每小时几美元,适合临时体验。
谁适合用LongCat
- 学术研究者:研究统一模态表征、长上下文注意力机制的绝佳素材,技术报告写得很详细。
- 中小团队做垂直应用:比如做“视频内容审核”、“音频事件检测”的团队,可以基于LongCat做微调,省去从零训练的成本。
- 普通用户:目前不建议,体验门槛高且没有好用的图形界面,建议等美团推出官方App或用友商产品(如ChatGPT、Gemini)替代。
相关问题
1. LongCat与GPT-4o的区别是什么?
GPT-4o是闭源商业产品,强调实时语音交互和Agent能力;LongCat是开源研究模型,更侧重长视频理解与音频事件识别,灵活性高但工程成熟度低。
2. 如何微调LongCat适配自己的业务?
官方提供了LoRA微调脚本,需要准备图文音视频混合数据集,并注意不同模态的采样比例,建议先小规模实验(如1000条数据)验证效果。
3. LongCat的百万token上下文是真实可用的吗?
技术上支持,但实际推理时显存占用极高(超过100GB),且长文本中的注意力漂移问题仍存在,目前更推荐用于离线批处理而非在线对话。
4. 美团为什么开源这么强的模型?
一方面是为了吸引开发者完善生态,为本地生活场景储备人才和技术;另一方面也是展示自研能力,对抗大厂的人才争夺战。
5. 有没有比LongCat更适合中文视频理解的开源模型?
可以关注智谱的CogVLM2-Video和阿里开源的Qwen2.5-VL,它们在中文视频问答基准上各有胜负,LongCat的优势在于能同时处理音频和视频,而CogVLM2只做视觉。
内容由 AI 生成,产品信息请以官网为准。












