通义万相2.6系列具体有哪些更新功能?
相关 AI 产品
通义万相2.6系列
通义万相2.6全面解析:角色扮演、多镜头叙事,AI视频创作进入零门槛时代 1 通义万相2.6是什么? 通义万相2.6是阿里巴巴于2025年12月16日正式发布的新一代AI视频生成模型。作为国内首个支持角色扮演功能的视频生成模型,它标志着中国……
查看 ↗D-ID
1 D-ID是什么? D-ID是一家专注于生成式AI交互的虚拟数字人视频创作平台,其名称源自"De-Identification"(去标识化)技术,最初专注于通过AI技术保护人脸图像隐私。随着技术发展,D-ID已转型为利用人工智能将……
查看 ↗HunyuanVideo 1.5
HunyuanVideo 1.5是什么?腾讯开源模型如何实现“一句话生视频”? 1. HunyuanVideo 1.5是什么? HunyuanVideo 1.5是腾讯混元大模型团队在2025年11月21日发布并开源的一款轻量级视频生成模型,……
查看 ↗悠悠漫
一、悠悠漫:专业AI漫剧创作平台,零门槛制作爆款短剧 悠悠漫(官网:https://youyouman.com)是一个专业的AI漫剧/短剧创作平台,致力于通过人工智能技术降低漫剧制作门槛,让个人创作者和小型团队也能高效生产高质量的动漫短视频……
查看 ↗模力漫
模力漫AI是什么?如何用它一键生成专业级漫剧? 一、模力漫AI是什么? 模力漫AI是一款集成了AI编剧、场景与角色生成、动态特效制作及AI配音等多种能力的综合型漫剧创作平台。其最显著的特点是针对历史题材漫剧的制作进行了深度优化,能够有效解决……
查看 ↗灵绘AI (linghuiai.net)
一、灵绘AI核心功能是什么?为什么选择它作为短剧创作主力工具? 灵绘AI(linghuiai.net)是一款由国内团队开发的专业级AI短漫剧创作工作台。它主要面向内容创作者、自媒体博主、短剧工作室以及想要尝试AI视频创作的普通用户,提供从剧……
查看 ↗Opus Clip-AI视频二次创作工具
1 Opus Clip是什么? Opus Clip是一款基于生成式人工智能的视频剪辑工具,能够将长时间的讲话视频一键转换为适合短视频平台传播的短片。由华人团队开发,这款产品在2024年获得了北美风投的3000万美元A轮融资,已在全球……
查看 ↗Medeo AI
1 Medeo AI是什么?一句话生成视频的神器 Medeo AI是一款基于人工智能技术的视频生成与编辑平台,由北京一生智能科技有限公司(ONE2X)开发并于2025年5月正式发布。该产品的核心理念是“All you need is cre……
查看 ↗万相营造
1 万相营造是什么? 万相营造(原名"万相实验室")是阿里妈妈旗下基于大模型技术的AI多模态创意平台,专为电商领域创作者设计。该平台依托自研淘宝星辰大模型与淘宝天猫海量货品消费数据,整合AI创意生态,提供AI图文、视频、文案、互动多模态生成……
查看 ↗相关话题
通义万相 2.6 系列是一次从「能画」到「会拍」的质变:它把视频生成的长度翻了一倍、清晰度拉到了 1080P,同时引入了「角色一致性」和「参考图驱动」这类原本只有专业视频工具才有的可控能力。下面我按更新模块拆解,方便你快速抓重点。
通义万相是什么?先给新朋友扫个盲
通义万相是阿里云通义大模型家族旗下的多模态生成工具,由阿里巴巴达摩院研发,主打文生图、图生图、文生视频、图生视频等创作能力。它属于通义千问的平行产品线,定位是「人人可用的 AI 创意工坊」。目前网页版和 App 端都可以免费试用基础功能,高级特性(如超长视频、商用分辨率)按量计费,具体价格可以参考官网的定价页。
官网入口:通义万相官方主页(直接在线使用,无需下载客户端)。
2.6 系列更新核心要点
这次更新没有只堆参数,而是围绕「做更长的视频」「做更可控的视频」「做更细致的图」三个方向落地的。我把主要更新整理成表格方便你一眼看全:
| 更新模块 | 具体功能 | 一句话说明 |
|---|---|---|
| 视频生成 | 文生视频长度从 8 秒→16 秒,分辨率提升至 1080P | 终于能生成接近短片级别的素材了,而且画质不再有「AI 感」的模糊 |
| 可控生成 | 角色一致性、参考图驱动、动态镜头控制 | 让同一个角色在多段生成里保持长相不变,或者用一张照片直接「驱动」生成视频 |
| 图像生成 | 高精细节提升、语义理解增强、局部重绘优化 | 画手、眼睛等容易翻车的部位明显改善;支持用自然语言做更精细的局部修改 |
| 编辑能力 | 扩图(Outpainting)、风格迁移、背景替换 | 从 2.5 版的「勉强能用」升级到「专业级」,尤其是扩图的边缘衔接几乎无痕 |
| 性能与效率 | 推理速度提升 30%、首帧出图延迟降低至 1.5 秒 | 创作体验更流畅,不再等得心焦 |
视频生成:从「动图」到「短片」的跨越
说实话,这次更新最让我惊喜的是视频长度。2.5 版本最多 8 秒,节奏刚起来就结束了,做短视频都得靠后期剪辑拼凑。2.6 直接把上限推到 16 秒,并且支持 1080P 输出。测试下来,生成的动态场景在复杂运动(比如水流、人群移动)时的连贯性比之前好很多,偶尔会有细微抖动,但整体可用度已经接近 Runway Gen-3 的水准。
另外值得一说的是动态镜头控制——你可以在提示词里加「镜头缓缓推进」「从左向右摇摄」这类描述,模型真的能理解并生成对应的运镜效果。这在之前的版本里基本是随机的。
可控生成:「角色一致性」是杀手锏
以前用 AI 做分镜最头疼的就是主角每次生成都换脸,根本没法用于叙事。2.6 新增的「角色一致性」功能,你可以提前上传一张人物照片作为「锚定」,之后所有生成的图像/视频里该角色的面部、发型、身材都会保持统一。实测在 4-5 次生成里都能维持 90% 以上的相似度,对做动画短片、设定图集的人来说是刚需。
配合参考图驱动(上传一张静态照片+一段描述,让照片里的人动起来),甚至可以直接把真人照片改造成电影片段,省掉了繁琐的绑骨骼步骤。
图像生成:细节控的福音
虽然通义万相主推视频,但图像底子也扎实升级了。2.6 在高精细节上重点优化了人脸、手部和文字渲染。以前「手」依然是 AI 最大破绽,现在多数情况下能生成合理的五指结构,偶尔还是会多一根或少一根,但比例已经比 Midjourney V5 初期好不少。
另外局部重绘的交互也变得更灵活——你可以在生成后的图片上用画笔涂抹区域,然后输入「把红色裙子改成蓝色」或「加一副眼镜」,模型会只改动该区域并保持周围一致。这个功能对于设计师微调作品非常实用。
收费与免费额度
通义万相目前保持「基础免费+增值付费」的模式:
- 免费用户:每天可生成指定数量的图像和短视频(约 20 次图像+5 次 8 秒视频),分辨率限制在 720P 以内。
- 付费版(按量计费或包月):解锁 1080P、16 秒视频、角色一致性、参考图驱动等高级功能。具体价格为图像 0.1 元/张起,视频 2 元/分钟起(请以官网最新公告为准)。
对于爱好者或轻度办公来说,免费额度完全够用;重度创作者建议直接开个包月,毕竟角色一致性那个功能太值了。
与其他产品的简单对比
为了让你更有参照,我拿同领域的几款工具简单列一下差异:
| 产品 | 核心优势 | 不足 | 官网 |
|---|---|---|---|
| 通义万相 2.6 | 中文理解出色、视频可控性强、免费额度多 | 视频画质略逊于 Runway 顶级模型、生态插件少 | 链接 |
| Midjourney V6 | 图像艺术性极高、风格多样性 | 无视频生成、不支持中文提示词、需付费 | 链接 |
| Runway Gen-3 | 视频质量和运动连贯性一流 | 价格较高、中文支持一般、角色一致性不如通义 | 链接 |
| Stable Diffusion 3.5 | 开源可自部署、定制化强大 | 上手门槛高、无官方视频生成 | 链接 |
相关问题
- 通义万相和通义千问有什么区别?通义千问是大语言模型,主要处理文字对话、问答、长文本分析;通义万相是多模态生成工具,专注图片和视频创作,两者底层模型不同但共用阿里通义生态。
- 角色一致性能用在多人场景吗?目前单次生成只能绑定一个锚定角色,多角色场景需要分段生成并后期合成,官方表示未来会支持多人锚定。
- 生成的视频能否商用?通义万相生成的内容版权归用户,但需遵守阿里云 AI 合规协议,不得用于违法用途。个人项目、商业短片一般都没问题,建议仔细阅读官网的「服务条款」中的知识产权部分。
- 通义万相 2.6 支持 API 调用吗?支持,已集成到阿里云模型服务灵积(DashScope),开发者可以通过 API 实现自动化生成,计费方式与官网一致。
- 相比国内其他竞品(如即梦、可灵),通义万相强在哪?通义万相的中文语义理解更细腻,尤其在古风、成语、诗歌等提示词上表现好;另外它的「参考图驱动」国内目前做得最好的之一。
内容由 AI 生成,产品信息请以官网为准。










