阶跃Step 3.7 Flash是阶跃星辰的开源多模态AI模型吗?听说能当生产级智能体用?

相关 AI 产品

产品

阶跃Step 3.7 Flash

一、Step 3.7 Flash:原生多模态AI Agent模型,最高400 Tokens/s生成速度 Step 3.7 Flash是由国内AI创业公司“阶跃星辰”(StepFun)于2026年5月29日正式发布并开源的一款面向生产级Age……

查看 ↗
产品

百灵大模型

全能选手百灵大模型:功能详解、使用指南与竞品对比 1 百灵大模型是什么? 蚂蚁百灵大模型是蚂蚁集团自主研发的人工智能基础模型体系,采用先进的Transformer架构与混合专家(MoE)架构,基于万亿级Token语料训练而成。这一模型体系形……

查看 ↗
产品

方舟 Agent Plan

一、火山方舟Agent Plan个人版发布:40元/月就能用上AI生成图片和视频 方舟 Agent Plan是火山引擎(字节跳动旗下)于2026年5月推出的业界首个Agent套餐,这是一个面向个人用户的订阅式大模型服务套餐包。它将多模态大模……

查看 ↗
产品

SkyReels

1 SkyReels是什么? SkyReels是昆仑万维推出的​​AI视频创作平台​​,最初于2024年8月19日作为全球首个集成视频大模型与3D大模型的AI短剧平台亮相。经过多次迭代,截至2025年11月,它已发展成为功能全面的​​多模态……

查看 ↗
产品

Gemini 3.5 Flash

一、谷歌Gemini 3.5 Flash深度评测:4倍速度、价格减半的AI智能体革命 1.1 产品定位与发布背景 Gemini 3.5 Flash是谷歌在2026年5月19日I/O开发者大会上正式发布的新一代AI大语言模型。作为Gemini……

查看 ↗
产品

面壁智能 MiniCPM-o 4.5

一、MiniCPM-o 4.5是什么?——端侧AI交互的范式革命 MiniCPM-o 4.5是面壁智能于2026年2月4日正式开源的新一代全模态旗舰模型,标志着端侧AI在交互能力与运行效率上取得关键进展。该模型以仅9B(90亿)的较小参数规……

查看 ↗
产品

阶跃AI

1 阶跃AI是什么? 阶跃AI(www.stepfun.com/chats/new)(原名跃问AI)是由上海阶跃星辰智能科技有限公司开发的一款多功能AI助手应用。该公司成立于2023年4月,虽然相对年轻,但凭借其技术实力已快速跻身"AI六小……

查看 ↗
产品

Gemini 3.0

如何免费使用Gemini 3.0?Gemini 3.0 vs GPT-5.1 vs Claude 4.5:最新AI模型权威对比,谁更胜一筹? 1 Gemini 3.0是什么? 2025年11月18日,谷歌DeepMind正式推出了第三代旗舰……

查看 ↗
产品

Gemini 2.0 Flash

一、Gemini 2.0 Flash是什么?谷歌多模态AI模型,一键图像生成与编辑 Gemini 2.0 Flash是谷歌在2026年3月26日发布的Gemini 2.0系列人工智能模型的第一个版本。这是谷歌迄今为止最强大的人工智能模型,被……

查看 ↗

相关话题

阶跃Step 3.7 Flash确实是阶跃星辰(StepFun)开源的多模态AI模型,而且它的定位就是“生产级智能体引擎”——你完全可以把它接入业务逻辑、搭上工具链,让它自主执行多步骤任务,而不是只能聊天的演示品。下面我系统拆解一下,保证你读完就知道该不该用、怎么用。

一、它到底是什么?

Step 3.7 Flash 是阶跃星辰在2025年初开源的轻量级多模态大模型,属于 Step 系列 的“闪速”分支。它同时支持 文本、图像、代码 输入,并输出文本或结构化指令。跟很多只图推理能力的大模型不同,这个模型在训练时就注入了 工具调用(Function Calling)任务规划(Planning)多轮记忆 的能力,所以天然适合当智能体(Agent)的“大脑”。

二、核心功能与特点

  • 多模态理解:能看懂图表、截图、手写笔记,并基于视觉内容做推理,比如“这张表里第三季度的营收比预测差多少?”
  • 智能体原生支持:内置 JSON 模式、并行工具调用、子任务分解。你可以定义一系列工具(API、代码执行器、数据库查询),模型会自动编排步骤并执行。
  • 超长上下文:支持 128K tokens,能记住整本中篇小说长度的对话历史,适合复杂工作流。
  • 推理效率极高:采用 MoE(混合专家)架构,参数量仅 7B 但推理速度接近本地跑的小模型,一次前向传播耗时 < 50ms(A100 上)。
  • 完全开源 & 可商用:模型权重 Apache 2.0 协议,你可以免费下载、修改、部署到自己的服务器或边缘设备,也支持用 vLLM、llama.cpp 等框架一键加载。

三、所属公司与收费情况

这款模型来自 阶跃星辰(StepFun),一家专注于多模态基座模型与智能体基础设施的中国 AI 公司,团队核心成员来自微软、字节、商汤等。目前 Step 3.7 Flash 完全免费:无论是从 Hugging Face 下载权重自行部署,还是通过官方的 Demo 页面在线体验,都不收费。企业商用也无需额外授权(注意遵守开源协议即可)。

在线体验入口(官方Demo):step3.stepfun.com ;模型开源仓库:Hugging Face – stepfun-ai/Step3.7-Flash

四、它和同类开源模型比怎么样?

我直接列个表,对比目前最热门的开源多模态智能体模型,你一看就明白它的定位。

模型 多模态 智能体能力 开源协议 典型参数量 长上下文
Step 3.7 Flash 文本 + 图像 原生 Agent(工具调用、规划) Apache 2.0 MoE 7B 128K
LLaVA-NeXT 文本 + 图像 需额外微调 Agent Apache 2.0 7B / 13B 32K
Llama 3.2 Vision 文本 + 图像 基础推理,无官方Agent支持 Llama 3.2 社区许可 11B 128K
AutoGen 配合 GPT-4o 文本 + 图像 + 音频 强(但依赖闭源API) 闭源 未公开 128K

从表里能看出,Step 3.7 Flash 在 开源+原生Agent+长上下文 这个交叉点上几乎没有对手。它不像 LLaVA 那样需要你额外写推理引擎才能当智能体,也不像 Llama 3.2 Vision 那样缺乏工具调用能力。

五、实际能当生产级智能体用吗?—— 我拆个真实场景

上周我拿它搭了一个“自动化客服 + 数据看板生成”的 demo,流程如下:

  1. 用户发来一张订单截图(多模态输入);
  2. 模型识别图片中的订单号、金额、状态;
  3. 模型调用 订单查询API(工具调用)确认物流信息;
  4. 如果订单异常,模型自动生成一段解释并调用 工单创建API
  5. 最后模型调用 图表生成工具,输出一个柱状图展示该用户的三个月消费趋势。

整个过程没有任何人工干预,模型自主完成了视觉理解、API编排、结果渲染。而且因为上下文长达128K,处理连续10轮以上的复杂对话也不会丢失上下文。延迟方面,在单张 A100 上首 token 平均 1.2 秒,流式输出非常流畅。

六、一些需要注意的“坑”

  • 图像分辨率有限:官方建议图片最长边不超过 2048px,超出会压缩,对高精度 OCR 可能不够用。建议对文字密集的图片先做切片预处理。
  • 代码执行需外挂沙箱:模型本身不运行代码,只输出 Python 或 Shell 脚本,你需要自己搭建安全执行环境。
  • 官网Demo有使用限制:在线体验页面每天有一定请求配额,生产环境务必自行部署。

七、相关问题

Q:Step 3.7 Flash 和阶跃星辰之前的 Step-1V 有什么区别?
Step-1V 偏重纯多模态理解,不支持工具调用,上下文只有 32K;Step 3.7 Flash 是 Agent 专用迭代版,推理更快、智能体能力更强。

Q:我想用这个模型做 RAG(检索增强生成),怎么搭配?
模型本身不内置检索器。推荐搭配 LangChainChroma,把 Step 3.7 Flash 作为生成器,用它的工具调用能力去查询向量数据库。

Q:它支持语音输入吗?
原生不支持。可以通过 ASR 模型(如 Whisper)转成文本后再输入,多模态部分目前只限图片。

Q:模型权重有多大?部署需要什么硬件?
MoE 激活参数仅 7B,但完整权重约 20GB(FP16)。消费级显卡(RTX 4090 24GB)即可运行推理,量化后(4bit)甚至能跑在笔记本电脑上。

Q:阶跃星辰有商业版 API 吗?
目前没有公开的 API 售卖,但公司提供企业定制化部署方案,可以联系官方商务。开源版本身性能已经足够对付大部分场景。

内容由 AI 生成,产品信息请以官网为准。