用了八年量化策略,今天发现一个 499M 参数的模型把「K 线图」当语言来训练了——AAAI 2026 收录的论文把这个路子彻底拆开了
K线是所有交易者的共同语言,但AI一直读不懂它。原因很简单:K线不是文字,传统的NLP模型没法直接用。而传统量化模型要么靠手工特征工程,要么靠数字表格数据,始终没摸到K线的「语法」。
这件事,被一个叫 Kronos 的开源项目彻底变了。
2025年8月,清华团队开源了 Kronos——全球首个金融K线基础模型,在 AAAI 2026 正式录用。它的核心思路异常直接:把K线序列当作「语言」来处理,训练一个能读懂K线语法的 Foundation Model。
三个数字说清楚它的规模:45 个全球交易所数据预训练、4.1M 到 499.2M 四档参数、全系开源前三档权重。Kronos-mini 只有 4.1M 参数,Kronos-large 达 499.2M(闭源),全部从 Hugging Face 直接下载。
关键在于它怎么处理K线的「多维连续数据」问题。
传统方案:把 OHLCV(开盘价、最高价、最低价、收盘价、成交量)直接塞进 Transformer,结果是噪音淹没信号。Kronos 的做法分两阶段:
第一阶段:Kronos-Tokenizer 把连续多维 K线数据量化为层级离散 token——类似把声音信号转成音素,K线的「词」和「句子」由此产生。第二阶段:decoder-only Transformer 在这些 token 上做预训练,学习 K线序列中的结构性规律。
结果是一个统一模型可以同时处理预测、分类、异常检测等多种任务,不需要为每个任务单独建模。
代码层面,使用门槛极低:
:
官方还提供了一套微调脚本,可以把模型适配到特定市场的数据结构上。
这个方向的核心价值在于范式迁移:以前量化策略依赖专家定义特征,现在模型自己从原始 K线中提取规律。它本质上和 GPT 把文本当序列训练、CLIP 把图像当语言训练是一回事——只是这次,「语言」换成了 K线。
目前 Kronos-mini/small/base 三档开源,large 未开源。四档均支持 512 token context(以 K线根数为单位),Hugging Face 搜索 NeoQuasar 即可获取。Live Demo 展示 BTC/USDT 24 小时预测结果,可直接体验。
下一步可以做的:如果你有历史行情数据(CSV 格式,含 OHLCV),可以下载 Kronos-small 跑一遍预测流程,感受 tokenizer 和 Transformer 两阶段的具体效果差异。
评论区
登录后可评论。