7,880 颗星背后,Hatchet 想解决 AI Agent 编排的哪个真实问题
如果你在跑 AI Agent 或者长流程后台任务,大概率遇到过这几个经典问题:进程崩溃后任务全丢、多个 Agent 并行跑互相抢资源、任务跑到一半不知道怎么追查问题。这些问题 Temporal 能解决,但部署维护成本高;用 Redis 写个队列,功能又太薄。
Hatchet 可能是目前最值得认真看一眼的解法。
它到底是什么
Hatchet 是一个用 Go 写的开源编排引擎,GitHub 上 7,880 颗星、490 个 Fork,MIT 协议,对 PostgreSQL 有强依赖——这既是它的技术边界,也是它最大的优势所在:把任务运行时和事件日志都存在 PostgreSQL 里,让”可重现”变成默认行为,而不是额外代价。
官网是 https://hatchet.run,文档在 https://docs.hatchet.run,有 Hatchet Cloud 可以直接注册用,也支持完全自托管。
几个核心概念
Tasks(任务) 是最小单元,本质上就是一个被 Hatchet 包装过的函数,支持 fire-and-forget 和 fire-and-wait 两种模式。Workers 是长期运行的进程,从 Hatchet 拉任务来执行。Durable Workflows 则是把多个任务组成带依赖关系的 DAG,支持断点续跑、复杂暂停/恢复条件、以及事件驱动的触发。
最近一个 release(Python SDK v1.40.0,2026 年 9 月 4 日)刚加了多租户共享并发策略,可以用 CEL 表达式动态计算不同租户的并发上限。同一天的 v0.105.16 引擎版本修了 durable callback 顺序问题,修了好几个 NonDeterminismErrors——说明项目在认真处理生产级问题。
它解决什么真实问题
AI Agent 的断点续跑是最直接的使用场景。Agent 跑一个长任务,中途服务重启,传统方案里这个任务基本就废了。Hatchet 把每次执行都写入事件日志,重启后 Worker 可以从中断点恢复,不会重复执行已完成的部分。这点比 Celery/BullMQ 强很多。
海量并行任务的分发与限流是另一个强项。Hatchet 支持 Worker slot 控制——每个 Worker 根据自身能力声明”一次能接多少活”,系统不会超发。公平调度(fairness)策略确保高优先级任务不会被低优先级任务饿死。还支持基于动态 key 的并发控制,比如”每个用户 ID 最多同时跑 3 个任务”。
多租户场景原生支持,内置 Users 和 Roles,不用自己写权限层。
适合谁,不适合谁
适合: 需要跑长任务(超过几分钟的那种)的团队;已经在用 PostgreSQL、不想再引入 Redis/RabbitMQ 等额外中间件的团队;对任务可追溯性有要求(需要随时重跑、查看历史)的生产系统;AI Agent 开发者,需要可靠的执行保障。
不太适合: 追求极致吞吐量的纯数据管道(这时专用流处理引擎更合适);不想运维 PostgreSQL 的团队(虽然 Hatchet Cloud 托管版可以解决这个问题);喜欢轻量方案的简单脚本场景。
怎么跑起来
最简单的方式是装 CLI,一条命令起本地服务:
curl -fSL https://install.hatchet.run/sh | bash
hatchet --version
hatchet server start
然后装 SDK(Python / TypeScript / Go / Ruby 都可以):
pip install hatchet-sdk
写第一个任务:
from hatchet_sdk import Hatchet
hatchet = Hatchet()
@hatchet.task()
def simple_task(context):
print("hello from hatchet")
return {"result": "done"}
# 触发任务
hatchet.put(simple_task)
完整文档和示例代码在 https://docs.hatchet.run/v1/tasks,Cookbook 里收录了 Durable Workflows vs DAGs 的对比选型建议。
周边生态
Discord 社区挺活跃(https://discord.gg/ZHMeUafw89),GitHub Discussions 里有很多深度技术讨论。GitHub 上 open issues 131 个,不算多但维护者响应及时。有一个 Benchmarking 页面(https://webfiddle.net/cats-d8c4vu/docs.hatchet.run/self-hosting/benchmarking),公开了吞吐量数据,官方说生产环境每月处理数十亿任务。
下一步建议
如果你是 AI Agent 开发者,建议从 Durable Workflows 入手,把你现有的”一个大函数跑完全部逻辑”拆成多个步骤,感受一下断点续跑的价值。如果你正在选型任务队列,拿 Hatchet 和 Temporal/Conductor/Bruno 做横评,核心对比维度建议放这三点:中间件依赖(是否需要额外部署)、断点续跑能力、多租户支持。
项目地址:https://github.com/hatchet-dev/hatchet
文档:https://docs.hatchet.run
评论区
登录后可评论。