7,880 颗星背后,Hatchet 想解决 AI Agent 编排的哪个真实问题

如果你在跑 AI Agent 或者长流程后台任务,大概率遇到过这几个经典问题:进程崩溃后任务全丢、多个 Agent 并行跑互相抢资源、任务跑到一半不知道怎么追查问题。这些问题 Temporal 能解决,但部署维护成本高;用 Redis 写个队列,功能又太薄。

Hatchet 可能是目前最值得认真看一眼的解法。

它到底是什么

Hatchet 是一个用 Go 写的开源编排引擎,GitHub 上 7,880 颗星、490 个 Fork,MIT 协议,对 PostgreSQL 有强依赖——这既是它的技术边界,也是它最大的优势所在:把任务运行时和事件日志都存在 PostgreSQL 里,让”可重现”变成默认行为,而不是额外代价。

官网是 https://hatchet.run,文档在 https://docs.hatchet.run,有 Hatchet Cloud 可以直接注册用,也支持完全自托管。

几个核心概念

Tasks(任务) 是最小单元,本质上就是一个被 Hatchet 包装过的函数,支持 fire-and-forget 和 fire-and-wait 两种模式。Workers 是长期运行的进程,从 Hatchet 拉任务来执行。Durable Workflows 则是把多个任务组成带依赖关系的 DAG,支持断点续跑、复杂暂停/恢复条件、以及事件驱动的触发。

最近一个 release(Python SDK v1.40.0,2026 年 9 月 4 日)刚加了多租户共享并发策略,可以用 CEL 表达式动态计算不同租户的并发上限。同一天的 v0.105.16 引擎版本修了 durable callback 顺序问题,修了好几个 NonDeterminismErrors——说明项目在认真处理生产级问题。

它解决什么真实问题

AI Agent 的断点续跑是最直接的使用场景。Agent 跑一个长任务,中途服务重启,传统方案里这个任务基本就废了。Hatchet 把每次执行都写入事件日志,重启后 Worker 可以从中断点恢复,不会重复执行已完成的部分。这点比 Celery/BullMQ 强很多。

海量并行任务的分发与限流是另一个强项。Hatchet 支持 Worker slot 控制——每个 Worker 根据自身能力声明”一次能接多少活”,系统不会超发。公平调度(fairness)策略确保高优先级任务不会被低优先级任务饿死。还支持基于动态 key 的并发控制,比如”每个用户 ID 最多同时跑 3 个任务”。

多租户场景原生支持,内置 Users 和 Roles,不用自己写权限层。

适合谁,不适合谁

适合: 需要跑长任务(超过几分钟的那种)的团队;已经在用 PostgreSQL、不想再引入 Redis/RabbitMQ 等额外中间件的团队;对任务可追溯性有要求(需要随时重跑、查看历史)的生产系统;AI Agent 开发者,需要可靠的执行保障。

不太适合: 追求极致吞吐量的纯数据管道(这时专用流处理引擎更合适);不想运维 PostgreSQL 的团队(虽然 Hatchet Cloud 托管版可以解决这个问题);喜欢轻量方案的简单脚本场景。

怎么跑起来

最简单的方式是装 CLI,一条命令起本地服务:

curl -fSL https://install.hatchet.run/sh | bash
hatchet --version
hatchet server start

然后装 SDK(Python / TypeScript / Go / Ruby 都可以):

pip install hatchet-sdk

写第一个任务:

from hatchet_sdk import Hatchet

hatchet = Hatchet()

@hatchet.task()
def simple_task(context):
    print("hello from hatchet")
    return {"result": "done"}

# 触发任务
hatchet.put(simple_task)

完整文档和示例代码在 https://docs.hatchet.run/v1/tasks,Cookbook 里收录了 Durable Workflows vs DAGs 的对比选型建议。

周边生态

Discord 社区挺活跃(https://discord.gg/ZHMeUafw89),GitHub Discussions 里有很多深度技术讨论。GitHub 上 open issues 131 个,不算多但维护者响应及时。有一个 Benchmarking 页面(https://webfiddle.net/cats-d8c4vu/docs.hatchet.run/self-hosting/benchmarking),公开了吞吐量数据,官方说生产环境每月处理数十亿任务

下一步建议

如果你是 AI Agent 开发者,建议从 Durable Workflows 入手,把你现有的”一个大函数跑完全部逻辑”拆成多个步骤,感受一下断点续跑的价值。如果你正在选型任务队列,拿 Hatchet 和 Temporal/Conductor/Bruno 做横评,核心对比维度建议放这三点:中间件依赖(是否需要额外部署)、断点续跑能力、多租户支持。

项目地址:https://github.com/hatchet-dev/hatchet
文档:https://docs.hatchet.run

评论区

0 条评论

登录后可评论。