FreeLLMAPI Skill:把 34 家免费 LLM 额度聚成统一 API 端点,月均 740 亿 Token
FreeLLMAPI Skill:把 34 家免费 LLM 额度聚成统一 API 端点,月均 740 亿 Token
功能与原则
FreeLLMAPI 是一个本地自托管的 OpenAI 兼容代理服务,核心职责是将 Google Gemini、Groq、Cerebras、Mistral、NVIDIA NIM、OpenRouter、GitHub Models、Cohere、Cloudflare Workers AI、HuggingFace、Zhipu(智谱)、Moonshot、MiniMax 等 34 家主流 AI 服务商的免费配额,聚合成单一 /v1 端点输出。内置智能路由(按速度、能力、可用额度选择最优模型)+ 自动故障转移(遇到 429 或 5xx 即切换后备链路)+ 加密存储(密钥以 AES-256-GCM 加密落库)。设计原则是”零重复配置、零单点故障”,让个人开发者和 AI 极客用一套统一 key 调用所有免费模型。
认可度
截至 2026-08-26,项目 GitHub Star 数已达 20,191,Forks 2,915。搜索趋势数据显示,2026 年中曾单日新增 700+ stars,近期在 GitHub Trending 日榜稳定出现,被多个技术社区(NeoDrop、CSDN、知乎)列为”本周值得关注的 AI 工具“。支持 34 家免费 LLM 服务商、635 个免费模型端点,聚合月均 Token 量约 740 亿,规模在同类开源聚合器中领先。
链接
GitHub 仓库:https://github.com/tashfeenahmed/freellmapi
原作者
Tashfeen Ahmed(GitHub @tashfeenahmed),独立开发者,MIT 协议开源。项目持续活跃维护,截至 2026-08 仍有每日提交记录,同时提供中文版 fork(linkxzhou/freellmapi-cn)方便国内用户部署。
介绍
2026 年,几乎每个主流 AI 实验室都推出了免费调用额度——Gemini 每月数百万 Token、Groq 每日 1000 请求、Cerebras 可用 235B 大模型……但这些免费资源散落在十几个平台、十几个 SDK、十几套速率限制规则里,手动管理成本极高。FreeLLMAPI 正是解决这个痛点而生:只需在本地起一个 Docker 容器,在管理面板填入各平台 API Key,即可以一个 freellmapi-xxx 统一 Token 对外服务,所有支持 OpenAI 协议的消费端(Claude Code、Cursor、任意 Python/JS 脚本)无需任何改造。
项目基于 Node.js(TypeScript)+ Express + React(管理面板)+ SQLite(密钥存储) 构建。路由层会根据延迟、可用额度、健康状态自动挑选最优模型,失败时自动切换到 fallback chain,最多重试 20 次。用户还可以在管理面板实时查看每个 provider 的用量、成功率和 fallback 记录。
特点
- 单一 OpenAI 兼容端点:支持
/v1/chat/completions、/v1/responses、补全等接口,任意 OpenAI SDK 即插即用 - 34 家免费 LLM 聚合:Google Gemini 2.5 Pro/Flash、Groq Llama 4、Qwen3 235B、Cerebras、Mistral、SambaNova、NVIDIA NIM 等
- 自动故障转移:遇到 429(限流)或 5xx(服务异常)自动切换后备链路,保证可用性
- 密钥加密存储:API Key 以 AES-256-GCM 加密落库,本地服务不泄露上游凭据
- 智能路由 + 实时监控:按速度/能力/额度选模型,管理面板提供 per-request 日志、延迟、成功率、分 provider 统计
- 支持 Claude Code / Codex:提供
npx freellmapi setup-claude一键配置命令 - Docker 一键部署:兼容 Windows/macOS/Linux/Raspberry Pi(ARM64),镜像约 40MB
- 模型目录自动更新:通过签名 feed 获取新模型信息,免费用户约 30 天同步一次,Premium($19/年)实时同步
使用方法
Docker 快速启动(推荐):
git clone https://github.com/tashfeenahmed/freellmapi.git
cd freellmapi
# 生成加密密钥
ENCRYPTION_KEY="$(openssl rand -hex 32)"
printf "ENCRYPTION_KEY=%snPORT=3001n" "$ENCRYPTION_KEY" > .env
docker compose up -d
启动后访问 http://localhost:3001,在 Keys 页面填入各平台 API Key,调整 Fallback Chain 顺序,从页面头部复制统一 API Key。
Python 调用示例:
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:3001/v1",
api_key="freellmapi-your-unified-key",
)
resp = client.chat.completions.create(
model="auto", # 路由器自动选择最优模型
messages=[{"role": "user", "content": "用一句话解释量子计算"}]
)
print(resp.choices[0].message.content)
Claude Code 配置:
npx freellmapi setup-claude
使用场景与人群
适用场景:
– 个人开发者/独立项目:用免费额度做 PoC 和日常开发,降低 LLM 调用成本
– AI 研究者:批量跑实验对比不同模型表现,不需要注册十几个账号
– 多 Agent 系统:给多个 Agent 提供统一的 LLM 入口,支持按需 failover
目标用户: 有一定技术能力、愿意花 30 分钟自托管、想充分利用各平台免费额度的开发者。不适合完全不懂命令行的用户(官方也标注为”Personal experimentation only”)。
输入与输出案例
案例 1:Python 脚本调用
输入(model="auto",路由器自动选最优可用模型):
client.chat.completions.create(
model="auto",
messages=[{"role": "user", "content": "写一个快速排序"}]
)
输出:Groq/Llama 3.3 70B 返回完整 Python 快速排序实现
(若 Groq 触发限流,自动切换 Cerebras,返回同样结果)
案例 2:管理面板用量监控
查看 Analytics 页面:
- provider: Groq | requests: 1,247 | success_rate: 98.3% | avg_latency: 412ms
- provider: Cerebras | requests: 389 | success_rate: 99.7% | avg_latency: 287ms
- fallback_attempts: 23(全部成功切换,无用户感知中断)
评论区
登录后可评论。