FreeLLMAPI Skill:把 34 家免费 LLM 额度聚成统一 API 端点,月均 740 亿 Token

FreeLLMAPI Skill:把 34 家免费 LLM 额度聚成统一 API 端点,月均 740 亿 Token

功能与原则

FreeLLMAPI 是一个本地自托管的 OpenAI 兼容代理服务,核心职责是将 Google Gemini、Groq、Cerebras、Mistral、NVIDIA NIM、OpenRouter、GitHub Models、Cohere、Cloudflare Workers AI、HuggingFace、Zhipu(智谱)、Moonshot、MiniMax 等 34 家主流 AI 服务商的免费配额,聚合成单一 /v1 端点输出。内置智能路由(按速度、能力、可用额度选择最优模型)+ 自动故障转移(遇到 429 或 5xx 即切换后备链路)+ 加密存储(密钥以 AES-256-GCM 加密落库)。设计原则是”零重复配置、零单点故障”,让个人开发者和 AI 极客用一套统一 key 调用所有免费模型。

认可度

截至 2026-08-26,项目 GitHub Star 数已达 20,191,Forks 2,915。搜索趋势数据显示,2026 年中曾单日新增 700+ stars,近期在 GitHub Trending 日榜稳定出现,被多个技术社区(NeoDrop、CSDN、知乎)列为”本周值得关注的 AI 工具“。支持 34 家免费 LLM 服务商、635 个免费模型端点,聚合月均 Token 量约 740 亿,规模在同类开源聚合器中领先。

链接

GitHub 仓库:https://github.com/tashfeenahmed/freellmapi

原作者

Tashfeen Ahmed(GitHub @tashfeenahmed),独立开发者,MIT 协议开源。项目持续活跃维护,截至 2026-08 仍有每日提交记录,同时提供中文版 fork(linkxzhou/freellmapi-cn)方便国内用户部署。

介绍

2026 年,几乎每个主流 AI 实验室都推出了免费调用额度——Gemini 每月数百万 Token、Groq 每日 1000 请求、Cerebras 可用 235B 大模型……但这些免费资源散落在十几个平台、十几个 SDK、十几套速率限制规则里,手动管理成本极高。FreeLLMAPI 正是解决这个痛点而生:只需在本地起一个 Docker 容器,在管理面板填入各平台 API Key,即可以一个 freellmapi-xxx 统一 Token 对外服务,所有支持 OpenAI 协议的消费端(Claude Code、Cursor、任意 Python/JS 脚本)无需任何改造。

项目基于 Node.js(TypeScript)+ Express + React(管理面板)+ SQLite(密钥存储) 构建。路由层会根据延迟、可用额度、健康状态自动挑选最优模型,失败时自动切换到 fallback chain,最多重试 20 次。用户还可以在管理面板实时查看每个 provider 的用量、成功率和 fallback 记录。

特点

  • 单一 OpenAI 兼容端点:支持 /v1/chat/completions/v1/responses、补全等接口,任意 OpenAI SDK 即插即用
  • 34 家免费 LLM 聚合:Google Gemini 2.5 Pro/Flash、Groq Llama 4、Qwen3 235B、Cerebras、Mistral、SambaNova、NVIDIA NIM 等
  • 自动故障转移:遇到 429(限流)或 5xx(服务异常)自动切换后备链路,保证可用性
  • 密钥加密存储:API Key 以 AES-256-GCM 加密落库,本地服务不泄露上游凭据
  • 智能路由 + 实时监控:按速度/能力/额度选模型,管理面板提供 per-request 日志、延迟、成功率、分 provider 统计
  • 支持 Claude Code / Codex:提供 npx freellmapi setup-claude 一键配置命令
  • Docker 一键部署:兼容 Windows/macOS/Linux/Raspberry Pi(ARM64),镜像约 40MB
  • 模型目录自动更新:通过签名 feed 获取新模型信息,免费用户约 30 天同步一次,Premium($19/年)实时同步

使用方法

Docker 快速启动(推荐):

git clone https://github.com/tashfeenahmed/freellmapi.git
cd freellmapi
# 生成加密密钥
ENCRYPTION_KEY="$(openssl rand -hex 32)"
printf "ENCRYPTION_KEY=%snPORT=3001n" "$ENCRYPTION_KEY" > .env
docker compose up -d

启动后访问 http://localhost:3001,在 Keys 页面填入各平台 API Key,调整 Fallback Chain 顺序,从页面头部复制统一 API Key。

Python 调用示例:

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:3001/v1",
    api_key="freellmapi-your-unified-key",
)
resp = client.chat.completions.create(
    model="auto",  # 路由器自动选择最优模型
    messages=[{"role": "user", "content": "用一句话解释量子计算"}]
)
print(resp.choices[0].message.content)

Claude Code 配置:

npx freellmapi setup-claude

使用场景与人群

适用场景:
– 个人开发者/独立项目:用免费额度做 PoC 和日常开发,降低 LLM 调用成本
– AI 研究者:批量跑实验对比不同模型表现,不需要注册十几个账号
– 多 Agent 系统:给多个 Agent 提供统一的 LLM 入口,支持按需 failover

目标用户: 有一定技术能力、愿意花 30 分钟自托管、想充分利用各平台免费额度的开发者。不适合完全不懂命令行的用户(官方也标注为”Personal experimentation only”)。

输入与输出案例

案例 1:Python 脚本调用

输入(model="auto",路由器自动选最优可用模型):
client.chat.completions.create(
    model="auto",
    messages=[{"role": "user", "content": "写一个快速排序"}]
)

输出:Groq/Llama 3.3 70B 返回完整 Python 快速排序实现
(若 Groq 触发限流,自动切换 Cerebras,返回同样结果)

案例 2:管理面板用量监控

查看 Analytics 页面:
- provider: Groq | requests: 1,247 | success_rate: 98.3% | avg_latency: 412ms
- provider: Cerebras | requests: 389 | success_rate: 99.7% | avg_latency: 287ms
- fallback_attempts: 23(全部成功切换,无用户感知中断)

GitHub: https://github.com/tashfeenahmed/freellmapi

评论区

0 条评论

登录后可评论。

Skill超级捕获手 15 阅读