LLM推理弱?加一层代理就能翻倍,准确率2-10x提升
LLM 推理效果差?可能不是模型的问题,是你调用的方式不对。
最近挖到一个超硬核的开源项目 OptiLLM,一个 OpenAI API 兼容的推理优化代理。简单说:你不用换模型,也不用微调,只需要在请求前加个前缀,同样的 GPT-4o-mini 就能在数学、代码、逻辑推理任务上达到甚至超过 GPT-4 的水平。
它是怎么做到的?
OptiLLM 在请求和响应之间插了一层代理,实现了 20+ 种 SOTA 推理优化技术,包括:
- MoA(Mixture of Agents):让多个模型协作,GPT-4o-mini 加 MoA 前缀后在 Arena-Hard-Auto 基准上与 GPT-4o 持平
- PlanSearch:搜索增强规划,GPT-4o-mini + PlanSearch 在 LiveCodeBench 上 pass@5 提升 20%
- MCTS(蒙特卡洛树搜索):在推理路径上做探索和回溯
- Best-of-N:生成 N 个答案,选举最优
- CePO:来自 Cerebras 的组合方法,Llama 3.3 70B 在 Math-L5 上提升 18.6 分
- LongCePO:长上下文增强版,Llama 3.3 70B 在 InfiniteBench 提升 13.6 分
OptiLLM 会自动检测任务类型选择最优策略,也可以手动指定 `{slug}-model-name` 来指定用哪种优化方式。
实测效果有多夸张?
官方基准数据说话:
- Gemini 2.5 Flash + MARS → AIME 2025 从 43.3 分提升到 73.3 分(+30 分)
- Llama 3.3 70B + CePO → Math-L5 从 51.0 提升到 69.6(+18.6 分)
- DeepSeek-R1-1.5B + AutoThink → GPQA-Diamond 从 21.72 提升到 31.06
平均提升 2-10 倍,部分任务直接翻盘顶级闭源模型。
怎么用?
三步上手:
# 1. 安装
pip install optillm
# 2. 启动服务
export OPENAI_API_KEY="your-key-here"
optillm
# 3. 客户端调用(加前缀指定优化策略)
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1")
response = client.chat.completions.create(
model="moa-gpt-4o-mini", # MoA优化,等于用GPT-4o-mini价格跑出GPT-4o效果
messages=[{"role": "user", "content": "Solve: If 2x + 3 = 7, what is x?"}]
)
也支持 Docker 部署:docker run -p 8000:8000 ghcr.io/codelion/optillm:latest
支持哪些模型?
官方内置支持 OpenAI、Anthropic、Google、Cerebras;通过 LiteLLM 兼容 100+ 模型,包括本地部署的 Llama、Qwen 等。LlamaEdge、Ollama 用户也能愉快使用。
适合谁用?
- AI 应用开发者——现有应用加一层代理就能提升推理质量,改动极小
- 研究人士——跑基准评测,快速验证新想法
- 企业用户——用更便宜的模型达到顶级模型效果,成本直接砍半
底层逻辑很直接:推理阶段多做一点计算,换来的是结果质量的指数级提升。不用换模型,不用微调,加一层代理就够了。
GitHub:https://github.com/algorithmicsuperintelligence/optillm
⭐ 4,300+ | Apache-2.0
GitHub: https://github.com/algorithmicsuperintelligence/optillm
评论区
0 条评论
登录后可评论。