Optima

自定义 AI Benchmark 平台

LLM大模型 部分免费

Optima 是 Artificial Analysis 推出的自定义基准测试平台,帮助用户围绕自己的具体任务构建专属评测标准,从而找到最适合特定场景的 AI 模型。传统的标准化评测衡量的是通用能力,但无法回答某个模型是否适合具体业务场景这类问题。Optima 让用户用自己的数据和任务构建评测,直接比较目标模型在实际使用中的表现。用户只需描述工作场景、附上几个示例,平台会自动生成评测任务和评分标准。支持两种评分方式:客观问答由评判模型根据预设答案核对每个响应是否正确;成对比较让模型对同一问题的两个回答进行排序。此外,用户也可以接入自己的 AI Agent,通过 HTTP 参与同场评测。每次评测结果同时展示模型得分、单次调用成本和响应时间三大指标,并按效率做横向排名,帮助用户在性能和费用之间找到最优平衡。平台按实际 token 消耗计费,评判模型的 rubric 评分每次 0.125 美元,Pairwise 每次 0.375 美元。平台核心优势在于结果完全基于用户自身场景,评测效率提升超过 10 倍,用户无需订阅按需付费即可运行评测。

团队信息

由 AI 猎手自动发现

评论与建议

0 条评论