local.ai 今日发布
独立本地 AI 模型真实任务评测平台
local.ai 是一个独立的本地 AI 模型评测平台(Independent Local AI Benchmarks),提供真实硬件环境下的本地模型性能数据。与传统跑分只看 tokens/s 或 FLOPs 不同,local.ai 关注端到端任务耗时(GDPVal task time),帮助用户在真实工作负载下选择最适合自己硬件的本地模型组合。平台收录来自用户实际机器的 Benchmark 数据,覆盖硬件、模型、Agent Harness、推理引擎、量化方案等多个维度的交叉评测结果。
核心功能
local.ai 提供八项核心功能:真实任务耗时评测不以 tokens/s 或内存带宽等单指标衡量,而是测量实际 GDPVal 任务的完成时间,反映真实使用体验;多维度交叉对比将模型、硬件、Harness、推理引擎、量化方案等所有相关变量纳入统一评测框架;硬件覆盖已收录 Apple M4 Max、DGX Spark 等多种设备数据;量化方案评测对同一模型的不同量化版本进行对比;吞吐量和任务时间双视角同时展示 Decode throughput 和 Median GDPVal task time;Early Access 数据共享用户可提交自己机器的 Benchmark 数据;Referral 推荐系统通过邀请机制邀请他人贡献数据;公开透明的数据源所有数据来自真实用户机器,平台不做实验室特调。
特色优势
local.ai 有四项核心优势。第一,关注真实任务时间而非单点指标:相同吞吐量的两个模型,任务完成时间可能相差 3 倍以上(如 Laguna S 2.1 Q4_K_M 39.1 分钟 vs Nemotron 3 Super UD-Q3_K_M 11.9 分钟),证明 tokens/s 不能替代端到端任务评测。第二,揭示硬件规格与实际性能的差异:FP32 计算力更高或内存带宽更大的硬件,不一定在实际任务中更快(如 DGX Spark 30 TFLOPS vs M4 Max 19.8 分钟完成任务),用真实数据打破唯硬件论。第三,帮助用户做出完整配置决策:本地 AI 不只是选模型,还涉及硬件选择、Harness、推理引擎、量化等多个环节,local.ai 是少数提供系统性横向参考的平台。第四,用户贡献的真实性数据:数据来自真实用户提交的跑分结果,非厂商自测,具有独立参考价值。
应用场景
本地 AI 模型选型场景:个人开发者在购买 Mac 或其他开发机前,通过 local.ai 数据评估该硬件运行特定模型的真实性能。本地模型比较场景:在多种本地模型之间犹豫时,通过端到端任务耗时而非 tokens/s 做最终决策。量化方案选择场景:对同一模型不同量化版本有疑虑时,查看真实任务表现和分数差异。AI 开发环境搭建场景:搭建本地 AI 开发环境时,选择合适的 Harness 和推理引擎组合。
适用人群
独立开发者需要在自己的开发机上选择合适的本地模型,了解真实性能而非理论参数时适用。AI 爱好者对本地部署开源模型感兴趣,希望获得有数据支撑的配置建议时适用。技术决策者为团队或项目选型本地 AI 方案,需要客观的性能对比数据时适用。Benchmark 贡献者拥有特定硬件配置,愿意贡献真实跑分数据帮助他人决策时适用。
出品方
local.ai 由独立团队维护,平台定位为本地 AI 领域的第三方评测基础设施,Early Access 阶段用户可申请加入并贡献数据。
更新动态
平台持续收录新硬件和新模型的 Benchmark 数据,用户可通过官网的 Referrals 功能邀请他人使用并贡献数据,数据审核后纳入公开评测库。
官网链接
官网:https://local.ai About:https://local.ai/about 硬件数据:https://local.ai/hardware 模型数据:https://local.ai/models
评论与建议
登录 后参与评论或提建议