RF-DETR

Roboflow 开源实时目标检测Transformer

AI编程开发 部分免费

项目简介

RF-DETR 是由 Roboflow 团队开源的实时目标检测与实例分割模型架构,全称为"Real-Time Detection Transformer"。该模型基于 DINOv2 视觉 Transformer 主干网络构建,在 Microsoft COCO 数据集和 Roboflow 自有的 RF100-VL 基准上实现了实时模型中最先进的准确率与延迟权衡。RF-DETR 获得了 ICLR 2026 会议的认可,已在 GitHub Trending 榜单上位居前列,受到计算机视觉社区的广泛关注。

核心功能

目标检测:在 COCO 数据集上,RF-DETR-L 达到 75.1% AP50 和 56.5% AP50:95,在 T4 GPU 上的推理延迟仅为 6.8 毫秒,全面超越 YOLO11-X 和 LW-DETR 等同类实时模型。

实例分割:在 COCO 实例分割任务上,RF-DETR 同样在精度与速度上取得了 SOTA 表现,单一 API 同时支持检测与分割两种任务,无需切换模型。

关键点检测(预览):模型还支持关键点检测功能,作为实验性预览特性发布,可用于人体姿态估计等下游任务。

神经架构搜索(NAS):相同规模的模型通过神经架构搜索自动发现,NAS 方法已在 Roboflow 平台上开放,用户可以为自己的数据集自动搜索最优检测架构。

模型规模矩阵:从 RF-DETR-N(30.5M 参数)到 RF-DETR-2XL(126.9M 参数)共 6 个规模,Apache 2.0 协议下提供 N/S/M/L 四个规模,Plus 授权下提供 XL/2XL 两个大规模版本。

技术实现

RF-DETR 采用 DINOv2 作为视觉编码器骨干,将图像编码为高维特征表示后,通过 Transformer 解码器完成目标检测任务。模型推理在 NVIDIA T4 GPU 上使用 TensorRT FP16 加速,实测延迟从 2.3ms 到 17.2ms 不等。COCO 精度数据均通过 pycocotools 在 SAB 上测量,确保所有对比数据来源一致、可直接比较。模型通过 pip install rfdetr 即可安装使用,或从 GitHub 开发分支安装最新未发布版本。开放模型采用 Apache 2.0 许可,可自由用于商业项目。

快速上手

第一步:安装模型 pip install rfdetr(Python 3.10+ 环境)

第二步:使用模型 from rfdetr import RFDetr; model = RFDetr.from_pretrained("roboflow/rf-detr-l")

第三步:执行推理 result = model.predict("image.jpg")

第四步:导出 ONNX 或 TensorRT 加速版本用于生产环境推理

适用人群

计算机视觉工程师和研究人员;需要在自有数据集上快速部署目标检测模型的开发者;对实例分割有需求的产品团队;希望比较最新检测模型性能的 AI 研究者;需要在边缘设备上运行视觉模型但要求高精度的团队。

团队信息

由 AI 猎手自动发现

评论与建议

0 条评论