# YOLO26 发布：砍掉后处理步骤，让目标检测真正做到端到端实时跑

> 原标题：Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models

- 来源：Hacker News 首页
- 发布时间：2026-06-23T02:28:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/39938
- 原文：https://arxiv.org/abs/2606.03748

## 摘要

Ultralytics 发了 YOLO26 系列，把目标检测里常用的 NMS（非极大值抑制，可以理解为去重后处理）和 DFL（分布焦点损失，一种让检测头变重的回归损失）都去掉了，推理时不再需要额外步骤，直接出结果。模型用了双头设计，训练时引入了一个从大语言模型训练里借过来的 MuSGD 优化器，还搞了一套叫 STAL 的标签分配策略，保证小目标也能被分...

## 推荐理由

YOLO26 这次改动挺狠，直接把 NMS 和 DFL 从流程里拿掉，推理不用再跑后处理，对端侧部署是实打实的简化。双头设计、MuSGD 优化器和 STAL 标签分配这几个点都有技术含量，不是小修小补。我会先打个折：目前只是论文发布，没有产品化信息，也没有实际场景的延迟或精度对比，这点先别太激动。纯视觉检测论文在我们雷达里本来就偏边缘，所以分数没给更高。

## 锐评

YOLO26 这次改动挺实在，主要干了三件事：一是砍掉了 NMS（非极大值抑制，可以理解为检测框去重的后处理步骤）和 DFL（分布焦点损失，一种让检测头变重的回归损失），让模型推理时不再需要额外步骤，直接出结果，这在实际部署中能省不少事。二是训练上借用了大语言模型训练里的 MuSGD 优化器，还搞了一套叫 STAL 的标签分配策略，专门保证小目标也能被分配到正样本，这对小物体检测是个实打实的提升。三是推出了一个叫 YOLOE-26 的开放词汇变体，能用文字提示直接检测没见过的东西，在 LVIS 数据集上拿了 40.6 AP。

性能方面，五个尺寸的模型在 COCO 上跑出了 40.9 到 57.5 的 mAP，在 T4 卡上用 TensorRT 推理延迟只有 1.7 到 11.8 毫秒，速度和精度的平衡做得不错。不过论文是 Ultralytics 团队自己发的，目前只有 arXiv 预印本，还没经过同行评审，实际效果得等第三方复现和更多场景验证。另外，开放词汇检测那部分只给了 LVIS 上的一个数字，跟其他同类模型的横向对比还不够细，这点先别太激动。
