# DoorDash 用多个大模型当“陪审团”给菜品打标签，准确率比人工高 20%

> 原标题：Building Food Metadata with LLM Juries

- 来源：Hacker News 首页
- 发布时间：2026-07-14T01:41:49.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/44131
- 原文：https://careersatdoordash.com/blog/building-food-metadata-with-llm-juries-context-optimization-multimodal-ai/

## 摘要

DoorDash 的菜单上有几百万个菜品，名字写法千奇百怪，靠人一个个标辣度、菜系太慢也太贵。他们搭了一套 AI 标注平台，同时看菜名、图片和网页搜索结果来推断属性。最特别的是，他们不用人审，而是让多个强模型组成“陪审团”独立投票、取共识，标注准确率比普通人工审核高出约 20%。另外，他们用“上下文优化代理”在几分钟内自动迭代提示词，把精度又提升了 2...

## 推荐理由

DoorDash这篇工程博客分享了一套多模态+LLM陪审团的标注流水线，有具体准确率数字和自动调提示词的玩法。对搞AI数据管道的同学挺有启发，但外卖菜单这个领域太垂直，受众面不够广，所以R轴没打勾，整体放在featured档。

## 锐评

DoorDash 面对的是几百万个写法放飞自我的菜名，靠人一个个标属性又慢又烧钱。他们这套方案最实在的地方是两件事：一是用“LLM 陪审团”代替人审，让多个强模型独立投票取共识，标注准确率比普通人工审核高出约 20%，直接绕开了传统人工标注的瓶颈。二是用这个陪审团自动生成训练数据，微调小模型，让最终上线的小模型推理质量对齐前沿大模型，但成本只要十分之一。

另外，他们搞了个“上下文优化代理”，能在几分钟内自动迭代提示词，把精度又往上拉了 20% 以上，提示词开发速度加快了十倍。工程上用了分布式推理，把几百万条数据的回填时间从一个月压到几天，这点对实际落地很关键。

不过，文章没交代陪审团具体用了哪几个模型、单条标注的推理延迟是多少，也没给出每处理一条菜品的实际成本。所以“成本降到十分之一”这个数字，得看它对比的是哪个大模型的 API 价格。整体来看，这是一套用大模型做裁判、用小模型干活的务实方案，适合数据量大、标注标准模糊的场景，但效果上限很依赖陪审团里那几个“法官”本身的质量。
