DoorDash 用多个大模型当“陪审团”给菜品打标签,准确率比人工高 20%
Building Food Metadata with LLM Juries
DoorDash 的菜单上有几百万个菜品,名字写法千奇百怪,靠人一个个标辣度、菜系太慢也太贵。他们搭了一套 AI 标注平台,同时看菜名、图片和网页搜索结果来推断属性。最特别的是,他们不用人审,而是让多个强模型组成“陪审团”独立投票、取共识,标注准确率比普通人工审核高出约 20%。另外,他们用“上下文优化代理”在几分钟内自动迭代提示词,把精度又提升了 2...
推荐理由:DoorDash这篇工程博客分享了一套多模态+LLM陪审团的标注流水线,有具体准确率数字和自动调提示词的玩法。对搞AI数据管道的同学挺有启发,但外卖菜单这个领域太垂直,受众面不够广,所以R轴没打勾,整体放在featured档。