# Netflix 用大模型直接做推荐排序，线上观看时长涨了 0.8%

> 原标题：GenRec: Towards LLM-Native Recommendation at Netflix

- 来源：Hacker News 首页
- 发布时间：2026-08-15T12:56:56.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/50864
- 原文：https://netflixtechblog.com/genrec-towards-llm-native-recommendation-at-netflix-f20be6f643e3

## 摘要

Netflix 发了一篇技术博客，介绍他们正在尝试的推荐系统新方案 GenRec。这个方案不再用传统的推荐模型流水线，而是直接拿一个大语言模型（LLM）来给候选影片打分排序。具体做法分两步：先拿 Netflix 自己的数据继续训练一个基础大模型，让它熟悉平台的内容和用户行为；再把这个模型微调成推荐排序器，输入是用户的观看历史和一批候选片名，输出是排序分...

## 推荐理由

Netflix 拿大模型动自己的推荐系统，是头部公司实实在在的工程动作，有干货。但没开源、没公开指标，影响基本锁在推荐系统圈子里。够得上 featured，但再往上推就缺外部验证了。

## 锐评

这篇博客讲的是 Netflix 把推荐系统的排序环节直接换成一个大语言模型，取名 GenRec。做法分两步：先拿平台自己的数据继续训练一个基础模型，让它熟悉片库和用户行为；再把它微调成排序器，输入是用户看过什么、候选片有哪些，输出就是排序分。线上 A/B 测试的结果是观看时长比现有系统高了 0.8%，离线指标 NDCG 涨了 2.3%。推理延迟控制在 11 毫秒以内，说明他们做了不少工程优化，不然大模型实时排序根本跑不动。

不过文章没提用的是哪个基础模型，参数量也没说。0.8% 的观看时长提升在推荐系统里算不错，但不知道这是靠堆算力换来的，还是模型真的更懂用户。另外，把传统推荐流水线换成一个大模型，维护和排查问题的难度会大很多，这点博客里没展开。成本也是个大缺口——训练和推理分别花了多少钱，完全没披露。

整体看，这是个方向性的尝试，证明大模型直接做排序在工程上可行，但离“比现有方案更划算”还有距离。如果后续能补上模型规模和成本数据，判断会更踏实。
