# 想进顶尖 AI 实验室做预训练？先学会写一个比官方库还快的 GPU 内核

> 原标题：[AINews] How to land a job at a frontier lab (on Pretraining)

- 来源：Latent Space
- 发布时间：2026-05-19T07:31:40.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/26931
- 原文：https://www.latent.space/p/ainews-how-to-land-a-job-at-a-frontier

## 摘要

Vlad Feinberg 写了一篇求职笔记，把进前沿实验室的门槛讲得很直白：核心能力是底层性能调优，也就是能动手改内核（kernel），让模型训练真的跑得动。他给了一道具体的面试题——先推导 Chinchilla 缩放定律，并比较它在稠密模型和 MoE（混合专家）架构下的区别；然后用 JAX 从零实现，最后写一个 Pallas 内核，要求在专家维度 ...

## 推荐理由

这篇文章把“进前沿实验室做预训练”拆成了可操作的技能清单：手写 JAX 内核、自己推一遍 Chinchilla 定律、用 Pallas 给 MoE 的 up/down 投影做融合。我会先打个折——正文没披露这些建议是 Vlad Feinberg 的个人经验还是 Google 的普遍要求，也没说这些技能在面试里占多大权重。但光是这份清单本身，对想往预训练方向走的人就有参考价值，尤其是把“懂缩放定律”从一句空话落到“自己推导过”这个动作上。

## 锐评

这篇笔记最实在的地方，是直接给了一道面试题：先推导 Chinchilla 缩放定律，比较它在稠密模型和 MoE（混合专家）架构下的区别，然后用 JAX 从零实现，最后写一个 Pallas 内核，要求在专家维度 F 大于隐藏维度 D 时，通过融合上下投影来跑赢 jax.lax.ragged_dot。这基本把前沿实验室预训练岗的硬技能要求摊开了——不是调参，是写底层算子。

作者 Vlad Feinberg 的背景偏 Google/TPU 生态，所以例子全押在 JAX 和 Pallas 上，对用 PyTorch 或 CUDA 的人参考价值要打个折。另外他提到 DSL（领域特定语言）做内核开发是个趋势，但正文没展开具体对比，也没给出 Pallas 内核的实际加速数据，只说“找一个能测出前向加速的场景并解释原因”。这点先别太激动，因为没有基准数字，很难判断这个优化在实际训练中到底省多少。

还缺两块关键信息：一是这类岗位的面试通过率或实际招聘人数，二是除了内核优化，团队协作和系统设计在面试中占多大比重。如果只盯着这道题练，可能忽略了实验室对工程落地和沟通能力的要求。
