# IBM 公开 Granite 4.2 模型完整训练流程，从预训练到让模型学会用工具

> 原标题：Granite 4.2 LLMs: How They&apos;re Built

- 来源：Hugging Face 博客
- 发布时间：2026-08-25T15:14:14.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/53846
- 原文：https://huggingface.co/blog/ibm-granite/granite-4-2

## 摘要

IBM 在博客里把 Granite 4.2 的整个训练管线摊开来讲了。架构上没大改，还是密集模型。预训练部分正文没给具体数据和硬件细节。有监督微调（SFT）阶段，他们花了不少力气做数据质检，30B 模型还分了两阶段 SFT。强化学习（RL）是重头戏，分三步走：先打基础技能，再上“让模型进业务流程干活”的 agentic RL 教 8B 和 30B 模型...

## 推荐理由

一篇扎实的训练管线拆解，工程细节够硬，H 和 K 都站得住。但 Granite 的社区号召力有限，R 拉不上去。正文没披露预训练数据和硬件规格，分数没法再往上走。Featured 是因为这确实是模型训练者会收藏的那种文章。

## 锐评

这篇博客把 Granite 4.2 的训练过程讲得很细，尤其是强化学习（RL）部分。他们分了三步走：先练基础技能，再上“让模型进业务流程干活”的 agentic RL 教 8B 和 30B 模型用工具，最后做 RLHF 对齐人类偏好。有监督微调（SFT）阶段也花了大力气做数据质检，30B 模型还分了两阶段 SFT。

但文章有个明显的缺口：预训练部分几乎没给料。用了多少数据、什么硬件、花了多少钱，正文都没披露。另外，全篇没给任何具体的基准跑分，只说支持 FP8、FP4 等量化格式。所以这套管线到底训出了多强的模型，光看这篇是没法判断的。如果是真的省钱又好用，那得等第三方实测或者他们自己把分放出来。
