# OpenAI 给 GPT-4o 开放了图像微调，开发者可以拿图片和文字一起训练模型了

> 原标题：Introducing vision to the fine-tuning API

- 来源：OpenAI News
- 发布时间：2024-10-01T10:04:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/699
- 原文：https://openai.com/index/introducing-vision-to-the-fine-tuning-api

## 摘要

OpenAI 在 2024 年 10 月 1 日上线了 GPT-4o 的图像微调功能，付费开发者现在能上传图片加文字的数据集来定制模型。最少 100 张图就能看到效果，图越多、数据量越大，提升越明显。Grab 用 100 个样本训练后，车道数量识别准确率提高了 20%，限速标志定位准确率提高了 13%；Automat 把桌面 RPA 机器人的任务成功率...

## 推荐理由

OpenAI 把视觉微调塞进了正式 API，门槛低到 100 张图，还给了两个有数字的客户案例，HKR 三项都踩实了。对做具体业务的人来说，这比发新模型更直接——能用自己的图片数据把模型掰成自己想要的形状。不过定价那段正文截断了，实际成本还得自己算，这点先别太激动。整体影响面不如旗舰模型发布那么大，但实用度很高，所以重要性给 84、放 featured 是合理的。

## 锐评

OpenAI 把图像微调正式放进 API，等于让开发者能拿自己的图片加文字去训练 GPT-4o，不再只靠文字调参。这对需要看图的业务是个实在的更新，比如自动驾驶、医疗影像、RPA 桌面自动化。

文章给了两个合作案例：Grab 用 100 张街景图训练后，车道数量识别准确率提升 20%，限速标志定位提升 13%，帮他们把原来人工标注地图的活自动化了。Automat 更夸张，桌面 RPA 机器人的任务成功率从 16.60% 跳到 61.67%，涨了 272%，但起点太低，实际成功率刚过六成，离生产环境稳定跑还有距离。另外他们用 200 张保险单据图做信息抽取，F1 分数只提了 7%，说明复杂文档的理解提升有限。

正文没披露完整定价，只说付费开发者能用，成本未知是个大缺口。图像微调的门槛看着低，100 张图就能起步，但效果跟数据质量和任务类型强相关，别指望随便丢点图就能出奇迹。
