跳到正文

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

最新精选

第 121–124 条 · 共 124 条

2024年10月1日星期二

OpenAI News

OpenAI 给 GPT-4o 开放了图像微调,开发者可以拿图片和文字一起训练模型了

OpenAI 在 2024 年 10 月 1 日上线了 GPT-4o 的图像微调功能,付费开发者现在能上传图片加文字的数据集来定制模型。最少 100 张图就能看到效果,图越多、数据量越大,提升越明显。Grab 用 100 个样本训练后,车道数量识别准确率提高了 20%,限速标志定位准确率提高了 13%;Automat 把桌面 RPA 机器人的任务成功率...

推荐理由:OpenAI 把视觉微调塞进了正式 API,门槛低到 100 张图,还给了两个有数字的客户案例,HKR 三项都踩实了。对做具体业务的人来说,这比发新模型更直接——能用自己的图片数据把模型掰成自己想要的形状。不过定价那段正文截断了,实际成本还得自己算,这点先别太激动。整体影响面不如旗舰模型发布那么大,但实用度很高,所以重要性给 84、放 featured 是合理的。

OpenAI News

OpenAI 在 API 里上线了模型蒸馏,让你用大模型的回答去教小模型

OpenAI 10 月 1 号在自家 API 里推了一套模型蒸馏工具,核心思路是:先用 GPT-4o 或 o1-preview 这类大模型跑出结果,再用这些结果去微调 GPT-4o mini 这种便宜模型,让它在特定任务上接近大模型的表现,但成本更低。整套流程包括三个部分:Stored Completions 负责自动抓取和保存 API 的输入输出对,...

推荐理由:我会先打个折:这不是新模型发布,而是把模型蒸馏做成 API 内置流水线,附带自动存样本、评测和微调三个套件。正文说 store:true 抓取数据不额外增加延迟,这点先别太激动,实际体验要看并发量。免费 token 额度有截止日期,Evals 免费次数也绑定了与 OpenAI 共享评测的条件,省钱归省钱,但数据会留在对方那边。整体对想用大模型带小模型、又不想自建 infra 的团队挺实用,只是信息缺口在于蒸馏后的模型在具体任务上到底比直接微调强多少,正文没给对比数字。

2024年8月20日星期二

OpenAI News

OpenAI 开放 GPT-4o 微调,训练费每百万 token 25 美元,9 月 23 日前每天送 100 万免费额度

OpenAI 把 GPT-4o 的微调权限开放给所有付费开发者了。训练价格是每百万 token 25 美元,用微调后的模型跑推理,输入每百万 token 3.75 美元,输出每百万 token 15 美元。到 9 月 23 日为止,每个组织每天能免费拿到 100 万训练 token。官方说,几十条样本就能让模型在特定任务上听话不少,比如调整回答风格、遵...

推荐理由:OpenAI 这次给 GPT-4o 开放微调,不是画饼,是直接上线了。我会先打个折:免费额度只到 9 月 23 号,每天 100 万 token,够你跑个小实验但别指望白嫖大项目。训练每百万 token 25 美元,推理输入 3.75、输出 15,价格不算低,但比从头训模型省事太多。真正值得盯的是两个外部团队的成绩——Cosine 在 SWE-bench Verified 上刷到 43.8%,Distyl 在 BIRD-SQL 上拿到 71.83%,说明微调后的 GPT-4o 在代码和 SQL 场景确实能打。正文没披露这两个微调具体用了多少数据、什...

2024年7月24日星期三

OpenAI News

OpenAI 用“规则打分”替代部分人工反馈,让模型在安全问题上更听话

OpenAI 在 7 月 24 日公开了他们用在安全对齐上的新方法:Rule-Based Rewards(RBRs),也就是用一套事先写好的规则给模型回复打分,而不是每次都靠人反复标注。这套方法把模型面对敏感请求时的反应分成三类——硬拒绝(简短道歉并明确说不)、软拒绝(带同理心地拒绝)和正常遵从——然后针对每类行为设定具体的评判标准,比如“回复是否在说...

推荐理由:我会先打个折:正文截取部分没给具体效果数字,也没对比基线,所以分数压在 78–84 这个区间。但 OpenAI 把安全规则显式写进奖励模型这件事本身值得关注,因为它解决的是工程上很实际的麻烦——政策一改,不用重新雇人标一堆数据,改规则就行。三种响应模式(硬拒、软拒、合规)让模型拒绝时不会太生硬,这点对产品体验有帮助。不过别太激动,论文没披露误拒率或漏判率,实际线上表现还得看后续有没有更细的评测。