跳到正文

#数据/训练

今日 0 条

9月22日星期二

Anthropic News

Anthropic 与 WHO 等机构用 Claude 支持刚果(金)埃博拉疫情响应

Anthropic 的 Beneficial Deployments 与应用 AI 团队与 CEPI、WHO 非洲区域办事处、INRB 合作,在刚果(金)Bundibugyo 型埃博拉疫情(BDBV)响应中使用 Claude。

推荐理由:原文披露 Claude 在刚果(金)埃博拉疫情中的具体用法与耗时变化,可了解 AI 在公共卫生应急中的落地边界。

9月14日星期一

OpenAI News

Fyxer 把邮件拆成 30-50 个小模型,草稿采纳率 53%

Fyxer 用 OpenAI 模型做了个 AI 行政助理,核心是把邮件处理拆成 30-50 个专用小模型,分别负责判断要不要回、分析意图、调取记忆、生成草稿。训练数据来自 50 万小时真人行政助理的工作记录,用 LoRA 微调,再通过用户编辑草稿的差异做 DPO 训练(偏好样本教模型学风格)。目前草稿直接采纳率 53%,90 天用户留存 90%。正文没...

9月10日星期四

Mistral AI

Cloudera 与 Mistral 达成合作,将主权 AI 引入企业数据平台

Mistral 与 Cloudera 宣布合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。企业还能在受控环境中用专有数据训练定制模型,数据与模型所有权均归企业,模型基于开放权重。Cloudera 平台上客户管理的数据规模达 30 exabytes。

9月8日星期二

Google DeepMind

Google DeepMind 发布 AlphaGenome Atlas,预测人类基因组全部单碱基变异

Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 多倍。

推荐理由:原文给出覆盖 90 亿单核苷酸变异的预测数据集与 AVI 评分,读者可据此了解基因组变异解读的新工具形态。

9月3日星期四

Hugging Face 博客

用 100 步 GRPO 微调 3.5 亿参数模型,结构化输出合规率从 22.6% 提到 29.7%

Hugging Face 和 Liquid AI 发了一份实操指南,拿 LFM2.5-350M 这个小模型做实验。他们用 TRL 库跑 GRPO(一种按组比较、挑好回答来优化的强化学习方法),只用了 500 条样本、训练 100 步,在免费 Colab GPU 上就能跑完。在 IFStruct 结构化输出基准上,模型按指定格式返回有效结果的比例从 22...

推荐理由:一份实操向的教程,数字具体、方法可复现,H 和 K 都站得住。但内容只对微调工程师有用,缺乏破圈潜力,R 不成立。放在 featured 档给 72 分合理。

8月27日星期四

Anthropic News

Anthropic 开放 1 万个科研人员 Claude 席位并扩大 AI for Science 计划

Anthropic 宣布通过新的 Claude team plan for scientists 向全球科研人员开放 1 万个席位,标准席位免费,5 倍用量上限的高级席位为每月 15 美元,为期一年,并计划在未来数月把该计划扩展到 1 万个席位之外。

推荐理由:Anthropic 公布面向科研人员的免费与折扣席位规模、申请门槛和额度上限,可据此判断科研团队的实际获取路径。

8月26日星期三

Hugging Face 博客

Hugging Face 教你微调多向量嵌入模型:一张 RTX 3090、14.5 小时,就能在自家数据上打败通用检索器

Sentence Transformers v6.0 新增了 MultiVectorEncoder 模型类型,专门做 ColBERT 那种“晚交互”检索——也就是查询和文档各自编码成多个向量,最后再逐 token 算分,比单向量模型更精细。这篇博客手把手教你怎么微调这种模型,作者用一张 RTX 3090(24GB 显存)只跑了 14.5 小时,训练出一...

8月25日星期二

Mistral AI

Mistral 与 HUMAIN 达成战略合作,推进沙特及中东主权 AI

Mistral 与 HUMAIN 宣布战略合作,覆盖 AI 基础设施、先进模型开发与 AI 解决方案部署,初期聚焦网络安全和语音,并计划开发阿拉伯语表现强劲的前沿模型。合作规模达数亿欧元,Mistral 将探索使用 HUMAIN 数据中心基础设施,双方还将在沙特面向受监管行业制定联合市场策略。

7月22日星期三

7月15日星期三

Hugging Face 博客

Thinking Machines 发布 Inkling:一个万亿参数、原生多模态的开源模型

Inkling 是一个总参数量约 1 万亿(975B)、每次推理激活 41B 参数的混合专家(MoE)模型,能直接吃进文字、图片和音频,支持 100 万 token 的上下文窗口。它用 45 万亿个多模态 token 训练,还内置了多 token 预测(MTP)投机解码层来加速推理。模型提供了 BF16 和压缩后的 NVFP4 两种版本,Hugging...

推荐理由:Thinking Machines 这家新面孔一上来就扔了个近万亿参数的多模态 MoE 模型,规格写得挺满:975B 总参、41B 激活、100 万上下文、45T token 训练量,还自带投机解码加速。硬指标和实用性都有料,所以 H 和 K 都站得住。但团队没品牌积累,没故事可讲,R 这块确实弱,大家会先打个折观望。

6月8日星期一

Google DeepMind

Google DeepMind 公布塞拉利昂 AI 教学试验结果

Google DeepMind 公布在塞拉利昂开展的预注册随机对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,相当于八周内取得约 1.2 至 1.7 年的常规学习进度。

推荐理由:原文给出塞拉利昂随机对照试验的量化结果与交互数据,可了解 AI 辅助教学在真实课堂中的效果边界。

5月27日星期三

Mistral AI

Mistral 收购 Emmi AI,加码面向航空航天等行业的 Physics AI 基础研究

Mistral 收购 Emmi AI,以推进面向工业工程的 Physics AI 基础研究,重点覆盖航空航天、汽车、半导体和能源等行业。其已发布成果包括 AB-UPT,可在单张 GPU 上处理 9M 表面和 140M 体积网格的原始几何数据而无需重新划分网格,以及面向大型多物理过程的端到端深度学习代理模型 NeuralDEM。

5月23日星期六

Mistral AI

Mistral 收购 Physics AI 公司 Emmi AI

Mistral AI 宣布已达成收购 Physics AI 先驱 Emmi AI 的最终协议,以强化其作为工业企业 AI 转型伙伴的定位。Emmi AI 成立于奥地利,专注物理 AI 与大型工程模型,可加速工程工作流、以实时仿真替代多日计算并构建数字孪生。Emmi 的联合创始人及 30 多名研究人员和工程师将于 5 月加入 Mistral 的 Science 与 Applied AI 团队。

推荐理由:Mistral 通过收购 Physics AI 公司 Emmi 补强工业仿真能力,读者可了解其向工程与制造场景延伸的路径。

5月19日星期二

Google DeepMind

Google DeepMind Co-Scientist 加速细胞衰老逆转研究

Google DeepMind 的 Co-Scientist 正被用于加速细胞衰老研究,它扫描数万篇论文后提出 20 多个可测试的新遗传因子,其中数个经实验室验证能驱动细胞进入更年轻状态并改善整体功能。它还能将原本需长达六个月的筛选数据分析缩短至几天。

5月17日星期日

Google DeepMind

Google DeepMind 推出 Gemini for Science 科学工具集

Google DeepMind 发布 Gemini for Science,包含 Google Labs 上三个实验性工具:基于 Co-Scientist 的 Hypothesis Generation。

推荐理由:Google 把 Co-Scientist、AlphaEvolve 等研究原型打包成可申请的科学工具,读者可据此判断智能体科研的落地形态。

5月16日星期六

Google DeepMind

剑桥大学教授用 Google Co-Scientist 寻找跨物种传染病分子开关

剑桥大学 Clare Bryant 教授利用 Google Co-Scientist 研究流感等病原体跨物种传播时引发脓毒症等重症的分子开关。Co-Scientist 生成并排序假设,优先锁定一个她此前未关注的蛋白,并逐步将假设细化到具体氨基酸。Bryant 团队正构建含氨基酸突变的细胞系验证,原本需两到三年的工作预计六个月完成。

Google DeepMind

Google DeepMind Co-Scientist 如何助力 Calico 探索衰老生物学

Calico Life Sciences 的 Matt Onsum 与 Katherine Labbé 正使用 Google DeepMind 的 Co-Scientist 整合衰老生物学中零散的研究发现,将其转化为可验证的假设。在整合应激反应(ISR)研究中,该工具帮助团队生成了一条关于代谢如何调控 ISR 的新假设,并协助优化实验设计。相关实验已产生新发现,团队计划发表这些结果。

Google DeepMind

Google Co-Scientist 加速肝病机制发现,提出 MASH 组合疗法新假说

爱丁堡大学团队用 Google Co-Scientist 研究 MASH 肝病,系统整合肝生物学与药理学证据,锁定值得关注的机制并筛选出候选组合疗法。针对 resmetirom 仅对少数合格患者有效的问题,Co-Scientist 提出 NLRP3 炎症小体是连接炎症与代谢的分子桥梁,该假说随后经实验验证,有望推动靶向双重疗法。

5月12日星期二

Google DeepMind

Google DeepMind 发布 Co-Scientist 多智能体科研系统

Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体 AI 系统,可迭代生成、辩论和演化复杂科学问题的新假设。

推荐理由:原文披露了多智能体系统的三阶段协作机制与多个实验室的落地案例,可了解 AI 参与科学假设生成的具体路径。

4月27日星期一

3月18日星期三

Mistral AI

Mistral AI 推出企业级模型训练系统 Forge

Mistral AI 推出 Forge,一套让企业基于自有专有知识构建前沿级 AI 模型的系统,支持预训练、后训练和强化学习等阶段。Forge 支持 dense 与 MoE 架构,并可处理多模态输入,模型可在企业内部基础设施中训练与治理。Mistral AI 已与 ASML、Ericsson、欧洲空间局、新加坡 DSO National Laboratories 等机构合作,用其专有数据训练模型。

推荐理由:原文给出企业用自有数据训练前沿模型的分阶段能力与已合作机构,可据此判断企业自建模型的路径。

3月17日星期二

NVIDIA 博客

GTC 上 NVIDIA 用 RTX 电脑和 DGX Spark 跑本地 AI 助手,还发了新模型

NVIDIA 在 GTC 上主推两件事:一是让 AI 助手直接在 RTX 电脑和 DGX Spark 小超算上本地跑,不用联网,隐私和 token 成本都省了。DGX Spark 有 128GB 统一内存,能塞下 120B 参数以上的模型。二是发新模型,包括小号的 Nemotron 3 Nano 4B 和大号的 Nemotron 3 Super 120...

推荐理由:我会先打个折:正文没披露标题里“最新开放模型”的全量清单和价格,所以不能给更高分。但 HKR 三项都站得住——本地跑大模型和代理的钩子够强,128GB 统一内存和 PinchBench 分数是实打实的数字,而且本地推理正好踩在隐私和成本这两个行业痒点上。保留 featured,不往上提,因为信息有缺口,来源也是厂商发布稿。

3月12日星期四

NVIDIA 博客

英伟达开源 Nemotron 3 Super:120B 模型只激活 12B 参数,跑 agent 任务吞吐量翻五倍

英伟达发了 Nemotron 3 Super,一个总参数量 120B、但每次推理只激活 12B 参数的混合专家模型。它用了混合 MoE、隐式 MoE 和一次预测多个 token 的技术,上下文窗口拉到 100 万 token。官方说在跑 agent 这类多步骤任务时,吞吐量比之前方案高 5 倍;如果搭配 Blackwell 的 NVFP4 精度,推理速...

推荐理由:这是一条扎实的模型发布消息,H、K、R 三点都踩中了。H 靠 5 倍吞吐这个具体承诺抓眼球;K 把参数量、激活量、上下文长度、训练规模和硬件对比都列清楚了,信息密度高;R 在于开放权重和配方,不是只给个模型让你猜。没给更高分是因为关键性能数据都来自 NVIDIA 自家博客,还没看到第三方验证,这点先别太激动。

1月6日星期二

NVIDIA 博客

NVIDIA 把跑千亿参数大模型的机器塞进了桌面

NVIDIA 在 CES 上展示了两台桌面设备 DGX Spark 和 DGX Station,能在本地跑 1000 亿到 1 万亿参数的开源模型。DGX Station 有 775GB 的统一内存,可以把模型压缩到 NVFP4 格式,压缩率最高 70%,跑 llama.cpp 时推理速度平均提升 35%。现场还演示了每秒处理 25 万个 token ...

推荐理由:HKR 三项都站得住:桌面跑大模型的 hook 够强,性能数字和演示数据把事实撑住了,而且整件事指向本地开发闭环能不能替代部分云端迭代这个真问题。不过说到底这是英伟达的产品发布,性能证据都来自厂商自己的演示,我会先打个折,所以重要性停在 75 分。

2025年9月9日星期二

Mistral AI

Mistral AI 完成 1.7B€ C 轮融资,ASML 领投

Mistral AI 宣布完成 1.7B€ 的 C 轮融资,投后估值 11.7B€,由半导体设备厂商 ASML 领投,DST Global、Andreessen Horowitz、Bpifrance、General Catalyst、Index Ventures、Lightspeed 和 NVIDIA 等现有投资方参投。

推荐理由:Mistral AI 完成 1.7B€ C 轮融资,由 ASML 领投,读者可据此了解其资金用途与半导体产业链合作方向。

2025年8月5日星期二

OpenAI News

OpenAI 公开了开源模型 gpt-oss 的极端风险测试方法,并据此决定放行发布

OpenAI 发了一篇技术文章,讲他们怎么评估开源模型 gpt-oss 在最坏情况下可能被用歪的风险。他们用的方法叫“恶意微调”,说白了就是故意把模型往坏里教:在生物风险这块,让模型上网查资料、用强化学习训练它搞威胁制造;在网络攻击这块,把它扔进一个能写代码干活的环境里打 CTF 解题赛。测完发现,被恶意调教过的 gpt-oss 还是打不过他们自家的闭...

推荐理由:我会先打个折:正文只给了相对结论,说 gpt-oss 在两项恶意微调后仍落后于 OpenAI o3,但具体分数、用了多少训练量、触发发布禁令的阈值全都没披露。这点先别太激动,信息缺口不小。真正该盯的是方法论——用恶意微调当最坏情况探针,而不是标题里“开放权重风险”那个大词。对从业者来说,这两套评估环境的设计思路比结论本身更有参考价值。

2025年8月1日星期五

Mistral AI

Mistral 通过微调 Pixtral-12B 提升卫星图像视觉语言模型性能

Mistral 用 LoRA 微调 Pixtral-12B,在 Aerial Image Dataset(AID)卫星图像分类任务上显著优于基座模型。微调通过 Mistral 微调 API 或 LaPlateforme UI 完成,无需大量超参数调优,仅需少量精选样本即可减少基座模型在模糊类别上的误判与幻觉标签。

2025年7月23日星期三

2025年6月16日星期一

OpenAI News

OpenAI 成立政府服务部门,首个大单是跟美国国防部试点,合同上限 2 亿美元

OpenAI 把之前零散的美国公共部门业务打包,推出了“OpenAI for Government”。第一个合作方是美国国防部首席数字与人工智能办公室(CDAO),签了一份上限 2 亿美元的试点合同,主要用 ChatGPT Enterprise 和 ChatGPT Gov 去改造行政流程,比如帮军人家庭查医保、整理采购数据、做主动网络防御。宾州政府之前...

推荐理由:这不是模型发布,但 OpenAI 在政府市场这一步迈得挺实:整合了面向联邦、州和地方政府的项目,首个国防部试点合同金额上限 2 亿美元,还提了个宾州员工日均节省 105 分钟的数字。我会先打个折——正文没写具体模型版本、定价和部署规模,所以效率数据只能当个参考,别太激动。HKR 三项都踩中了,够得上 featured;缺细节让它进不了 p1。

2025年6月11日星期三

Mistral AI

Mistral AI 发布 Mistral Compute AI 基础设施

Mistral AI 发布 Mistral Compute,提供从裸金属服务器到全托管 PaaS 的私有集成堆栈,涵盖 GPU、编排、API 与产品服务。该服务由 Mistral 自研训练套件支撑,可训练和部署任意 AI 负载,作为 NVIDIA 合作伙伴将提供最新参考架构与数万块 GPU。

2025年4月9日星期三

OpenAI News

OpenAI 推出 Pioneers 计划,帮垂直行业做公开评测集和定制模型

OpenAI 在 2025 年 4 月 9 日公布了 Pioneers 计划,第一批只挑少量创业公司合作。核心做两件事:一是针对法律、金融、保险、医疗、会计等行业,和公司一起设计领域专用的评测基准,之后会公开发布——这比模型本身更值得关注,相当于 OpenAI 要下场定义“行业里什么叫好用”。二是用强化微调(RFT,一种用较少数据把模型训成特定任务专家...

推荐理由:HKR-K 和 HKR-R 都过关:OpenAI 确认会公开领域评测、每家公司做三个用例的定制模型,还有研究团队协作的强化微调,这对追领域性能的团队有实际价值。HKR-H 偏弱,而且价格、入选数量、模型基座、时间表正文全没给,所以放在 featured 低段。

2025年3月4日星期二

OpenAI News

OpenAI 成立 NextGenAI 联盟,砸 5000 万美元把高校和图书馆绑上自己的技术栈

OpenAI 拉上 15 家大学、医院和图书馆组了个叫 NextGenAI 的联盟,总共承诺投入 5000 万美元,形式是研究经费、算力补贴和 API 调用额度。这笔钱不是直接发,而是让合作方用 OpenAI 的工具干活。MIT 的师生能拿 API 和算力去训练、微调自己的模型;牛津的博德利图书馆用 API 转录古籍,把几百年前的书变成可检索的电子文本...

推荐理由:OpenAI掏5000万美元加算力和API,把MIT、牛津等15家机构拉进NextGenAI联盟。这事不是发个模型,而是让学术圈用它的工具做训练、微调、甚至转录古籍,等于在下一代研究者和机构里提前铺管道。我会先打个折:正文没披露资金是现金还是额度、算力具体多少、API调用上限,这些缺口让实际力度不好判断。但方向很明确,卖的不是单点产品,是生态绑定。

2024年12月17日星期二

OpenAI News

OpenAI 把 o1 模型放进 API 了,还顺手给实时语音接口降了价

OpenAI 这次主要给开发者端上了几道新菜。首先是 o1 模型正式在 API 里上线,先推给用量最高的第五级开发者。相比之前的预览版,o1 现在能调用外部函数、按你给的 JSON 格式稳定输出、看懂图片,还多了一个叫 reasoning_effort 的参数让你控制它思考多久。官方说它平均比预览版少用 60% 的思考 token,等于更快更省钱。跑分...

推荐理由:这条更新对开发者来说信息量很扎实。o1 补上了之前缺失的生产特性,不再是只能看不能用的状态;推理 token 用量大降和音频价格大砍都是实打实的成本改善。后半段 GPT-4o mini 实时价格被截断,但已披露的部分没有事实错误或过时信息,也没有不安全或误导性的建议。整体判断:事实准确、当前有效、对从业者安全。

2024年10月3日星期四

OpenAI News

OpenAI 给 ChatGPT 加了个叫 Canvas 的侧边栏,写东西和改代码不用再跟聊天框死磕了

OpenAI 在 10 月 3 号给 Plus 和 Team 用户推了个 Canvas 测试版,相当于在 ChatGPT 旁边开了个协作窗口,你可以直接在上面改文字或代码,模型也能像编辑一样给行内建议。它背后是 GPT-4o,专门训练过什么时候该自动弹出这个窗口:写作场景触发准确率到了 83%,编程场景 94%。模型还学会了做定点修改而不是每次都整篇重...

推荐理由:OpenAI 给 ChatGPT 加了个叫 canvas 的协作界面,写作和编程时能单独开一个窗口,选中某段文字直接改、能回退版本,还有调长度、修 bug、代码审查这些快捷操作。我会先打个折,这目前是测试版,只给 Plus 和 Team 用户用。但真正值得看的是他们怎么训的:内部 20 多项评测里,模型知道什么时候该自动弹出 canvas 的准确率写作 83%、编程 94%,定向编辑效果比之前好 18%,评论准确率高出 30%、质量高出 16%。这些数字说明他们不是拍脑袋加功能,而是用偏好数据专门教过模型什么时候该进协作模式、怎么改得更准。对做 A...

2024年10月1日星期二

OpenAI News

OpenAI 给 GPT-4o 开放了图像微调,开发者可以拿图片和文字一起训练模型了

OpenAI 在 2024 年 10 月 1 日上线了 GPT-4o 的图像微调功能,付费开发者现在能上传图片加文字的数据集来定制模型。最少 100 张图就能看到效果,图越多、数据量越大,提升越明显。Grab 用 100 个样本训练后,车道数量识别准确率提高了 20%,限速标志定位准确率提高了 13%;Automat 把桌面 RPA 机器人的任务成功率...

推荐理由:OpenAI 把视觉微调塞进了正式 API,门槛低到 100 张图,还给了两个有数字的客户案例,HKR 三项都踩实了。对做具体业务的人来说,这比发新模型更直接——能用自己的图片数据把模型掰成自己想要的形状。不过定价那段正文截断了,实际成本还得自己算,这点先别太激动。整体影响面不如旗舰模型发布那么大,但实用度很高,所以重要性给 84、放 featured 是合理的。

OpenAI News

OpenAI 在 API 里上线了模型蒸馏,让你用大模型的回答去教小模型

OpenAI 10 月 1 号在自家 API 里推了一套模型蒸馏工具,核心思路是:先用 GPT-4o 或 o1-preview 这类大模型跑出结果,再用这些结果去微调 GPT-4o mini 这种便宜模型,让它在特定任务上接近大模型的表现,但成本更低。整套流程包括三个部分:Stored Completions 负责自动抓取和保存 API 的输入输出对,...

推荐理由:我会先打个折:这不是新模型发布,而是把模型蒸馏做成 API 内置流水线,附带自动存样本、评测和微调三个套件。正文说 store:true 抓取数据不额外增加延迟,这点先别太激动,实际体验要看并发量。免费 token 额度有截止日期,Evals 免费次数也绑定了与 OpenAI 共享评测的条件,省钱归省钱,但数据会留在对方那边。整体对想用大模型带小模型、又不想自建 infra 的团队挺实用,只是信息缺口在于蒸馏后的模型在具体任务上到底比直接微调强多少,正文没给对比数字。

2024年8月20日星期二

OpenAI News

OpenAI 开放 GPT-4o 微调,训练费每百万 token 25 美元,9 月 23 日前每天送 100 万免费额度

OpenAI 把 GPT-4o 的微调权限开放给所有付费开发者了。训练价格是每百万 token 25 美元,用微调后的模型跑推理,输入每百万 token 3.75 美元,输出每百万 token 15 美元。到 9 月 23 日为止,每个组织每天能免费拿到 100 万训练 token。官方说,几十条样本就能让模型在特定任务上听话不少,比如调整回答风格、遵...

推荐理由:OpenAI 这次给 GPT-4o 开放微调,不是画饼,是直接上线了。我会先打个折:免费额度只到 9 月 23 号,每天 100 万 token,够你跑个小实验但别指望白嫖大项目。训练每百万 token 25 美元,推理输入 3.75、输出 15,价格不算低,但比从头训模型省事太多。真正值得盯的是两个外部团队的成绩——Cosine 在 SWE-bench Verified 上刷到 43.8%,Distyl 在 BIRD-SQL 上拿到 71.83%,说明微调后的 GPT-4o 在代码和 SQL 场景确实能打。正文没披露这两个微调具体用了多少数据、什...