跳到正文

#数据/训练

今日 0 条

昨天 · 9月29日星期二

6月7日星期日

AI HOT 精选

AI 公司开始集体换用更便宜的模型,成本能砍掉九成

Tomasz Tunguz 观察到,基础模型公司往上抢应用层生意、最聪明的闭源模型越来越贵、开源模型又已经够用,这三件事逼着 AI 买家开始大规模“换芯”。Coinbase 把简单任务分流到便宜模型,用量指数级涨但成本没变;Lindy 把所有流量从 Anthropic 切到 DeepSeek v4,省了几百万美元,核心场景效果反而更好;Harvey 在...

推荐理由:这篇不是那种“AI 要颠覆一切”的空话,而是把 Coinbase、Lindy、Harvey 这些公司怎么在实际业务里换模型、省了多少钱讲得很清楚。Harvey 那个 84 美元对 954 美元的例子尤其直观,让人一看就知道成本压力有多大。它属于对行业成本结构变化的扎实观察,不是重大模型发布或产品上线,所以放在 featured 里、76 分这个位置是合适的。

6月5日星期五

新智元 · 公众号

Anthropic 警告 AI 研发已进入自我加速期,OpenAI 被指跨过可靠性门槛

这篇文章本身因为微信环境验证没抓到正文,只能根据已有的英文标题和摘要来还原。核心信息是两条:一是 Yann Dubois 在采访里说 OpenAI 大概在去年 12 月跨过了一个“可靠性阈值”,具体指什么、怎么验证的,正文没披露;二是 Anthropic 内部数据显示,到 2026 年第二季度,公司里每人每季度的代码贡献量已经是 2024 年第一季度的...

推荐理由:我会先打个折,因为这是二手采访分析,不是官方发布或可复现的测试。但三条理由都站得住:标题里的“可靠性阈值”是个悬念钩子,正文抛出了两个带时间或倍数的具体说法,而且讨论的是中美从业者都在盯的算力差距和效率竞赛。所以给到 82 分,放在 featured 位置,不往上拔了。

6月2日星期二

r/LocalLLaMA

我花了几个月钻进 verl 的 RL 训练框架,最后还是放弃了:内部机制、维护分支的代价,还有一个 NCCL 的坑

作者深入研究了字节跳动的 verl(一个做 RLHF 强化学习微调的开源框架),把它的核心流程拆了一遍:DataProto 数据协议怎么走,模型怎么生成回答(rollout),怎么打分(reward),怎么算优势函数(advantage),最后怎么更新模型。作者本来维护了一个自己的分支,但因为上游几乎每天都有改动,同步的成本比自己做改动还高,最后只能停...

推荐理由:这是一篇来自一线的 RL 后训练框架使用报告,不是官方发布。作者没在推销什么,而是老实交代了 fork 又放弃的原因和踩坑记录。我会先打个折:信息密度不错,但只覆盖单机场景,正文没披露多机下的 NCCL 表现。对正在选型或折腾 verl 的人有参考价值,对其他人可能就只是看个热闹。

5月17日星期日

Dwarkesh Patel 播客

预训练并行策略与翻车训练笔记

这篇笔记聊了两件事:预训练为什么容易跑崩,以及怎么把训练拆到多张 GPU 上。跑崩的核心原因有两个——破坏因果性和引入偏差。比如 MoE 路由里用专家选择(expert choice)分配 token,会让 token n 的去向依赖 token n+k 的路由结果,训练时看到了推理时看不到的信息;token 丢弃也会让后面的 token 影响前面的处...

推荐理由:Dwarkesh 这期笔记把预训练里容易翻车的地方摊开讲:expert choice 和 token dropping 会破坏因果性,FP16 集体通信能把一万次累加算偏,这些坑不踩过很难意识到。我会先打个折——它更像从业者之间的经验交换,不是系统性的技术报告,但给的数字(6ND、288GB、参数量×3)对算成本和排故障都有用。正文没展开具体实验验证,所以别当定量结论用。

5月8日星期五

量子位 · 公众号

美国研究员 36 小时跑遍中国 AI 圈:字节让所有实验室紧张,DeepSeek 被所有人夸

Ai2 研究员 Nathan Lambert 在 36 小时内密集拜访了智谱、月之暗面、清华、美团、小米和零一万物。他观察到中国 AI 实验室普遍紧盯字节跳动的动向,同时对 DeepSeek 的技术实力和开源做法表示尊重。学生深度参与核心工作、开源习惯以及技术栈的自主掌控,是中美 AI 生态的几个明显差异。

推荐理由:这篇不是模型发布或大厂合作,属于一手见闻加行业判断,信息密度高但偏观察性质。我会先打个折,放在featured而不是p1。正文没给出具体数据验证,但研究员身份和走访名单让可信度不低,值得从业者花几分钟读。

4月20日星期一

r/LocalLLaMA

用一张 RTX 4090 跑 Gemma 4 26B,从 2400 份财报电话会里挖交易信号,一个有效,一个差点骗过我

一位 Reddit 用户用 800 份标注过的财报电话会记录微调了 Gemma 4 26B,然后在一张 RTX 4090 上花了约 14 小时,推理了 3 年内共 2400 份记录。在 600 份样本外数据上,一个信号显示:CFO 指引越含糊,公司股价在 5 天内相对板块平均跑输约 1.8%,信息系数(IC)为 0.04。另一个信号更强,与板块回报的相...

推荐理由:这是一篇第一人称的实战记录,不是公关稿。作者把 Gemma 4 26B 塞进一张 4090,用 800 份人工标注的财报电话会微调,然后让模型在 2400 份近三年转录上提取交易信号,整批跑完 14 小时。结果里有一个信号站住了:CFO 把业绩指引从具体数字改成模糊表述后,股价 5 日内相对行业落后约 1.8%,IC 0.04,不算强但能用。另一个信号和行业回报相关性高达 0.85,作者直接判定为幽灵信号,提醒读者因子去重比标题里的赚钱故事重要得多。全文没有吹模型多强,反而在讲怎么排雷,信息密度和诚实度都够,适合 featured 位置。

1月3日星期六

TechCrunch · AI

Mercor 三年做到 100 亿美元估值,靠的是给 AI 公司拉高端专家做数据标注

Mercor 这家成立三年的公司,现在估值 100 亿美元,干的活说白了就是给 OpenAI、Anthropic 这些 AI 实验室当人才中介。他们找的不是普通众包人员,而是高盛、麦肯锡、顶尖律所的前员工,时薪最高给到 200 美元,让这些人用自己的行业经验去训练 AI 模型。CEO Brendan Foody 在 Disrupt 大会上聊了几个关键点...

推荐理由:这篇值得看,因为它讲了一个具体又反直觉的链条:OpenAI、Anthropic 这些实验室,通过 Mercor 这个人才中介,把高盛、麦肯锡和顶级律所的前员工拉来给模型做领域知识标注,时薪开到 200 美元。等于说,最可能被 AI 冲击的那批人,现在成了训练 AI 的关键劳动力。Mercor 三年估值冲到 100 亿美元,说明这条供给链跑通了。不过正文没披露具体规模、合同怎么签、任务怎么分配,所以对商业模式和可持续性还得打个问号。我会先打折看,但方向本身已经够说明问题了。