跳到正文

大佬观点

行业关键人物在想什么:创始人访谈、研究者论战、投资人判断的观点集合。

268 条精选相关主题现象与趋势行业动态

最新精选

第 141–160 条 · 共 268 条

5月1日星期五

彭博科技

Meta 砸钱搞 AI 像云厂商一样猛,但没看到对应的云收入

Dave Lee 直接批评 Meta 的 AI 资本支出太离谱,最高可能冲到 1450 亿美元。他的核心质疑是:亚马逊和谷歌敢这么花钱,是因为有云业务带来的销售增长做支撑,Meta 没有这块收入,花大钱却看不到能匹配的回报。视频里没展开讲 Meta 具体把预算烧在了哪些模型或基建上,但点出了这种支出节奏不可持续。

推荐理由:这篇不是产品发布或技术论文,而是对 Meta 花钱逻辑的评论。我会先打个折:它没有新模型或新工具,但把 capex 和收入错配这件事讲得很直白。1450 亿这个数字够大,大到让人想问钱花哪儿了;正文又明确说 Meta 的财报电话会口径偏谨慎,没有云收入来兜底。对在看 AI 投入产出比的人来说,这个提醒是及时的。信息密度不算高,但判断清晰,所以放在 featured 里没问题。

4月30日星期四

r/LocalLLaMA

实测:用小模型跑编程 agent,哪些环节会崩

作者花了几周时间,用 7B 以下的本地小模型和免费云端模型跑多文件编程任务,发现结构化输出很不靠谱。崩得最多的地方有三个:模型在回复里乱加 markdown 代码块标记,把编辑内容写到错误的文件里,以及分不清该读文件还是写文件。作者给的解法是做后处理清洗和加校验步骤,但正文没披露具体用哪些模型、测试了多少任务,也没给出量化的成功率,所以这些结论只能当经...

推荐理由:这篇 Reddit 帖子不是论文,是作者拿 Qwen、Gemma 等小模型实打实跑了几周多文件编程 agent 后的踩坑记录。我会先打个折:它只是单人经验,没有系统对比实验,所以给 75 分。但内容很实在——7B 以下模型连输出格式都稳不住,Markdown 围栏乱加、改错文件、读写成写这类问题反复出现。作者没灌水,直接给了后处理、JSON schema 校验、路径白名单和只读路由这些能落地的补救办法。正文没披露具体模型版本和测试任务量,这点让结论的普适性弱一些,但对想用本地模型搭 coding agent 的人,这些失败模式比 benchmark...

新智元 · 公众号

陶哲轩说数学界从缺证明变成证明太多,AI 生成的“生肉证明”堆满 GitHub

陶哲轩最近公开说,数学研究的瓶颈已经从“找不到证明”变成了“证明太多看不过来”。在一个关于 Erdős 问题的 GitHub 页面上,已经有 20 多个 AI 生成的解法等着人去评估。文章提到 GPT-5.4 Pro 用 80 分钟就给出了 Erdős #1196 的一个思路,陶哲轩自己在 24 小时内验证了核心部分。现在真正头疼的不是 AI 能不能解...

推荐理由:这篇东西不是模型发布,但把陶哲轩的发言和 GitHub 上的 AI 证明积压摆在一起,信息量够硬。我会先打个折,因为正文没给出那 20 多份解法的具体通过率或质量分布,只能看到数量堆上去了。真正值得盯的是陶哲轩说的验证与消化工作流——证明便宜了,判断力反而更贵,这个转向对从业者比裸看模型跑分更有参考价值。

FT · 科技

Google 在 AI 军备竞赛中跑赢对手,科技巨头们计划砸下 7250 亿美元

这篇付费文章只露了个头,正文没披露具体的时间范围和各家花钱的明细。从摘要看,Google 在云计算增速上超过了亚马逊和微软,而 Meta 因为大幅上调资本支出,股价承压。7250 亿美元这个数字是几家巨头 AI 投资计划的总额,但具体怎么算出来的、覆盖几年,文章没给。这点先别太激动,关键细节都锁在付费墙后面。

推荐理由:这篇 FT 报道扔出一个 7250 亿美元的 AI 支出预期,说 Google 跑得比同行快,Alphabet 云业务增速也压过 Amazon 和 Microsoft。我会先打个折——正文没披露这数字怎么拆到各家公司、覆盖哪几年、投在模型还是基础设施上,所以别急着拿它当精确坐标。但即便模糊,这个量级和竞争格局对从业者判断算力成本、云厂商选择和资本热度还是有参考价值。

Latent Space

推理算力到了爆发点:CPU 不够用,GPU 也在被拆着用

Latent Space 这期把近期几条线索串了起来:AI 的推理(inference)需求正在急剧膨胀。黄仁勋在 GTC 上说,过去两年单次任务的算力消耗涨了约 1 万倍,总用量涨了约 100 倍,他管这叫“推理拐点”。英特尔 CEO 在财报会上给了更具体的数字,CPU 需求在涨,不是因为训练,而是因为代码智能体、强化学习环境模拟这些推理侧的工作全压...

推荐理由:这是一篇 Latent Space 的新闻汇总和趋势判断,不是模型发布或重大产品更新。它把黄仁勋的预测和 CPU 沙箱、智能体调度这些实际工作负载拆解放在一起,对从业者有参考价值,但信息密度和独家性不如一手发布。我会先打个折,放在 featured 里偏评论解读的位置。

OpenAI News

GPT-5 模型为什么满嘴都是“小妖精”

OpenAI 自己出来解释了 GPT-5.1 之后模型爱用“哥布林”“小妖精”打比方的怪癖是怎么来的。根子出在“书呆子”这个个性定制选项上:训练时给这个风格打分的奖励模型,对带幻想生物词汇的输出格外偏爱,76.2% 的数据集里都给更高分。虽然选“书呆子”的用户只占 2.5%,但贡献了 66.7% 的“哥布林”出现次数。更麻烦的是,强化学习没把这种口癖锁...

推荐理由:我会先打个折:正文就一段 RSS 摘要,触发条件、时间线和修复机制都没披露,所以没法做太硬的判断。但标题已经把传播点、根因和修复方向列出来了,GPT-5 输出“哥布林”这件事本身就够怪,从业者会立刻联想到模型人格化行为是怎么跑进输出链路的。这点先别太激动,因为信息缺口太大,但安全对齐和上线事故这两个话题叠加,确实值得放进 featured 里提醒大家留意后续。

Dwarkesh Patel 播客

Reiner Pope 黑板讲座:大模型训练和推理背后的数学账本

Dwarkesh 把采访间改成了黑板教室,请来芯片公司 MatX 的 CEO Reiner Pope,用公式和粉笔把大模型从训练到服务的成本结构拆了一遍。讲座从批处理大小讲起:没有批处理,服务成本会直接差出 1000 倍,这也是为什么各家 API 定价和快速模式差价巨大的根源。接着讲了 MoE 模型怎么跨 GPU 机柜摆放、流水线并行如何把模型层切分到...

推荐理由:这是一堂黑板课,不是新闻事件,所以分数没往上拉。但内容确实扎实:Pope 把训练和推理里几个关键的成本开关——尤其是批处理对经济性的影响——用数字讲清楚了。我会先打个折,因为正文没给具体实验数据,更多是经验推演,但“1000 倍”这个量级足够让人重新审视自己的服务设计。

4月28日星期二

The Verge · AI

AI 开始批量找漏洞,脚本小子要失业了?

The Verge 这篇讲的是 Claude 的一个安全测试版 Mythos 在 DARPA 的 AI 网络挑战赛里扫了 5400 万行代码。参赛队伍用它不仅找出了大部分预先埋好的漏洞,还额外揪出十几个没埋过的真实 bug。文章没提 Mythos 的跑分、收费方式和怎么申请试用,所以实际效果和成本还得观望。

推荐理由:这篇值得推,因为 DARPA 比赛的数据很实在——5400 万行代码扫下来,工具不仅认出了人工漏洞,还额外揪出十几个没埋的,说明 AI 挖洞确实能跑出意料之外的结果。标题的“脚本小子”说法虽然夸张,但把门槛降低这个风险讲透了。正文没给 Claude Mythos 的基准、价格或开放条件,所以没法判断它到底多强、多贵,这点先别太激动。整体信息量够上推荐位。

彭博科技

WSJ 称 OpenAI 没达到自己定的用户和销售目标

《华尔街日报》拿到内部消息,说 OpenAI 没完成自己设的新用户和销售额目标。公司内部开始担心在 AI 基础设施上砸的钱是不是太多了。不过这篇报道正文被 Bloomberg 的付费墙挡住了,具体目标数字、差了多少、时间范围和花了多少钱都没披露,所以没法判断缺口有多大。

推荐理由:我会先打个折,因为 WSJ 这篇正文没披露具体数字,缺口多大、哪个季度、花了多少钱全不清楚,所以信息密度其实偏薄。但选题本身够直接:OpenAI 自己定的增长目标没完成,内部已经在担心基础设施的高支出扛不住。对从业者来说,这不是公关稿里的增速放缓,而是实打实的成本焦虑——如果连 OpenAI 都踩刹车,整个行业靠烧钱换用户的逻辑就更值得怀疑了。这点先别太激动,等具体数据出来再下重注。

Latent Space

Applied Intuition 十年做成 150 亿美元估值,他们想把所有会动的机器都塞进同一个 AI 操作系统

Applied Intuition 的 CEO 和 CTO 聊了他们从 YC 时期的自动驾驶工具链,一路做到估值 150 亿美元实体 AI 公司的完整路径。公司现在有 30 多款产品,全球非中国车企前 20 名里 18 家是他们的客户,L4 级无人卡车已经在日本跑起来了。他们反复强调,实体 AI 真正的瓶颈不是模型不够聪明,而是怎么把模型塞进车里:车载...

推荐理由:这篇复盘把 Physical AI 从融资故事拉到了实车部署层面,信息量够硬——估值、客户覆盖、L4 落地都有数字撑着。我会先打个折:正文没披露具体模型架构或安全验证的实测数据,所以重要性停在 80 这个区间是合理的。对做车端推理和自动驾驶落地的人,这篇值得一看,但别指望有技术白皮书级别的细节。

X · @dotey(宝玉)

西方忘了怎么造东西,现在也快忘了怎么写代码

作者拿国防工业的教训来比软件行业:美国重启毒刺导弹生产线要4年,因为会造的人早退休了,图纸还是卡特时代的;欧洲承诺100万发炮弹,晚了9个月才凑齐,因为发射药停产17年、TNT只剩一家厂。核心不是没钱,是知识断了。软件业现在也在走这条路——METR的对照实验发现,资深开发者用AI写代码反而慢了19%,但很多人已经离不开AI。Salesforce今年不招...

推荐理由:标题类比够尖锐,正文用军工交付延迟和 METR 的 19% 降速给了硬数字,最后把焦点从 AI 速度拉回到人才断层,对 AI 从业者来说比单纯吹或黑 AI 编程更有讨论价值。因为是转译加评论,权威性打折扣,但信息量和话题度都够,放在 featured 里合适。

4月27日星期一

Dwarkesh Patel 播客

周末杂想:算力垄断、智能与权力的混淆,以及科学验证的困境

Dwarkesh 抛出了一堆他没想明白的 AI 问题。首先是算力分配:全球超过 70% 的 AI 算力握在五家云厂商手里,其中大部分还优先供给了 OpenAI、Anthropic 和 Google DeepMind 三家。他担心普通人会被高价挤出 AI 红利,并追问全民基本算力该怎么搞。其次是模型进步的本质,他搞不清长周期编程智能体到底靠什么突破,也质...

推荐理由:Dwarkesh这期没给实验结论,就是扔了一串开放问题。我会先打个折,因为正文没披露五家厂商占七成算力的数据来源,这点先别太激动。但他把长程编码Agent、KV缓存内存取舍、训练和推理合并这些技术点揉在一起问,确实让人想接着翻答案。真正值得盯的是算力怎么分、模型能不能在线学、以及‘智能’和‘权力’的定义怎么重新划——这些比论文摘要更贴近一线焦虑。没有产品发布或政策变动,所以分数停在评论类的中上区间。

Hacker News 首页

在万米高空断网跑大模型:M5 Max 撑了 10 小时,但一根充电线让我亏了 34W 供电

作者在伦敦飞拉斯维加斯的 10 小时航班上,用一台顶配 MacBook Pro M5 Max(128GB 统一内存、40 核 GPU)离线跑了 Gemma 4 31B 和 Qwen 4.6 36B 两个本地模型。他主要用 DuckDB 搭了个云账单分析工具,还处理了约 400 万 token 的零散编码任务。体验下来,写限定范围的代码、做小工具时,本地...

推荐理由:这是一篇第一人称的本地推理实测,硬件、模型、功耗数字都摆出来了,不是空谈。我会先打个折:它更像个人体验报告,不是行业级发现,所以分数落在 72–77 这个区间。真正有意思的是功耗可观测性——同一负载下 iPhone 线只供 60W,MacBook 线供 94W,差了 34W,这点先别太激动,但说明供电配件对本地跑大模型的实际性能影响不小。正文没披露模型量化方式,也没说具体跑了什么任务,所以不能把结论拔太高。

Hacker News 首页

现在用 AI 可能比雇人还贵

Axios 报道,一些公司的 AI 算力开销已经超过了员工工资。英伟达高管 Bryan Catanzaro 说,他团队的算力成本远高于人力成本;Uber 的 CTO 则因为 token 消耗太快,已经花光了 2026 全年的 AI 预算。Gartner 预测今年全球 IT 支出会涨到 6.31 万亿美元,主要就是被 AI 基建、软件和云服务推高的。文章...

推荐理由:这篇文章把 AI 成本焦虑变成了预算事实。Nvidia 内部团队算力开销远超人力、Uber CTO 的 token 预算提前见底,加上 Gartner 的支出预测,都在说同一件事:AI 的账单开始比工资单更吓人。它不是产品发布或硬新闻,而是趋势报道,所以放在 72–77 这个区间。我会先打个折,因为正文没给出 Nvidia 和 Uber 的具体金额对比,但方向性判断足够清晰,值得从业者看一眼自己的预算表。

Hacker News 首页

停止招新人,你的资深工程师就会反过来拿捏你

Justin Smestad 算了一笔账:如果公司从 2026 年起不招初级工程师,到 2030 年就会养出一支全是贵价老兵的团队,而且毫无还价能力。逻辑很简单——一个资深工程师可以开口要 40% 的涨薪,如果公司没有培养了两年的后备梯队,替代他可能要花六个月,还得按更高的市场价招人。初级员工不只是干杂活,他们是未来的中坚力量,是薪资谈判时的保险。文章...

推荐理由:这篇不是讲模型或产品,是一篇个人评论,但把账算得很清楚。核心逻辑是:你现在省掉初级人头,两年后高级工程师开口要 40% 涨薪,你连个能顶上来的中级都没有,外面招人还得搭进去半年。我会先打个折,因为 40% 和 6 个月这些数字正文没给出处,更像经验估算。不过它提醒了一件容易被季度报表掩盖的事——用 AI 代理替掉初级岗,省的是工资,多出来的可能是组织断层和议价权转移。对在看人效和 AI 落地的团队,这个视角值得扫一眼。

4月26日星期日

Hacker News 首页

西方忘了怎么造东西,现在开始忘怎么写代码

作者拿军工复产的惨痛教训来类比 AI 写代码对软件业的冲击。2022 年下的毒刺导弹订单要到 2026 年才能交付,因为图纸是卡特时期的,懂生产的工程师早退休了,没人接班。欧盟承诺一年给乌克兰一百万发炮弹,但当时年产能只有 23 万发,最后晚了九个月才凑齐。美国核弹头里一种叫 Fogbank 的材料更离谱,停产十几年后想复产,发现老工人都走了,连原始配...

推荐理由:这篇文章不是讲技术,是讲人。它拿军工制造的案例当镜子,照的是 AI 编程正在吃掉初级岗位的入口。我会先打个折:军工和软件行业的生产逻辑不完全一样,但管线断层的类比是成立的。正文没给 AI 编程的具体数据,全靠军工案例的冲击力撑着,所以分数卡在 74 是合理的——观点强,但缺一手编程侧的证据。

Hacker News 首页

别把 AI 代理当同事,把它嵌进你的软件里

Feldera 的联合创始人 Gerd Zellweger 认为,现在流行的 AI 代理(比如那些帮你写代码、查问题的机器人)太像人了:爱解释、爱总结、需要来回对话,用起来很累。他提出应该把代理嵌入现有软件,让它安静地在后台干活。文章给了三种已知的集成模式:命令行接口(CLI)、声明式配置(告诉系统要什么结果,别管步骤)、以及像 Kubernetes ...

推荐理由:这篇文章是 Feldera 联合创始人的工程观点,不是产品发布或一手评测,但把 Agent 嵌入软件的三种模式讲得清楚。我会先打个折,因为正文没给出实际部署数据或对比实验,更像架构主张。不过它把“Agent 解释新信息,数据库引擎持续执行逻辑”这个分工点透了,对正在纠结 Agent 交互形态的从业者有参考价值,所以放在 featured 里。

Hacker News 首页

知识工作的拟像:LLM 把表面功夫做得太好,反而让质量判断失灵了

作者在 2026 年 4 月 25 日发了这篇博客,核心观点很直接:大语言模型(LLM)打破了知识工作里靠“表面质量”当质量代理的潜规则。他举了市场分析报告的例子——一份报告日期不对、有错别字、图表贴错,你直接就不看了,因为连表面功夫都没做好的人,研究大概率也不靠谱。这种“看表面”的代理判断以前很管用,成本低、相关性也高。但 LLM 太擅长模仿专业文风...

推荐理由:一篇个人视角的尖锐随笔:大模型让产出看起来专业,但审查和信任机制没跟上。用咨询报告和代码审查举例,指出团队现在只是快速扫一眼就通过,真正该盯的是模型背后的概率偏好和评估方式,而不是产出本身像不像真的。观点清晰,但没有实证支撑,我会先打个折,当一篇引发思考的评论看。

Hacker News 首页

用 Claude Code 把烂尾项目捡起来跑通,这事不丢人

作者拿自己一个搁置已久的项目做实验:写一个中间层,把 YouTube Music 伪装成 OpenSubsonic 服务,让 Feishin、Symfonium 这些播放器能直接播 YouTube 上的歌。他用 Claude Code(Opus 4.6)从零搭,技术栈是 FastAPI、Pydantic、ytmusicapi 和 yt-dlp。做法是先...

推荐理由:这是一篇第一人称的实战记录,不是行业通稿。作者用 Claude Code 加 Opus 4.6 重写 YouTube Music 到 OpenSubsonic 的连接器,技术栈交代清楚,调试过程有具体细节。最值得看的是他的工作方式:先写清楚 spec,再让模型生成,最后人工验收,比一次性全丢给模型靠谱得多。信息量够、有可复用的思路,但影响范围就停在个人开发工作流这个层面,没到行业级更新。

4月25日星期六

Hacker News 首页

AI 代理的故事里缺了什么:不是模型能力,是信任边界

Mark Nottingham 直接戳破了“AI 代理为你工作”这个说法。他列了 8 个互联网信任崩塌的真实案例,其中一个是微软新版 Outlook 会偷偷把第三方邮箱密码传到自家云端,再分给 700 多个数据伙伴。核心问题不是模型不够聪明,而是我们根本没想清楚:当软件能替你做事时,它到底在替谁做事。文章没给技术方案,但把“委托边界”这个被忽略的前提摆...

推荐理由:HKR 三项都成立,但这是署名评论而非模型或产品发布。Mark Nottingham 在 Web 协议领域的权威加上 Hacker News 上的讨论热度,让它够得上 featured 门槛,但到不了 P1。