跳到正文

大佬观点

行业关键人物在想什么:创始人访谈、研究者论战、投资人判断的观点集合。

268 条精选相关主题现象与趋势行业动态

最新精选

第 181–200 条 · 共 268 条

4月20日星期一

r/LocalLLaMA

用一张 RTX 4090 跑 Gemma 4 26B,从 2400 份财报电话会里挖交易信号,一个有效,一个差点骗过我

一位 Reddit 用户用 800 份标注过的财报电话会记录微调了 Gemma 4 26B,然后在一张 RTX 4090 上花了约 14 小时,推理了 3 年内共 2400 份记录。在 600 份样本外数据上,一个信号显示:CFO 指引越含糊,公司股价在 5 天内相对板块平均跑输约 1.8%,信息系数(IC)为 0.04。另一个信号更强,与板块回报的相...

推荐理由:这是一篇第一人称的实战记录,不是公关稿。作者把 Gemma 4 26B 塞进一张 4090,用 800 份人工标注的财报电话会微调,然后让模型在 2400 份近三年转录上提取交易信号,整批跑完 14 小时。结果里有一个信号站住了:CFO 把业绩指引从具体数字改成模糊表述后,股价 5 日内相对行业落后约 1.8%,IC 0.04,不算强但能用。另一个信号和行业回报相关性高达 0.85,作者直接判定为幽灵信号,提醒读者因子去重比标题里的赚钱故事重要得多。全文没有吹模型多强,反而在讲怎么排雷,信息密度和诚实度都够,适合 featured 位置。

机器之心 · 公众号

Anthropic 编程智能体负责人讲 vibe coding 的正确姿势:2 周变 1 天,但别让 AI 碰核心逻辑

Anthropic 研究员 Erik Schluntz 分享了他团队用 Claude 写代码的真实工作流。他们最近合并了一个 2.2 万行的生产环境改动,大部分代码由 Claude 生成,把原本两周的工作压缩到了一天。他的做法是先花 15-20 分钟让 AI 通读代码仓库、做规划,然后只让 AI 改叶子节点(也就是依赖最少、影响范围最小的模块),核心逻...

推荐理由:这是一篇来自 Anthropic 内部的实战经验,不是泛泛而谈。有 22000 行生产合并、两周变一天的硬数字,也有可复用的流程规则,比如先让模型花 15 到 20 分钟探索代码库再动手、改动锁在叶子节点、核心路径必须人审。对正在纠结怎么把 coding agent 放进真实流水线的团队来说,参考价值很高。保持 featured 不升 p1,因为它本质是实践课,不是模型或产品重大发布。

r/LocalLLaMA

用本地 Qwen3.6 给 Claude Code 当副手,每次任务省下 30 倍 Opus token

一位 Reddit 用户把 Qwen3.6 通过 LM Studio 接成 Claude Code 的 subagent,让本地模型干提取和审计的粗活,Claude 只做最后决策。在两个审计任务里,Opus 的边际 token 消耗降了约 30 倍:一个 23 个文件的路由审计从 1.3 万 token 降到 400 token,一个 18 个文件的 ...

推荐理由:一个 Reddit 用户拿自己的两台机器做了两组任务对比,数字很直接:23 个路由文件审计从 13k token 降到 0.4k,18 个 Astro 文件盘点从 89k 降到 3k,省了约 30 倍 Opus token。机制是把提取、盘点、审计这类工作交给本地 LM Studio 跑的 Qwen 子代理,Claude Code 只做调度。正文没藏着掖着,承认 Qwen 和 Opus 各有漏检,不是单方面碾压。我会先打个折:只有两个任务、一个人跑、没大规模验证,但思路和数字对想省 Opus 费用的人有直接参考价值。

4月19日星期日

机器之心 · 公众号

内存不够用这件事,可能要持续到2030年

日经亚洲引用供应链数据说,到2027年底全球DRAM产能可能只能满足六成需求。SK集团会长崔泰源更直接,认为短缺会拖到2030年。核心原因是产能规划跟不上:2026到2027年AI数据中心需要的DRAM年产量得增长12%,但厂商实际只安排了7.5%的扩产计划,而且新增产能优先给了高带宽内存(HBM),消费级内存被挤到一边。这不是短期涨价,是产能结构被A...

推荐理由:这条消息的钩子很硬——内存短缺可能持续到 2030 年,不是一次性涨价。正文用 Nikkei Asia 的 60% 需求满足率和扩产缺口把问题量化了,而且点出 AI 数据中心抢产能这个结构原因。对从业者来说,这直接影响算力成本和硬件排期,所以我会先打个折:它不是模型或产品发布,但作为供应链预警,信息密度和时效性都够,放在 featured 里合理。

量子位 · 公众号

马斯克在抖音卖老干妈?其实是 OpenAI 新模型生成的假图

这篇文章展示了用 OpenAI GPT Image 2 生成的几张假图,包括“马斯克抖音直播卖老干妈”和“GTA-6 联动海报”,画面里还伪造了 10 万+ 的在线观看人数。文章说 Image 2 现在能画出很逼真的海报、游戏截图,还能在图上写出可读的长文字,背后可能用了类似 Codex 的界面生成流程。但正文没提这个模型的定价、推送范围和具体上线时间...

推荐理由:HKR 三项全中:钩子够抓人,能力展示很具体,信任崩塌这个点从业者都会关心。没给 p1 是因为正文没披露开放范围、价格和正式发布时间,信息有缺口,我会先打个折。

r/LocalLLaMA

拆解 LangGraph 的 Pregel 执行模型、检查点内部机制和 DeepAgents

这篇帖子把 LangGraph 拆开看,它本质上是对 Pregel 运行时的一层高级封装,核心就三个东西:PregelNode(执行节点)、channel(节点间传数据的通道)和 reducer(定义数据怎么合并)。帖子提到用四张 Postgres 表存检查点,执行流程是 Plan → Execute → Update 的 superstep 循环,c...

推荐理由:这篇文章不是 API 教程,而是把 LangGraph 的并行执行、检查点写放大和子图边界放到同一个 Pregel 运行时模型里看,对做 agent 的人有实操参考价值。正文没给基准测试或生产案例,所以分数没往上拉。

The Verge · AI

内存条短缺可能持续好几年

AI 行业抢内存抢得厉害,到 2027 年底,内存厂商预计只能满足六成需求。三星、SK 海力士、美光都在扩产,但新工厂基本要 2027 或 2028 年才能投产,唯一明确今年能增加产能的是 SK 海力士 2 月刚开的清州厂。核心瓶颈是扩产速度跟不上:2026 和 2027 年内存产出必须每年增长 12% 才够用,正文没披露目前实际增速是多少,这点先别太激动。

推荐理由:这篇报道把内存短缺的时间线拉长到数年,比常见的季度性紧张更有信息量。我会先打个折:正文没披露需求端的具体构成,也没说60%这个数字是怎么算出来的,所以不能当精确预测用。但三家大厂的新增产能在2027年前基本指望不上,2026年只有SK清州工厂能贡献一点增量,这点先别太激动。对AI从业者来说,这意味着训练和推理的硬件成本短期内很难降,做预算时得把内存价格高位当成常态。

4月18日星期六

量子位 · 公众号

OpenClaw 的坑已经踩进奶茶店了

古茗和银泰百货拿 OpenClaw 做测试,踩了 5 个部署的雷:默认端口 18789 直接暴露、至少 8% 的 Skill 是恶意插件、权限越界、一次跑飞吃掉 20 多分钟 token、旧系统防护太弱。实际出过的事包括 agent 把正常堡垒机端口关了导致运维被锁在外面,还有 agent 申请麦克风这种不相关的权限。真正的问题不是聊天体验,而是 ag...

推荐理由:这篇不是泛泛的 AI 安全评论,而是用古茗和银泰的实际测试,列出了 5 类可验证的落地风险和一个真实运维事故。我会先打个折:目前只是个案级别的测试结果,没有官方修复方案,也没有大规模影响或多家交叉验证,所以到不了 P1。但 H、K、R 三项都站得住——事故有钩子、细节可复现、痛点够深,给 featured 没问题。

机器之心 · 公众号

算力不够用了,OpenAI 把宝押在了两件事上

Greg Brockman 透露,因为算力吃紧,OpenAI 砍掉了 Sora 的部分资源,把重心缩到两个方向:一个是个人助手,另一个是能替用户啃硬骨头的 AI 工人。目前算力没法同时撑起这两件事。正文没披露具体的算力预算、时间表和模型参数,所以“下一代基座模型 Spud”到底多强、什么时候出来,都还是未知数。

推荐理由:我会先打个折:正文没披露千亿算力投入的具体金额、时间表和技术参数,所以别当硬数据看。但这条信息值得关注的点在于,它把 OpenAI 的产品排序逻辑讲清楚了——不是退守 B2B,而是被算力预算强行重排。Sora 资源收缩、优先保推理模型和统一 AI layer,这些信号对做应用层的人比单纯吹参数更有参考价值。如果是真的,说明接下来 OpenAI 的开放节奏会更保守,想蹭他们基座能力的团队得重新算账。

Latent Space

OpenClaw 的两面:TED 讲的是故事,工程师看到的是 60 倍安全报告和至少 20% 的恶意技能提交

Peter Steinberger 在同一天放出了两个演讲,面向公众的 TED 版本讲了 OpenClaw 的高光时刻,面向工程师的 AIE 版本则交了底:安全报告数量是 curl 的 60 倍,社区提交的技能里至少 20% 是恶意的。OpenClaw 被称作史上增长最快的开源项目,但正文没披露它的架构、上线时间和治理模式。真正的信号是攻击面的膨胀速度...

推荐理由:我会先打个折:正文没披露 OpenClaw 的具体架构、发布时间和治理机制,所以这篇更像一个信号而不是一份完整分析。但它把公众叙事和工程现实撕开来看,用 60 倍安全报告和 20% 恶意 skill 贡献这两个数字,直接点出开源代理栈的安全债已经跑在治理前面了。对正在搭 agent 的团队来说,这个提醒比增长故事值钱。

X · @dotey(宝玉)

Anthropic 设计师一人扛 7 条产品线,分享了 9 条用 Claude 做设计的实操心得

Anthropic 设计师 Ryan Mather 一个人负责公司 7 个产品线,他公开了自己用 Claude Design 的工作流。核心是先花一小时让 Claude 把代码库和设计稿抽成一套 UI Kit,后续生成的设计稿会自动套用风格,省掉重复劳动。协作上,他建议设计师和工程师一起看着画布边聊边改,取代过去“出稿→丢给开发→返工”的接力模式。操作...

推荐理由:这是条扎实的实操笔记。Anthropic 自家设计师现身说法,给的 9 条建议都能直接落地,不是泛泛聊趋势。我会先打个折:正文没披露省了多少时间、任务成功率这些硬指标,所以分数停在 76。但“人做人审”变成“Claude 做、人审”这个流程转向,对从业者来说比很多产品公告更有参考价值。

4月17日星期五

MIT Technology Review · AI

机器人是怎么学会干活的:一段当代简史

2025年人形机器人拿到的投资是61亿美元,是2024年的4倍。钱突然涌进来,不是因为造出了C-3PO,而是机器人学习的方式彻底变了。以前靠人手写规则,比如叠衣服要定义领口、袖口、折叠角度,情况一多规则就爆炸。2015年前后,前沿做法改成在仿真里用奖励信号让机器自己试错,跑几百万次来学会一个动作。2022年ChatGPT出来后,思路又跳了一步:把大模型...

推荐理由:这篇不是新发布,更像一篇梳理,所以放在 featured 偏低的档位。我会先打个折:正文在案例部分被截断了,后续公司细节没披露,这点先别太激动。但它的价值在于把 61 亿美元的热钱和两条技术路线讲清楚了——仿真试错那套从 2015 年就在跑,2022 年后多模态动作模型开始让机器人直接输出动作,本质是用数据换掉手写规则。对做具身智能的人来说,这个框架比单点新闻更有用。

腾讯技术工程 · 公众号

腾讯工程师用 Claude Code 跑通后台开发全流程,11 个环节在一个终端里搞定

这篇文章来自腾讯技术团队的一次实践复盘,他们用 Claude Code 搭配自定义的 Skills、Commands 和 MCP 服务器,把后台开发的 11 个步骤串成一个终端里的流水线。需求探索这一步花了 20 次工具调用、9.38 万 token、56 秒;执行阶段拆成 4 个任务,产出了 3 次代码提交。核心不是让 AI 直接写代码,而是把需求分...

推荐理由:我会先打个折:这不是模型发布或产品大更新,而是一篇来自一线的实践复盘。但它把 agentic engineering 从概念拉到了可复现的后台开发流程里,token 消耗、工具调用次数、人工卡点都给了具体数字,比市面上大多数“AI 写代码”的公关稿扎实。对正在琢磨怎么让模型进业务流程的从业者来说,这套终端内的编排思路和踩坑记录值得一看。

Dwarkesh Patel 访谈

黄仁勋:美国应该继续卖芯片给中国,放弃 40% 的全球科技市场是帮倒忙

黄仁勋的核心逻辑是:中国占全球科技产业约 40%,如果美国主动退出这个市场,等于把开发者生态和模型优化方向拱手让给华为等中国硬件。他举了个例子——假如 DeepSeek 这类模型优先针对华为架构做优化,而不是跑在英伟达的 CUDA 生态上,那对美国技术栈的长期伤害比单次禁售大得多。他承认华为去年业绩很好、一批中国芯片公司已经上市,而英伟达在中国市场的份...

推荐理由:黄仁勋这段表态信息密度挺高。他没用常规的“禁售会丢订单”那套说辞,而是换了个角度:不卖芯片等于把开发者生态和市场份额拱手让人。40% 这个数字他直接挂在中国科技产业的体量上,意思是放弃这个盘子,美国技术栈的根基会变薄。他还拿 DeepSeek 举例,说如果这类模型先跑去适配华为硬件,美国反而被动——这比泛泛谈风险更有画面感。另外他点了一句 Nvidia 芯片强不光是算力,还在于编程上手容易、生态完善,这其实是在提醒大家,禁售真正伤的是生态绑定,不是一次买卖。整体是个短平快的观点输出,不是深度分析,所以重要性没给太高,但三个维度都踩中了。

最佳拍档

同事.skill 爆火背后:它只是提示词的工程化封装,炼化不了任何人

最近 GitHub 上一个叫“同事.skill”的项目几天就拿了 1.3 万颗星,还衍生出前任、老板、甚至女娲.skill,网上开始流行“散是 Token,聚是 Skill”这种说法,搞得很多人担心自己会被炼化成数字文件、被公司替代。这个视频把技术逻辑拆得很清楚:Skill 的源头是 Anthropic 在 2025 年 10 月给 Claude 上的...

推荐理由:这篇属于二次解读,不是一手发布或实测,但把Anthropic的Agent Skills开放标准和GitHub上爆火的“同事.skill”项目串起来了。我会先打个折,因为正文没披露跨平台兼容率和法律认定标准,这两个缺口让结论没法坐实。亮点在于它没吹“数字分身”,而是把边界说清楚了:适合周报、文档、代码审查这类标准化流程,强制上交反而会炼出废话。对关心工具落地和版权风险的从业者来说,这篇值得一看,但别当产品评测用。

Hacker News 首页

AI 算力开始不够用了

Nvidia Blackwell GPU 的租赁价两个月内从每小时 2.75 美元涨到 4.08 美元,涨了 48%。CoreWeave 也把价格上调了 20%,最低租期从一年拉长到三年。OpenAI 的 CFO 说他们已经在砍项目,因为算力跟不上。Anthropic 最新的模型只给了大约 40 家机构用。作者判断,AI 算力随便用的阶段结束了,接下来...

推荐理由:这篇文章用一个涨价 48% 的数字开场,把算力稀缺从概念变成账单,读起来像朋友发来一条消息说“显卡租金涨了,注意一下”。它没有停留在感叹,而是把 Blackwell 租金、CoreWeave 提价和 Anthropic 限流三件事摆在一起,指向一个判断:稀缺已经开始改写前沿模型的获取门槛。正文没给更细的供需数据或各家采购策略,所以我会先打个折,不把它当一手情报,但作为提醒从业者盯紧成本与容量的信号,已经够用了。

X · @dotey(宝玉)

Boris Cherny 分享 Claude Opus 4.7 深度使用技巧:自动模式、回顾与 /go 工作流

Boris Cherny 根据自己几周的高强度使用,给出了几个让 Claude Opus 4.7 更顺手的实操方法。新加的“自动模式”让模型自己判断命令是否安全并自动执行,不用再频繁点确认,适合跑长时间任务。如果不想全自动,可以用 /fewer-permission-prompts 技能,把安全但总弹窗的命令加进白名单。“回顾”功能会帮你自动总结已完成...

推荐理由:这篇是实战笔记,不是产品公告。HKR 三项都踩实了:/go 把测试、清理、提 PR 串成一条线,钩子够强;Auto mode、Recaps、Focus mode 的用法具体可复现;Claude Code 用户对审批限制的焦虑被直接回应。正文没给价格、上线时间和性能跑分,所以别当评测看,重点盯工作流怎么变。

TechCrunch · AI

Adobe 数据:一季度美国零售商来自 AI 的流量同比涨了 393%,而且这群人更肯花钱

Adobe 周四发了一份报告,说 2026 年第一季度美国零售网站从 AI 助手(比如 ChatGPT、Perplexity 这类产品)过来的流量比去年同期多了 393%。单看 3 月,这个数字是 269% 的增长,去年年底购物季更猛,涨了 693%。报告还提到,从 AI 渠道点进来的访客,转化成下单的比例更高,带来的收入也更多。但正文没披露转化率和收...

推荐理由:我会先打个折:这是二手报道,数据来自 Adobe,TechCrunch 转述,没给原始报告链接。393% 的同比涨幅确实抓眼球,假日季 693% 更夸张,说明消费者在用 AI 助手逛店这件事上已经形成习惯。但正文只说了“转化更好、带来更多收入”,没给具体转化率提升或收入增幅,这点先别太激动。对做电商和做模型的人,真正的信号不是流量涨了多少,而是流量入口在变——AI 导购正在变成一个新的分发层,谁占住这个入口,谁就拿走后面的交易。这个趋势比一个季度的百分比重要得多。

4月16日星期四

Ben's Bites

Ben 的上下文清理小抄:别让 AI 被垃圾信息喂饱

Ben 在飞往旧金山的航班上没网,临时下载了 Gemma 4 26B 模型离线干活,顺便分享了他管理 AI 上下文窗口的几条硬经验。核心观点是:别迷信 100 万 token 的超长窗口,他根本不信任那种窗口下的稳定记忆,任务所需的完美回忆不该超过 15 万 token。他建议在上下文用量达到 60% 左右就收手,因为网页搜索会塞进大量你来不及看的 A...

推荐理由:这是一份个人工作流笔记,不是产品发布或论文,但给出的 60% 上下文红线和对 1M token 记忆的不信任,对天天跟 agent 打交道的人有直接参考价值。我会先打个折:正文没披露这些数字背后的系统测试,更像经验之谈,但胜在具体、可验证。污染链条那段提醒很实在,长上下文不是越大越好,垃圾进去只会放大。

Hacker News 首页

AI 挖漏洞不是拼算力,模型智商才是天花板

antirez 拿 OpenBSD 的 SACK 漏洞举例,说了一个反直觉的结论:用 AI 找代码漏洞,堆 GPU 多跑几次没用。因为代码能走的执行路径是有限的,跑再多轮也会饱和,最终卡住你的是模型本身的智商,而不是采样次数。弱模型就算给它无限的 token,也永远没法把“窗口校验缺失”“整数溢出”“不该为空的指针分支”这三件事串起来,所以找不到真漏洞...

推荐理由:antirez 这篇不是论文,更像一篇带实验的博客。核心判断很明确:AI 找漏洞的上限卡在模型本身的智力水平,不是 GPU 数量。他用 OpenBSD 的 SACK bug 做了个可复现的测试——弱模型就算给你无限 token,也串不起来窗口校验、整数溢出和 NULL 分支这三件事,路径会饱和。这个结论对天天在算成本和效果的人有用:与其无脑加采样,不如盯模型质量和获取速度。我会先打个折,正文没给大规模对比数据,更像单点验证,但逻辑链条清楚,值得一看。