跳到正文

大佬观点

行业关键人物在想什么:创始人访谈、研究者论战、投资人判断的观点集合。

268 条精选相关主题现象与趋势行业动态

最新精选

第 161–180 条 · 共 268 条

4月25日星期六

Hacker News 首页

数据库没为 AI 代理这波操作做过设计

Arpit Bhayani 指出,让 AI 代理直接操作数据库,会同时打破我们过去四十年默认的四条规矩:查询是写死的、写入是有人审核过的、连接是短暂的、出问题有人盯着。他给 PostgreSQL 开了几剂具体药方:给代理用的数据库角色加上 5 秒语句超时和 10 秒事务空闲超时;全面改用软删除,并记录是谁删的、为什么删;对关键数据只追加不修改,靠事件日...

推荐理由:我会先打个折,这篇文章不是模型发布或产品更新,属于工程评论,所以分数放在 72–77 这个区间合理。但它的切入角度很刁,把数据库的老规矩和智能体的新行为直接对撞,而且给了能落地的 Postgres 防护参数,对正在让智能体进业务流程的团队来说,这些坑和补丁比泛泛而谈的安全建议有用得多。正文没给出大规模压测数据,所以别指望它能证明这些配置在生产环境扛不扛得住,但作为一份“把 agent_worker 当不可信调用方”的实操清单,价值够了。

The Verge · AI

一本新书复盘了 Maven 项目:美军是怎么从嫌弃 AI 到离不开它的

Katrina Manson 的新书梳理了 Maven 项目从 2017 年用计算机视觉分析无人机视频起步,到后来演变成 Maven Smart System 的全过程。书里最抓眼球的一个数字是:在对伊朗行动的头 24 小时里,美军靠这套 AI 系统辅助打了一千多个目标,规模差不多是二十年前伊拉克“震慑”行动的两倍。不过这篇采访没提现在用的是哪家公司的...

推荐理由:这篇讲的是美军怎么从 2017 年用 Project Maven 看无人机画面,走到今天靠 AI 系统加速生成打击目标。我会先打个折:正文没披露当前用的模型、供应商换过没有、部署范围多大,所以分数停在 74。但 24 小时打 1000 多个目标这个数字很直观,差不多是 20 多年前伊拉克“震慑行动”的近两倍,能让人立刻感受到 AI 在实战里的介入程度。Katrina Manson 的新书追溯了这段历史,不过细节缺口明显,这点先别太激动。

4月24日星期五

Hacker News 首页

为什么你应该拒绝让医生用 AI 帮你记病历

Emily M. Bender 和 Decca Muldowney 给了 9 个理由,劝患者在诊室里拒绝 AI 自动记录系统。这类工具会录下你和医生的对话,自动生成病历草稿。她们的核心担忧不是技术出错,而是诊所会把省下的时间拿来塞更多病人,而不是让你多聊一会儿。具体风险包括:录音和文字稿交给第三方公司,隐私保护未必靠谱;患者很难在几分钟内真正搞懂数据会...

推荐理由:这篇文章不是技术评测,是一篇立场鲜明的评论。两位作者直接劝患者对诊室里的 AI 录音工具说不,理由集中在录音数据怎么用、谁有权限看、语音识别对带口音的人不公平,以及医生可能过度信任 AI 草稿而漏掉关键信息。我会先打个折:全文没有给出实证数据,更像一份风险清单,所以重要性不会拉太高。但它的传播价值在于把“省时”背后的代价摊开讲——机构可能把省下来的时间变成更多接诊量,而不是让医生更仔细看你。这点对从业者来说是个提醒,别只盯着效率数字。

Hacker News 首页

Affirm 用一周时间让 800 多名工程师集体切换 AI 编程智能体

2026 年 2 月,Affirm 停掉常规开发,让全公司 800 多名工程师花一周时间,用 AI 编程智能体(agent)把真实需求从想法一路做到提交 PR。到文章发布时,超过 60% 的 PR 都有智能体参与。文章说,2025 年底已经有 80% 以上的工程师每周用 AI 开发工具,但少数人用得很深、多数人还在观望,差距在拉大,所以他们决定用集中一...

推荐理由:这条消息的看点不是 Affirm 用了什么工具,而是组织层面的一次硬切换:800 多人的工程团队停摆一周,全员跑 agentic 开发流程,之后六成以上 PR 都有 agent 参与。数字够具体,动作够极端,对正在琢磨怎么推 AI 编码的团队来说,参考价值比普通客户案例高出一截。正文没给出长期质量和速度数据,这点先别太激动,但就冲这个规模和执行速度,值得放进 featured。

机器之心 · 公众号

机器人跑赢人类马拉松后,资本开始从硬件转向“大脑”

荣耀的人形机器人“闪电”在北京亦庄半马跑出50分26秒,比人类男子世界纪录57分20秒还快。宇树H1在1.9公里弯道赛段也跑出4分13秒。文章说2026年一季度具身智能融资近200笔、总额超300亿元,4月16日灵初智能又拿了4.55亿美元Pre-A轮。信号很直接:钱正从机器人本体流向模型和智能系统,硬件能卷的差不多到头了。

推荐理由:文章用一个直观的比赛成绩开场,然后落到融资数据和行业判断上,没有空谈概念。我会先打个折:正文没交代机器人是在什么规则、什么路况下跑的,和人类纪录的直接对比要谨慎看。但Q1融资规模和它石智航那笔大额Pre-A轮是实打实的新信息,加上“硬件护城河变浅、大脑才是下半场”这个判断,对关注具身智能方向的人有提醒作用。整体是评论性质,不是一手产品发布或论文,所以放在featured。

MIT Technology Review · AI

医疗 AI 已经进医院了,但我们还不知道它到底能不能让病人好得更快

密歇根大学的 Jenna Wiens 和多伦多大学的 Anna Goldenberg 在《自然·医学》上发了篇文章,核心就一句话:医院里 AI 工具铺得很快,但没人认真评估它们对病人最终健康结果的影响。2025 年一项研究说,美国约 65% 的医院在用 AI 做预测,其中只有三分之二会检查模型准不准,至于用了之后临床决策有没有变好、病人有没有受益,基本...

推荐理由:我会先打个折,这篇文章没有新模型、新法规或临床试验结果,所以分数到不了顶。但它抓的时机很准:医院里AI预测工具铺开了,病人结局的证据却缺位。2025年那两个数字——65%的医院在用,三分之二只测了准确性——直接把信息缺口摆上台面。对从业者来说,这比又一个刷榜的模型更值得盯,因为部署后的临床决策影响才是真金白银的考验。

Hacker News 首页

一个交互式网页,用可视化的方式拆解大语言模型是怎么造出来的

作者把 Andrej Karpathy 的技术讲座做成了一个可以点着看的网页教程,从爬互联网数据开始,一路讲到模型怎么生成文字。里面给了几个具体数字:训练用了 15 万亿个 token,模型参数 4050 亿,原始文本数据 44TB,词表大小 10 万个。网页把流程拆成了数据收集、分词、训练、推理和基础模型行为这几步,每一步都有动画或可交互的演示,比如...

推荐理由:我会先打个折:这不是新研究,是把 Karpathy 的公开课做成交互教材。但做得扎实——从 Common Crawl 抓数据、BPE 分词、Transformer 训练到温度采样,全流程可视化,还给了 15T tokens、405B 参数这些量级数字,让人对 LLM 的规模有体感。对想补基础的人很友好,正文没披露什么新 benchmark 或成本数据,所以别当行业信号看,就当一份高质量的学习材料。

Computing Life · Share · 鸭哥调研

Skill 是天生带自杀基因的产品

作者认为 Anthropic 的 Skill 形态没法独立做成付费产品。直接卖文件会被零成本传播,PromptBase 跑了三年估算年收入才五百万美元;做成托管服务本质是卖服务器,不是卖 skill;做成 API 引流工具又只是免费营销物料。更深层的问题是,skill 把使用知识从隐性变显性,消灭了培训、咨询等原有价值链的盈利空间,自己却因为明文复制成...

推荐理由:我会先打个折:这不是 Anthropic 的新发布,是一篇评论,所以重要性停在 featured 档。但它的判断很锋利——作者不跟你绕弯子,上来就说 Skill 天生带“自杀基因”,然后一条条拆直售、托管、API 引流为什么都是死路。数字也留得有用,比如 Snyk 审计发现 13.4% 的 skill 有严重安全问题,这比空谈风险更有说服力。真正让我觉得值得推荐的是它把视线从 artifact 这种静态产出挪开,提醒你盯紧收费点正在往关系、此刻、物理责任和判断上转移。正文没给出 Skill 官方定价或分成政策,但靠公开数据和逻辑推演,已经把悲观结论...

阮一峰的网络日志

第二次 API 开放浪潮

阮一峰在周刊里聊了一个正在发生的趋势:大模型能干活了,逼着各种平台重新开放 API。15 年前那波 API 开放没跑通,因为平台发现数据给别人用了,自己插不上广告,最后都缩回围墙花园里。但 2025 年下半年大模型达到生产可用水平后,逻辑变了——AI 要自动化执行任务,就必须能调用外部平台,没 API 就进不了 AI 工作流,用户会直接转向有接口的竞品...

推荐理由:阮一峰这篇周刊判断,2025 年下半年大模型开始真正进业务干活,会触发第二次 API 开放浪潮。核心逻辑是 Agent 不能光说不练,得调用外部服务才能完成动作,所以微信这类消费级平台的接口开放比云服务 API 更值得盯。文章给了腾讯开放微信接口、MCP 和 Skill 成为常见接入机制这些具体信号,不是空谈趋势。不过正文没给出这次“浪潮”的量化数据或开发者采用率,更像一个基于现象的预判,所以重要性我打个折,放在 76 分。

彭博科技

旧金山一家店让 AI 当 CEO,结果蜡烛订太多了

旧金山 Cow Hollow 的 Andon Market 把选品和定价交给一个叫 Luna 的 AI agent 来管,标题直接说它蜡烛订多了。正文没披露具体多订了多少、是哪个环节出错、亏了多少钱、后来怎么补救。能确认的是,这家店真的把零售运营的决策闭环交给了 agent,而不只是拿 AI 做辅助分析。

推荐理由:Bloomberg 报道了旧金山一家便利店让 AI 代理 Luna 管选品和定价,标题说它蜡烛订多了。我会先打个折,因为正文没给具体数字——超采量、触发逻辑、亏了多少钱、怎么补救,这些全没写。但真正值得盯的不是店里卖什么,而是闭环经营权限已经交出去了,代理能直接下单,这比实验室跑分更说明风险。信息缺口让这件事停在 featured 低段,但话题性够强。

4月23日星期四

The Verge · AI

AI 订阅要开始挤利润了,重度用户先挨刀

Anthropic 这个月大幅收紧了第三方工具 OpenClaw 调用 Claude 的权限,把那些把 AI 当“自动化流水线工人”用的重度用户往更贵的付费套餐里赶。公司给出的理由是系统压力太大、盈利压力也大,工程师 Boris Cherny 直说现有的订阅套餐根本不适合这种用法。不过正文没披露具体涨了多少、新限额是多少、以及这次调整波及多大范围。简单...

推荐理由:Anthropic 把 Claude 的代理用量变成定价和准入问题,直接影响工具开发者和重度用户。HKR 三项都踩中了,但正文没披露具体价格、配额和生效范围,所以分数只能给到 featured 的低段。我会先打个折,这点先别太激动——通用订阅被代理式高消耗用法挤出单独计费层,才是真正值得盯的趋势。

新智元 · 公众号

Anthropic 在私募二级市场报价冲到 1.05 万亿到 1.15 万亿美元,首次超过 OpenAI 的约 8800 亿美元

这个数字来自私募二级平台(比如 Forge Global)上的报价,不是新一轮融资估值。三个月前 Anthropic 的融资估值还是 3800 亿美元,现在二级市场直接翻了三倍左右。市场给出的理由是流通股少、Claude Code 和收入增长势头猛。但正文没披露实际成交量、具体收入数字,也没公司官方确认,所以这个万亿身价更像少数交易撑起来的价格,先别太当真。

推荐理由:我会先打个折:这不是官方融资估值,而是私募二级平台的报价,成交量、收入规模和公司确认都没披露,所以别太激动。但信息本身有嚼头——它把 Anthropic 从三个月前 3800 亿的融资估值直接拉到万亿级别,背后是流通股少、Claude 产品势头和投资者情绪在起作用。对从业者来说,这更像一个市场温度计,而不是一张成绩单。

彭博科技

BCG 说 2025 年有四分之一的收入来自 AI 相关业务

波士顿咨询公司(BCG)透露,2025 年公司总收入的 25% 是靠帮客户做 AI 落地赚来的。这个比例说明咨询行业本身的收入结构已经被 AI 需求推着走了,不是某个模型发布,而是实打实的服务收入。不过正文没披露具体赚了多少钱、服务了多少客户,也没说这 25% 里哪些是纯策略咨询、哪些是技术实施。BCG 还提到正在招更多工程师和专家来帮客户把 AI 嵌...

推荐理由:Bloomberg 给了一个硬数字:BCG 自称 AI 工作带来 2025 年 25% 的营收。这比泛泛的趋势报告强,所以 H/K/R 都过了。但缺总营收、客户数和具体服务线细节,分数就卡在 featured 门槛附近。我会先打个折:25% 这个比例挺高,可没披露基数,不知道绝对值有多大,这点先别太激动。

彭博科技

SpaceX 想用 600 亿美元买下 AI 编程工具 Cursor,a16z 和 Thrive 可能大赚一笔

彭博这篇报道的正文被付费墙挡住了,只拿到了标题和摘要片段。已知信息是:SpaceX 正在考虑收购 AI 编程助手 Cursor,报价高达 600 亿美元。如果交易成了,a16z 手里大概 10% 的股份能值 60 亿美元左右。Thrive Capital 的持股比例正文没披露,具体赚多少也算不出来。另外,这笔交易到底签没签、走到哪一步了,文章里也没说清...

推荐理由:这条消息不是纯财经边角料,它把 AI 开发工具推到了一个很怪的收购场景里。SpaceX 600 亿买 Cursor 的传闻本身够新、够具体,也够让人想讨论。我会先打个折:文章没写交易有没有落定,也没说 Cursor 产品路线和商业化会不会因此转向,所以停在 featured,不上 p1。

Hacker News 首页

有创业公司开始炫耀 AI 账单比员工工资还高,把 token 花费当成增长指标

Swan AI 的 CEO 发帖说,他们 4 个人的团队一个月给 Claude 花了 11.3 万美元,他把这笔钱看作本该用来招人的预算,目标是不到 10 个人做到 1000 万美元年收入。Fundable AI 的联合创始人也在底下附和,说 AI 能顶一个 15 人的文档处理团队。文章点出一个风向:token 花费正在被当成一种新的虚荣指标,但花得多...

推荐理由:我会先打个折:这篇不是硬核技术进展,而是一篇评论性质的趋势观察。H 分给得高,是因为它把“AI 账单超过人力成本”这个反转直接摆到台面上,容易引发讨论。K 分靠的是 Swan AI 那个 11.3 万美元/月的 Claude 账单,数字够具体,能让人直观感受小团队在模型调用上的投入有多猛。R 分确实有,它踩中了“用 token 消耗替代人头”的焦虑,但正文自己也承认这更像一种增长指标而非已验证的 ROI,Fundable AI 说能替代 15 人团队的说法也没给出验证细节,所以不能当市场级事件来推。整体判断:值得从业者看一眼,但别急着把它当成行业拐点。

4月22日星期三

Hacker News 首页

Show HN 提交量翻了三倍,现在大部分是 AI 一键生成的页面

Adrian Krebs 用脚本扫了 500 个 Show HN 落地页,发现 67% 的页面至少命中 2 个 AI 设计特征,比如 Inter 字体、紫色渐变、卡片彩色左边框、图标功能网格这些模板化痕迹。检测方法是用 Playwright 跑无头浏览器,在页面里直接检查 DOM 和计算样式,靠 15 条硬规则判断,人工抽查下来误判率大概 5% 到 1...

推荐理由:这条值得推给做 AI 工具和产品的人看。Adrian Krebs 没在评模型能力,而是用一套土办法——Playwright 跑脚本检查 DOM 和样式——发现 Show HN 现在 67% 的页面都命中至少两个 AI 设计特征。我会先打个折:这是单人实验,不是严格审计,误报他自己也认了 5% 到 10%。但信号比数字本身重要:AI 默认生成的前端模板正在让产品页面快速趋同,这对靠差异化吃饭的早期项目不是好事。正文没披露具体是哪 15 个特征,也没给误报的详细拆解,所以别当行业报告用,当个警钟看刚好。

FT · 科技

TikTok 想在巴西海岸砸 95 亿美元建数据中心,当地人不干了

FT 这篇报道正文被付费墙挡住了,只能看到标题和摘要。已知信息是:TikTok 计划在巴西海岸建一个 95 亿美元的数据中心,但项目因为环境问题遇到了阻力。标题把这事跟中国 AI 的全球扩张挂上了钩。至于这个数据中心具体要用多少电、电从哪来、审批走到哪一步、反对者是谁,正文没披露,这些才是判断项目能不能落地的关键。

推荐理由:FT 把'全球 AI 推进'这个大词落到了一个具体的 95 亿美元巴西数据中心项目上,还带出了环境阻力。我会先打个折:正文只是 RSS 摘要,缺装机量、电力结构和审批状态,所以别急着下结论。真正值得盯的是,AI 扩张现在开始撞上电、地和许可这三堵墙,这点比地缘叙事更实在。

4月21日星期二

Hacker News 首页

膨胀伪影:大模型输出的瑕疵不是压缩痕迹,而是解压时脑补过头的证据

Matt Ström-Awn 把大模型生成内容里的毛病叫做“膨胀伪影”,而不是压缩伪影。他的逻辑是:模型从模糊的训练数据里往外“解压”时,会在信心不足的地方用训练分布里的高频模式硬填,于是就有了那些套话、过度注释的代码、六指手和穿模视频。这些痕迹能当法医线索用——斯坦福的研究人员靠追踪 ChatGPT 发布后词频飙升的词(比如 commendable、...

推荐理由:我会先打个折,这是个人博客评论,不是一手研究或产品发布,所以分数停在 73。但它的钩子很巧,把 LLM 的毛病重新包装成“扩展伪影”,一下就把审美收敛和生成路径暴露的问题串起来了。文章给的数字也实在,17.5% 的论文和 16.9% 的审稿有 AI 起草痕迹,说明这已经不是小范围现象。JPG 压缩 10000 次后 PSNR 掉到 14.59 的类比虽然不算严谨实验,但直观地让人感受到反复生成带来的退化。真正值得盯的是取证价值:这些伪影不光是风格问题,还可能成为追踪生成路径的线索,这对审稿信任和内容溯源都挺要命的。

TechCrunch · AI

NSA 被曝在用 Anthropic 的 Mythos 模型,五角大楼还在跟这家公司打官司

Axios 的消息说,美国国家安全局(NSA)正在用 Anthropic 新出的 Mythos Preview 模型。这个模型本月初才公布,专做网络安全任务,但因为攻击性太强,Anthropic 没敢公开发布,只给了大约 40 家机构用,公开点名的只有十几家,NSA 不在公开名单里。据说 NSA 主要拿它扫描系统环境、找可被利用的漏洞。吊诡的是,NSA...

推荐理由:标题把 NSA、Anthropic 的受限模型 Mythos 和 Pentagon 分歧绑在一起,冲突钩子很足。新信息就两点:NSA 在用、模型是受限版,但正文没披露怎么接入、跑在什么环境、花了多少钱、Pentagon 那边到底在吵什么。我会先打个折,因为证据链现在很薄,全靠一篇报道撑着。不过国防情报场景用前沿模型这件事本身,对采购、合规和供应商关系都有直接冲击,从业者会关心后续怎么落地。分数定在 75,等有合同细节或部署范围再往上调。

4月20日星期一

Hacker News 首页

Deezer 每天上传的新歌里,44% 是 AI 生成的

Deezer 自己公布的数据:现在每天有将近 7.5 万首 AI 生成的歌上传到平台,占每日新增上传量的 44%,一个月下来超过 200 万首。不过这些歌基本没人听——AI 歌曲的播放量只占总播放量的 1% 到 3%,而且其中 85% 的播放被平台判定为刷量欺诈,直接不给钱。这个比例涨得很快:去年 9 月每天还只有 3 万首,11 月到 5 万首,今年...

推荐理由:标题里的44%占比是个抓人的钩子,能让人立刻意识到AI音乐已经不是边角料了。但我会先打个折:正文只有RSS片段,检测手段、统计口径全都没说,这个数字的硬度存疑。真正值得盯的是平台后续怎么识别和处置这些AI作品,现在信息还不够做更细的判断。HKR三项都踩中了,所以保留76分和featured级别。