跳到正文

#产品更新

今日 25 条

4月21日星期二

彭博科技

Google 要发新的 AI 推理芯片,直接跟英伟达抢生意

Bloomberg 这条视频提到 Google 准备推出一批专做推理的新 AI 芯片,正面挑战英伟达。不过正文被付费墙挡了,没披露具体发布时间、型号、性能参数、定价和客户。我会先打个折:目前能确认的信号是推理芯片的供给竞争在升温,但产品到底多能打、什么时候落地,都还是未知数。

推荐理由:HKR-H 和 HKR-R 通过,因为这条消息把 Google 和 Nvidia 在推理芯片上的直接竞争摆上了台面。HKR-K 弱:报道只确认了推理这个方向,芯片叫什么、跑分多少、卖多少钱、什么时候出、谁会买,这些关键信息正文都没披露,所以信息缺口很大。

X · @dotey(宝玉)

OpenAI 给 Codex 加了 Chronicle,让它能“看”屏幕记住你在做什么

OpenAI 在 macOS 版 ChatGPT Pro 里灰度测试 Chronicle,这是 Codex 的 Memories 扩展。它会后台定时截屏、做 OCR、识别你用的工具,把近期屏幕活动整理成记忆,存为本地 Markdown 文件。你跟它说“这个报错”,它不用你解释就知道指什么。但要注意几点:后台 Agent 一直跑会很快吃掉 rate li...

推荐理由:OpenAI 让 Codex 能定时截屏、OCR 识别屏幕内容,然后写成记忆存到本地。这个功能目前只给 macOS 上的 ChatGPT Pro 用户灰度开放,欧盟、英国、瑞士用不了。我会先打个折:截图上传服务器处理后声称会删除、不用于训练,但官方自己也警告会放大网页 prompt 注入,而且记忆以明文 Markdown 放在 ~/.codex 目录下,泄露面不小。后台总结还会消耗 rate limit,这点先别太激动。整体信息量够、有可测试的细节,但受限于小范围灰度,所以放在 featured 而不是 p1。

彭博科技

Google 本周要发新一代 TPU,专做推理

Bloomberg 的视频预告说 Google 这周会公布新的定制芯片,定位是 AI 推理任务。正文被付费墙挡了,没拿到具体型号、性能、功耗和价格。我会先打个折:重点不是又发芯片了,而是这批 TPU 能不能把推理成本打下来、供货稳不稳。

推荐理由:标题说新芯片,但正文其实只给了两个信息:本周发布、面向推理。我会先打个折——型号、性能、功耗、价格一概没披露,现在激动还太早。之所以还放在 featured 里,是因为 Google 把新 TPU 直接框在推理上,这对算力成本和供给是个实打实的信号,AI 团队会追。但信息缺口太大,重要性停在 74 是合理的。

The Verge · AI

Epic 给《堡垒之夜》创作者发了 AI 角色工具,但明令禁止和 NPC 谈恋爱

Epic 在《堡垒之夜》里上线了一个叫“对话”的工具,让创作者可以把自己岛上的 NPC 变成能自由聊天的 AI 角色。创作者用提示词设定角色的人设、知识范围、行为和声音,玩家就能跟 NPC 进行不按剧本走的对话。标题特意警告“别想和 AI 约会”,但正文没具体说防越狱和内容审核机制到底怎么做的。去年 Epic 在游戏里试水过 AI 版达斯·维达,结果角...

推荐理由:Epic 给 Fortnite 创作者发了个新工具,能让岛上的 NPC 跟玩家自由聊天,用提示词定人设、知识和行为,还能选语音。标题特意警告别拿来搞约会对象,但正文没写具体怎么审核、什么话不能说,也没提成本和用的哪家模型。我会先打个折:可控性才是重点,不是“会聊天”本身。

Latent Space

用 Transformer 解决癌症临床试验 95% 的失败率——Noetik 的 Ron Alfa 和 Daniel Bear

95% 的癌症疗法通不过临床试验,Noetik 认为这主要是个配对问题:没搞清楚哪个病人、哪种肿瘤、该用哪种已有的药。他们训练了一个叫 TARIO-2 的自回归 Transformer,能从每个病人都会做的常规 H&E 染色切片里,直接预测出约 19,000 个基因的空间表达图谱。这种空间转录组数据原本是读肿瘤最丰富的方式,但标准治疗里几乎没有病人会做...

推荐理由:我会先打个折:正文没披露 TARIO-2 在独立验证集上的具体性能指标,也没说 5000 万协议是里程碑付款还是一次性,这点先别太激动。但这条消息的钩子很准——它没吹“AI 治愈癌症”,而是把 95% 的失败率解释成患者、肿瘤和疗法没对上号,然后用 transformer 从常规病理切片里预测近两万个基因的空间分布,相当于给肿瘤微环境画了一张高维地图。GSK 愿意掏钱,说明至少内部验证过了门槛。对从业者来说,值得盯的是这种“从便宜影像出昂贵组学数据”的省钱逻辑能不能复制到其他癌种,以及模型泛化到不同医院染色标准时会不会崩。

4月20日星期一

机器之心 · 公众号

智元机器人把2026年叫“部署态”元年,一口气甩出7套落地方案

智元在4月17号上海的活动上发了4款机器人、6个AI模型和7套标准化部署方案,把2026年定义为具身智能的“部署态”元年。远征A3续航标称8到10小时,WITA Omni 1.0的交互延迟目标是500毫秒以内,BFM模型用了一亿多帧图像和700小时动捕数据训练。他们还提到2025年出货超5100台、市占率39%,第1万台在今年3月下线。对从业者来说,重...

推荐理由:HKR三项都成立:文章开头就拿七套标准化方案说事,后面用出货量、市占率、延迟和训练数据做支撑。分数停在76,因为关键效果数据全是公司自己说的,客户侧的实际表现和独立验证正文没披露,我会先打个折。

彭博科技

爱奇艺启动 16 年来最大改组,要把 AI 生成内容塞进片单

爱奇艺开始了一场公司成立 16 年来最大规模的重组,目标是让 AI 在未来直接生成相当比例的影视内容。目前这篇报道的正文被付费墙挡住了,看不到具体用了什么模型、打算花多少钱、AI 内容占比多少、什么时候上线。能确认的信号是这次改组的动作很大,不是喊口号,但实际落地效果还得等更多细节。

推荐理由:Bloomberg的信源权威性把这条推过了featured线:一个主流视频平台把16年最大重组押在AI生成内容上,H和R都站得住。K偏弱是因为正文没披露模型、投入金额、内容占比和上线节点,所以分数停在74。真正值得盯的是组织调整的力度,不是“AI做内容”这句口号。

4月19日星期日

机器之心 · 公众号

高德在亦庄半马放出一只四足机器人“图图”,在开放路段不靠预设路线和遥控,跑完导盲避障任务

高德在2026年亦庄人形机器人半马上展示了一只叫“图图”的四足机器人,完成了一段开放环境下的导盲避障演示。官方说全程没有预设路线,也没有人遥控。背后的技术栈叫ABot,分两块:ABot-N0负责导航,在7个导航基准上拿了SOTA,其中SocNav得分88.3%,说明在社交场景里避让行人的能力不错;ABot-M0管操作,在Libero-Plus上拿了80...

推荐理由:HKR 三项都站得住:半马导盲这个设定本身就新鲜,技术栈和关键成功率数字也给了,而且场景选得够狠,天然带话题。分数维持在 80 不往上加,是因为正文没提导盲实测到底覆盖了哪些路况、有没有出过安全事故、什么时候能商用——这些缺口让判断得先打个折。

量子位 · 公众号

高德发布全栈具身智能体系 ABot,号称在 15 项指标上拿了最优

高德这次公开的 ABot 是一套想让机器人真正干活的全栈技术体系,分视觉感知、物理世界模型和视觉语言动作模型几块。ABot-3DGS 能用厘米级地图数据重建上万平米的三维场景,ABot-PhysWorld 则是一个 140 亿参数的扩散模型,用 300 万条真实机械臂操作视频训练,让机器人先在大脑里模拟动作再执行。文章说横扫 15 项 SOTA,但具体...

推荐理由:高德这次公开的 ABot 体系,我会先打个折——15 项 SOTA 具体是哪些基准、跟谁比,正文没列,挑战赛名称也没给,这点先别太激动。但能聊的东西确实有:ABot-3DGS 拿厘米级地图和轨迹数据生成了上万组 3D 场景,号称覆盖率 99%,如果属实,等于用地图老本行给具身训练铺了一条低成本数据管道;ABot-PhysWorld 用 14B 的 DiT 加 300 万条真实操作视频做物理判别训练,规模不小。真正该盯的是他们把世界模型和 VLA 闭环绑在一起做的思路,不是单点炫技。开源范围和时间表都没披露,落地成色还得等。

新智元 · 公众号

高德发布 ABot-Claw 和四足机器人 Tutu,在亦庄半马搞了次导盲演示

高德在 2026 亦庄机器人半马上展示了 ABot-Claw 智能体系统和四足机器人 Tutu,主打自主导盲。ABot-M0 在 Libero-Plus 上拿了 80.5%,比 Pi0 高出近 30 个百分点,说明在复杂操作任务上进步明显;ABot-N0 在 7 个导航基准上刷到了 SOTA。他们开源了一个叫 UniACT 的数据集,包含 600 万条...

推荐理由:我会先打个折:半马名次、商业化时间和价格正文都没提,所以别当量产信号看。真正值得盯的是 Map as Memory、云边协同和闭环纠错这套工程思路——它试图把导航、操作和记忆揉成一个能在线纠错的系统,而不是单点 demo。Libero-Plus 80.5% 的成功率比 Pi0 提升近 30 个百分点,说明操作端确实有进步;7 项导航 SOTA 和 600 万条开源轨迹则给复现留了口子。但所有这些数字都来自他们自己的评测,没有第三方验证,这点先别太激动。整体看,这是一次把具身智能拉到开放环境里遛一遛的尝试,工程整合的价值比单项指标更大。

4月18日星期六

机器之心 · 公众号

Anthropic 给 Claude 加了个设计功能,能直接出线框图、原型和幻灯片

Anthropic 在 Claude Pro、Max、Team 和 Enterprise 账号里上线了 Claude Design 的研究预览版,背后跑的是 Claude Opus 4.7。它能吃代码库、图片、DOCX、PPTX、XLSX 和网页截图,吐出来的东西可以导出到 Canva、PDF、PPTX 和 HTML。标题说 Figma 和 Adobe...

推荐理由:我会先打个折:标题说 Figma、Adobe 股价重挫,但正文没给出具体跌幅,这点先别太激动。真正值得看的是 Anthropic 把设计稿生成、设计系统读取、多人协作编辑和向 Claude Code 交接串成了一条线,这比单出一个画图工具要狠。不过目前还是研究预览版,没有用户测试数据、定价和实际落地案例,能不能真革了设计行业的命还得看后续。

新智元 · 公众号

Claude Opus 4.7 上线两天口碑翻车:跑分登顶,推理测试却暴跌

Anthropic 新模型 Claude Opus 4.7 上线不到 48 小时就吵翻了。在 Artificial Analysis 综合评分上它拿了 57 分并列第一,但换到 NYT Connections Extended 这个推理测试,准确率直接从上一代 4.6 的 94.7% 掉到 41.0%。另外,新模型换了一套分词器,同一段文本消耗的 to...

推荐理由:这条信息的价值不在“口碑崩了”的标题,而在于它把四个具体变化摆了出来:基准跑分领先、推理任务大幅退步、token 消耗变高、API 参数不兼容。对从业者来说,这比单纯报一个模型发布更有参考意义,因为它提示了升级可能带来的隐性成本。不过文章本身是发布 48 小时后的二次分析,不是 Anthropic 官方首发,所以重要性给到 83、放在 featured 层级是合理的。

新智元 · 公众号

B站吵翻了:Hermes 首次直播回应抄袭指控,MiniMax 提前卡位 Harness 赛点

MiniMax 说他们的 M2.7 模型现在能接手强化学习团队 30% 到 50% 的日常工作,自己跑通了超过 100 轮自我优化,评测指标提升了 30%。Hermes Agent 的日调用量从 20 亿涨到了近 3000 亿 token,M2.7 在 OpenRouter 上的日调用也超过了 250 亿 token。Hermes 负责人 Tommy ...

推荐理由:这篇不是一手发布或官方技术报告,而是把几条动态串起来的二手解读,所以重要性停在 83 分。我会先打个折:Hermes 直播否认抄袭本身不算大新闻,但配上 MiniMax 提前杀入 Harness 赛点、给出具体工作流占比和沙箱性能数据,就让整篇有了可读性。正文没披露 M2.7 具体在哪些任务上替代了人工、也没说 30% 提升的基线是什么,这点先别太激动。不过沙箱启动 20-40ms 和每分钟 60 万实例的并发能力如果是真的挺省钱,说明执行层的基础设施正在变成新战场。整体适合放进 featured,给做 Agent 的人一个信号:别光盯着模型跑分,...

Hacker News 首页

rtrvr.ai 把浏览器操作录成脚本,重放零 token 成本,还能让 AI 直接调用

rtrvr.ai 做了一个叫 AI Subroutines 的功能,核心思路是把你在浏览器里的一次操作录下来,变成一个可重复调用的工具脚本。重放时脚本直接在当前网页里跑,cookie、CSRF token、签名头这些认证信息全都不用手动处理,浏览器自己就带上了。录制时会从几百个网络请求里自动筛出真正有用的那几条,遇到 GraphQL 那种一更新就失效的...

推荐理由:rtrvr.ai 这个 Show HN 放出了一个叫 AI Subroutines 的功能,核心是把录过一次的浏览器操作存成可重复调用的工具,直接在当前标签页里执行,复用登录态和请求签名,省掉了反复调大模型的成本和延迟。我会先打个折——这是单家公司的产品更新,不是行业级事件,所以放在 featured 中段。但它的技术细节够实在:录制时把约 300 个请求压缩到约 5 个,GraphQL operation ID 不稳定就退回纯 DOM 操作,还支持一次调用批量分发 500 行参数。这些数字说明它在成本和延迟上确实有想法,不是空画饼。正文没披露多标...

X · @dotey(宝玉)

Anthropic 发布 Claude Design,用对话代替拖拽生成设计稿

Anthropic 推出了 Claude Design,一个靠聊天就能出设计稿的工具,背后跑的是新模型 Claude Opus 4.7。你描述需求,它直接生成图片,然后通过对话、批注、直接编辑或拖拽滑块反复改。团队第一次用的时候,它会读你的代码库和设计文件,自动生成一套设计系统(品牌色、字体、组件),后续项目自动套用。支持从文字、图片、文档或网页截取起...

推荐理由:Anthropic 把 Claude 塞进了设计环节,HKR 三项都站得住。文章给了开放节奏、底层模型和导出目标,信息量够上 featured。不过目前还是研究预览,不是模型级大更新,我会先打个折,重要性给 84。

4月17日星期五

X · @op7418(歸藏)

Claude 出了个设计工具,能直接生成网页、App 原型和 PPT

Claude 上线了一个设计工具,功能跟 lovable 类似,可以帮你生成网页、App 原型和 PPT。它支持导出 PPT 格式,也能把内容导出到 Canvas 继续编辑。正文没提产品叫什么、怎么收费、哪些套餐能用、有没有地区限制。从描述看,Claude 这次不只是聊天出文字,而是直接产出可交付的设计文件了。

推荐理由:这条消息本身信息量不大,就一个 RSS 摘要,但 Claude 上线设计工具这件事方向很明确——从对话界面走到能吐网页、APP 原型和 PPT,还打通了导出链路。我会先打个折,因为产品名、价格、套餐和地区限制全都没说,来源也只有一条 X 帖子和摘要,权威性偏弱。不过对从业者来说,这比模型跑分更值得盯,因为它直接关系到能不能把 AI 塞进设计交付流程里。

Hacker News 首页

Anthropic 实验室推出 Claude Design,用对话就能生成设计稿

Anthropic 在 4 月 17 日上线了 Claude Design,目前是研究预览版,Pro、Max、Team 和 Enterprise 用户都能用。它基于 Claude Opus 4.7,你给它文字描述、图片、文档(DOCX、PPTX、XLSX)甚至代码库,它就能生成设计稿、原型、幻灯片或单页宣传页。比较特别的是,它能直接读取你团队的代码和设...

推荐理由:这是 Anthropic 一次有分量的产品发布,不是小功能补丁。HKR 三项都站得住:形态新、部署细节够、工作流共鸣强。但研究预览的身份和没单列的价格让我把分控在 84,没给更高。真正值得盯的是它和 Claude Code 的交接链路,如果跑通,设计到代码的流转会变短。

X · @claudeai

Anthropic 实验室推出 Claude Design,用对话就能生成原型、幻灯片和单页文档

Claude Design 是 Anthropic 实验室放出的研究预览功能,Pro、Max、Team 和 Enterprise 用户今天开始陆续能用。它跑在 Claude Opus 4.7 上,官方说这是他们目前最强的视觉模型。用法很简单:你跟 Claude 聊需求,它直接出原型、幻灯片或单页文档。正文没提价格、输出限制和详细推送时间表。我会先打个折...

推荐理由:Anthropic 自己下场做设计生成,Claude 从纯文本助手变成能出视觉稿的工具,这个转向本身就值得关注。我会先打个折:帖子说 Opus 4.7 是“最强视觉模型”,但没给对比数据,也没说生成的文件能不能直接导出编辑。如果是真的,对快速出原型和汇报材料挺省钱,但别急着当生产工具用——格式限制和付费墙都没讲清楚。

新智元 · 公众号

智元机器人说已进入“部署态”,在工厂产线连续干了8小时没停

智元在4月17日的APC 2026上把2026年定义为“部署态元年”,核心案例是龙旗南昌工厂的Genie G2机器人:完成2283次上料任务,成功率超99.5%,单次节拍18到20秒,连续运行8小时。这些数字是公司自己公布的,正文没提有没有第三方审计。更值得看的信号是规模:智元称2025年出货超5100台,到2026年3月累计出货1万台,龙旗那边计划部...

推荐理由:HKR三条都踩中了。'Demo秀终结'这个角度有传播力,文章给出了工厂实测数据——8小时连续运行、2283次上下料、成功率超99.5%、单工序18-20秒,不是实验室摆拍。没给P1是因为这些数据全来自企业自报,正文没披露第三方审计或跨厂复现结果,我会先打个折。真正值得盯的是量产条件:2025年出货超5100台、2026年3月累计下线1万台,龙旗计划近千台部署,这些数字如果兑现,比单次Demo有分量得多。

X · @dotey(宝玉)

Seedance 2.0 API 开放,视频生成能直接串进工作流了

火山引擎把 Seedance 2.0 的 API 放出来了,国内走方舟平台,海外走 BytePlus。国内定价 46 元/百万 token,纯视频生成大概 1 元/秒,海外价格正文没写。这个 API 支持文字、图片、音频、视频四种输入,还内置了人脸验证、肖像授权和一万多个预置虚拟人像,可以用代码或 Agent Skills 把整条视频制作流程自动化。官...

推荐理由:这是一次 API 开放和定价更新,不是新模型发布。海外同步上线是个实在的钩子,价格信息也够具体,但正文没披露模型参数和统一评测基准,那个“效率提升近 10 倍”的个案先打个折看。整体对从业者有参考价值,所以给 74 分。

X · @op7418(歸藏)

Seedance 2.0 API 全量开放,支持文图音视频四种输入,还能做人脸登记和肖像授权

火山引擎把 Seedance 2.0 的 API 全量放出来了,国内走火山引擎,海外走 BytePlus。这个接口一次能接收文字、图片、音频、视频四种输入,也开放了人脸登记和肖像授权功能,可以直接用自己的脸生成视频,平台还预置了一批虚拟人像特征。正文没提价格、调用频率限制、模型版本和地区可用性,这些得自己去查。作者最期待的是把视频生成接进 Skills...

推荐理由:这是一次实打实的产品更新,不是概念发布。H 打满是因为全量开放意味着从 demo 到可集成的跨越;K 打满是因为四种模态输入和肖像授权机制都写清楚了,不是模糊的“多模态”;R 打满是因为视频生成类 API 的落地需求一直很旺,合规控制又是企业接入的硬门槛。分数定在 75,因为价格、速率限制、地区铺开节奏和实际生成质量正文都没给,这些缺口让实用性先打个折,别急着吹。

Latent Space

Anthropic 发布 Claude Opus 4.7:每个推理档位都压过 4.6 一头,还新增了 xhigh 模式

Anthropic 推出了新旗舰模型 Claude Opus 4.7,价格没变,还是每百万输入/输出 token 收 5 美元和 25 美元。最直观的变化是性能档位全面上移:4.7 的低档(low)比 4.6 中档强,中档比 4.6 高档强,高档则超过了 4.6 的 max 档。此外还新增了一个叫 xhigh 的推理强度,Claude Code 现在默...

推荐理由:Anthropic 旗舰模型更新,给了一堆可验证的数字和变化点,不是空对空吹牛。HKR 三项全过:钩子清楚、信息量足、对 Claude 用户群高度相关。重要性给 90 没毛病,属于那种“先别激动但值得马上看”的更新。

r/LocalLLaMA

Qwen3.6 新增 preserve_thinking 开关,修了上一代多轮对话“失忆”的 bug

Qwen3.6 模型页面上多了一个 preserve_thinking 参数,默认要打开。它的作用是把模型上一轮的思考过程原样保留在上下文里,而不是像 Qwen3.5 那样每次重新序列化,导致 KV 缓存失效、模型记不住自己刚想过什么。作者给了一个很直观的测试:先让模型想两个 20 位数字,只说出第一个;下一轮再问第二个。开关关掉时模型会说自己没生成过...

推荐理由:这条 Reddit PSA 的价值在于挖出了一个藏在模型页里的开关。我会先打个折,因为这不是官方发布说明,而是社区踩坑分享,但信息密度够高:有复现步骤、有根因分析、还顺手标了 LM Studio 和 oMLX 的支持状态。对正在用 Qwen3.6 搭 agent 的人来说,知道 preserve_thinking 能让推理上下文跨轮保留,比看十篇通稿都实在。

X · @OpenAI

OpenAI 发布 GPT-Rosalind,一个专攻生物、制药和转化医学的推理模型

OpenAI 在 X 上丢了个新模型 GPT-Rosalind,定位是给生物学、药物发现和转化医学研究用的前沿推理模型。帖子只说了应用方向,没提模型规模、跑分、能不能用、多少钱、什么时候上线。我会先打个折——目前只有一句话官宣,具体能力、训练数据和验证结果都没披露,别急着当生产力工具。

推荐理由:我会先打个折:这就是个命名预告,没有模型卡、没有跑分、没有开放方式,所以别急着当产品发布看。但 OpenAI 把新模型直接挂上 Rosalind 这个名字、明说用在生物学和药物发现上,说明他们想把推理能力往严肃科研场景推,而不是又出一个通用聊天模型。对做 AI+科学的人,这个方向比参数更重要;对想复现或评估的人,现在信息缺口太大,只能等后续披露。

TechCrunch · AI

OpenAI 给 Codex 加了更多桌面控制权,直接对标 Anthropic

OpenAI 在 2026 年 4 月 16 日升级了它的编程工具 Codex,让这个工具能更深入地操控你的电脑桌面,比如操作文件或应用。文章把这看作是对 Anthropic 的直接反击,因为 Anthropic 的 Claude Code 目前在商业用户里更受欢迎。不过,这篇报道正文被截断了,没有披露具体新增了哪些功能、怎么收费、什么时候推送,也没说...

推荐理由:TechCrunch 这篇报道的核心就一句话:OpenAI 给 Codex 加了更多桌面权限,直接对标 Anthropic 的 Claude Code。标题火药味足,但正文能确认的只有“权限更大”这一点,动作清单、价格、开放范围全都没披露。我会先打个折:这事值得关注,因为桌面控制权是编程助手进企业干活的关键门槛,谁先拿到信任谁就占优。但别太激动,正文没给出任何能判断实际能力或安全边界的细节,目前更像一次宣示性的产品更新。

X · @dotey(宝玉)

Claude Opus 4.7 思考 token 消耗更大,Anthropic 给付费用户永久提了速率上限

Opus 4.7 比上一代更费思考 token,Anthropic 直接给所有付费订阅用户永久上调了速率限制来对冲。正文没披露具体提了多少、定价规则有没有变、什么时候全面生效。如果你还没看到额度变化,先确认自己切到了 Opus 4.7,并且 Claude Code 已升到最新版。

推荐理由:这条更新对付费用户是实打实的操作变化,三个维度都踩中了:反差感强、事实明确、直接触动用户的钱包和工作流。正文没披露具体提了多少、怎么计费、什么时候生效,所以信息有缺口,但核心事实足够清楚,放在 featured 合适。

X · @dotey(宝玉)

Anthropic 发布 Claude Opus 4.7 在 Claude Code 里的使用指南,默认努力等级调到 xhigh

Anthropic 给了一套 Opus 4.7 搭配 Claude Code 的用法建议。核心变化是默认努力等级从 high 提到了 xhigh,官方说这个档位适合大部分写代码、设计 API、迁移和审查的活儿。模型现在会自己判断什么时候该多想、什么时候该快答,不用人手动调思考量。但这也带来一个行为变化:它默认不太爱频繁调工具和生成子智能体,如果你需要它...

推荐理由:这不是模型发布,是 Anthropic 官方给 Claude Code 配 Opus 4.7 的用法说明,但改的是日常使用习惯:默认 Effort 拉到 xhigh,模型会自适应思考,工具和 SubAgent 调用反而变少了,除非你在提示里明确要求。我会先打个折——范围比大产品发布窄,但对天天用 Claude Code 写代码、做审查和迁移的人来说,这几条能立刻省时间、省 token。HKR 三项都踩中了,所以给 featured。

X · @dotey(宝玉)

OpenAI 把 Codex 升级成能直接操作你电脑的桌面 Agent,先上 Mac

Codex 这次更新不再只是写代码,它现在能看屏幕、点鼠标、敲键盘,在 Mac 上并行跑多个 agent 还不抢你的窗口。对没开放 API 的软件,它直接像人一样手动操作。桌面 App 内置了浏览器,你可以在网页上圈点批注下指令,主要用来做前端开发和游戏调试。图像生成也接进来了,用的是新的 gpt-image-1.5 模型,做概念图、UI mock 和...

推荐理由:OpenAI 把 Codex 从代码补全工具升级成能操作电脑的 agent,并行跑任务、接 90 多个外部工具,还报了个 300 万周活开发者的数字。我会先打个折——正文没提安全边界和定价,欧盟、英国和记忆功能席位也还没开,所以实际落地范围有限。但光是‘能控制 Mac’这一步,就足够让做开发工具的人盯着看了。

X · @OpenAI

OpenAI 说 Codex 现在能操控 Mac 应用、接更多工具,还能自己跑重复性任务

OpenAI 发推说 Codex 现在能干的事更多了:能直接操作你 Mac 上的应用,对接更多工具,还能生成图片、从你之前的操作里学东西、记住你的工作习惯,以及接手那些需要反复做的任务。不过正文没披露具体支持哪些应用、怎么集成、定价和什么时候推,这些关键信息都还缺着,先别太激动。

推荐理由:OpenAI 这次把 Codex 从代码助手往桌面代理推了一步,能操作 Mac 应用、接更多工具、学你的操作习惯并记住偏好,听着像给电脑配了个能干活的小助手。但正文没披露支持哪些应用、怎么接入、收不收费、什么时候上线,这些关键信息全空着,所以先别太激动。我会打个折,因为记忆和跨工具执行能不能稳定跑起来才是真章,现在更像能力预告而不是可用的产品。

TechCrunch · AI

Google 的 AI Mode 现在能在桌面端 Chrome 里把网页和对话窗口并排打开

Google 在 4 月 16 日给桌面端 Chrome 的 AI Mode 加了一个并排浏览功能:你在 AI Mode 里点开一个链接,网页会在右侧打开,左侧的对话窗口不会消失。这样你一边看网页,一边可以接着问 AI 问题,AI 会结合当前页面内容和全网信息来回答。比如挑咖啡机时,你可以让 AI 直接告诉你某款好不好清洗。正文没提这个功能的具体推送范...

推荐理由:Google 把搜索对话和网页浏览塞进同一个工作流里,不再是“搜完就走”或“聊完再点”。正文给了上下文保留和页面+全网回答的机制,但覆盖范围、上线节奏和地区限制都没说,所以重要性先打个折,放在 featured 里观察。

4月16日星期四

X · @op7418(歸藏)

Claude Code 现在能用 Claude Opus 4.7 了,默认推理强度是 X-HIGH

Claude Code 接入了 Claude Opus 4.7,默认推理强度设为 X-HIGH。如果你觉得这个强度不够用,得自己手动切到 Max。正文没提价格、速率限制和具体上线时间。

推荐理由:这是一次有料的 Claude 产品更新,三个信号都踩中了:新模型进 Claude Code,还带了一个具体的操作细节——X-HIGH 默认、Max 要手动开。我没给更高分,因为价格、速率限制和正式发布时间正文都没提,这些缺口会让实际影响打个折。

Hacker News 首页

他们签了三年租约,把旧金山一家实体店完全交给 AI 去赚钱

Andon Labs 在旧金山 Cow Hollow 租下一间店面,签了三年租约,交给一个叫 Luna 的 AI 全权经营,目标就是盈利。Luna 没有实体,所以它自己招人:5 分钟内就在 LinkedIn、Indeed 和 Craigslist 上发了招聘帖,最后雇了两名全职店员,还通过 Yelp 找了油漆工和装修师傅。店里的选品、定价、营业时间、品...

推荐理由:HKR 三项都站得住:真租约、真门店,故事性强;招聘和工具细节有,但财务数据缺失,信息有缺口;AI 管人这个点直接戳到行业神经。不过这是公司自己发的帖子,盈利没公布,先别太激动,放 featured 比 P1 更合适。

X · @dotey(宝玉)

Anthropic 发布 Claude Opus 4.7,定价没变,但账单可能因为新分词器微涨

Claude Opus 4.7 上线了,API 名叫 claude-opus-4-7,输入每百万 token 5 美元、输出 25 美元,价格和 4.6 一样。这次主要升级了自主编程能力,能独立跑完更复杂的任务,还会自己验证结果再汇报。视觉方面,长边支持到 2576 像素,是之前的三倍多,截图不用再压缩了。不过有个背景:Anthropic 手里有个更强...

推荐理由:Anthropic 发新模型,不是改个名那种。2576 像素的视觉上限和 tokenizer 的 1.0–1.35 倍变化,直接影响到迁移测试和实际开销。标价没变但 token 消耗可能涨,这个信息对开发者比跑分重要。HKR 三项都踩实了,放 p1 没问题。

X · @op7418(歸藏)

Anthropic 发了 Claude Opus 4.7,加了自我验证和更细的视觉能力,价格没涨

Claude Opus 4.7 已经在所有产品和 API 上线,价格跟 Opus 4.6 一样。这次主要让模型能干更长时间的活,指令跟得更紧,汇报前会自己先检查一遍输出,减少人工盯着。视觉方面能看清长边最长 2,576 像素的图,比之前精细不少。Claude Code 里多了个 Ultra Review 命令专门做审查,思考等级加了 xhigh 档位,...

推荐理由:Anthropic 这次把 Opus 4.7 铺到了所有 Claude 产品和 API 上,价格没变,这点先别太激动,但确实降低了升级门槛。正文列出的更新比较实在:长任务处理更稳、指令执行更准、输出前会自己检查一遍,相当于模型多了个校对环节。视觉输入把长边限制提到了 2,576 像素,能塞进更清晰的图。配套的 Claude Code 加了 Ultra Review 命令和 xhigh 思考等级,Max 用户还能开自动审批,适合把模型放进业务流程里跑。整体看,这是一次偏可靠性和工作流适配的更新,没有吹新 benchmark,但信息量够,对从业者有参考价值。

X · @claudeai

Claude 发布 Opus 4.7,称是其最强 Opus 模型,主打长任务更稳、指令跟得更准、回复前会自己检查一遍

Anthropic 在 X 上发了条推文,说 Opus 4.7 是他们目前最能打的 Opus 模型。推文提了三个点:跑长任务时更严谨,不会半路掉链子;对指令的理解和执行更精准;输出结果前会先自我验证一轮,相当于自己先审一遍再交差。意思是你可以把最难搞的活丢给它,少盯几眼。不过正文没给任何跑分、上下文窗口多大、怎么收费、哪些人能用到,这些关键信息全都没提...

推荐理由:这是一次有分量的模型发布,HKR 三项都站得住:新 Opus 本身就有话题性,三条改进可以实测验证,Claude 重度用户会立刻上手对比。分数没给更高,是因为正文没放基准分数、上下文长度、价格和上线范围,这些关键信息缺了,实际能省多少成本、延迟高不高都还说不准。

Hacker News 首页

Anthropic 发布 Claude Opus 4.7,首次在较弱模型上部署网络安全拦截

Anthropic 在 4 月 16 日上线了 Claude Opus 4.7,价格和上一代 Opus 4.6 一样,输入每百万 token 5 美元,输出每百万 token 25 美元。这次更新主要强化了复杂软件工程任务和长流程工作的稳定性,模型会自己检查输出再汇报,视觉分辨率也更高了。官方给出的基准测试分数比 Opus 4.6 好看,但正文没有把所...

推荐理由:Anthropic 把 Claude Opus 4.7 推成正式版,价格没动,上线渠道覆盖了 API 和三大云平台,对实际工作流有直接影响。我会先打个折:正文说编程、长任务和视觉有提升,但具体跑分没全放出来,这点先别太激动。真正值得盯的是网络安全防护先在这个模型落地,安全策略有变化。整体信息够用,但缺完整数据支撑。

36 氪 · 直链

智元机器人旗下的觅蜂发布了一个物理 AI 数据平台,想解决机器人行业“没数据可喂”的问题

大语言模型能靠读书学知识,但具身机器人得在真实世界里摸爬滚打才能攒数据。觅蜂说现在全球高质量机器人训练数据加起来也就 50 万小时,跟大模型用的 100 万亿 token 完全没法比。他们这次推了一套叫 MEgo 的“无本体采集”硬件,就是让人戴着轻量夹爪和头戴设备直接记录动作,不用每次都搬昂贵的机器人本体。夹爪重 480 克,能 1080P 60fp...

推荐理由:我会先打个折:这还是一家公司的单次发布,正文没披露客户规模、定价和实际训练效果,所以分数没往上拉。但信息量够实在——觅蜂不卖本体,卖的是物理AI数据,智元自己拿数据也得走市场化下单。两款采集硬件参数也给了:夹爪480克、头显7个摄像头超300°视野、亚毫秒级同步。对盯着数据瓶颈的从业者来说,这些数字和商业模式比单纯秀机器人更有参考价值。

Hacker News 首页

通义千问开源 Qwen3.6-35B-A3B:总参数 350 亿,每次推理只激活 30 亿,主打编程智能体

Qwen 放出了一个新开源模型 Qwen3.6-35B-A3B,用的是混合专家架构,总参数量 350 亿,但实际干活时只调用 30 亿参数,跑起来很省资源。它的核心卖点是编程智能体能力,在 SWE-bench Verified 上拿了 73.4 分,Terminal-Bench 2.0 上 51.5 分,直接超过了自家上一代 270 亿参数的密集模型 ...

推荐理由:这是 Qwen 正经发模型,不是套壳功能更新。HKR 三条全中:低激活参数做代理编程是钩子,基准分数给了具体数字,开源权重加 30 亿激活直接戳部署成本和竞争焦虑。没给 p1 是因为目前只有一篇博客,还没看到第三方复现和更多消融实验。

r/LocalLLaMA

Qwen 放出 Qwen3.6-35B-A3B,35B 总参数只激活 3B,开源可商用

Qwen 发了个新模型,叫 Qwen3.6-35B-A3B,用的是稀疏 MoE 架构,总参数量 35B,但每次推理只激活其中 3B 参数,跑起来会比较省资源。采用 Apache 2.0 协议,可以商用。官方说法是它在写代码、处理多模态任务上表现不错,还支持“思考”和“不思考”两种模式,能直接塞进业务流程里干活。不过这篇帖子没给出具体的跑分、上下文窗口长...

推荐理由:这条帖子是个发布通告,信息量有限但钩子够硬。35B 总量、3B 激活的稀疏 MoE 听着省算力,但正文没放基准和上下文窗口,我会先打个折。Apache 2.0 开源是实锤,对想自己部署的人有吸引力;agentic coding 和多模态推理的说法先别太激动,等实测数据出来再看。

Hacker News 首页

Darkbloom:用闲置 Mac 跑加密推理,号称比 OpenRouter 便宜七成

Eigen Labs 搞了个叫 Darkbloom 的去中心化推理网络,把一亿多台苹果芯片 Mac 的闲置算力攒起来卖。它提供兼容 OpenAI 的 API,主打端到端加密和硬件验证,说操作节点的人看不到你的数据。价格表上列出的 token 费用比 OpenRouter 低 50%,不是标题里的 70%,这点先打个折。正文没披露独立安全审计的具体范围,...

推荐理由:HKR 三条全中:闲置 Mac 组网做推理的玩法有新鲜感,文章也把规模、接口、加密和价格都摆出来了。我先打个折,维持在 80 分——这还只是团队自己发的预览,审计范围、网络稳定性、攻击面边界都没经过第三方验证,论文出来之前别太激动。