跳到正文

全部动态

今日 25 条

4月22日星期三

彭博科技

OpenAI 发了新版生图模型,专门强化了图表和科学示意图的生成能力

OpenAI 更新了它的图像生成软件,这次的重点不是画得更美,而是让模型能更准确地生成复杂图表和科学示意图。正文没披露模型名字、发布时间、定价、跑分数据或具体技术方案,目前能看到的信号是 OpenAI 在往专业场景里推,而不是继续卷通用画质。

推荐理由:OpenAI 这次更新瞄准的是图像生成里一个高价值但一直没做好的短板——图表和示意图的准确性。Bloomberg 的信源让这条消息有了基本可信度,所以 H 和 R 都给了通过。但摘要实在太短,模型叫什么、什么时候能用、收不收费、跑分多少、怎么实现的,一概没提,K 只能卡在不过。我会先打个折:方向对了,但落地细节为零,先别太激动。

The Verge · AI

OpenAI 更新图片生成器,现在能联网搜资料来画图了

ChatGPT Images 2.0 这次最大的变化不是画质,而是能上网查资料。你选一个会思考的模型,它就能根据一个提示词生成一组图片,比如直接搜网页信息来画一本杂志封面。背后跑的是 GPT Image 2 模型,目前 Plus、Pro、Business 和 Enterprise 用户能用。正文没提什么时候全面推送、有没有用量限制、价格会不会变,这点先...

推荐理由:我会先打个折:正文没写具体上线时间、调用上限和价格变动,所以别急着算成本。但这次更新把“联网取数”和“多图生成”塞进一个工作流,等于让模型先查资料再画图,还能一次出好几张。对需要快速配图、做素材的人,这比单张生成实用得多。不过实际效果还得看联网检索准不准、多图一致性怎么样,这点先别太激动。

X · @dotey(宝玉)

Google 把 Gemini Deep Research 拆成两个版本:一个求快求省,一个烧算力出深度报告

Google 把 Gemini Deep Research 拆成了标准版和 Max 版,背后都是 Gemini 3.1 Pro 模型。标准版走速度和成本优先路线,适合嵌在产品里做即问即答;Max 版会反复搜索、推理、打磨报告,官方举的例子是分析师下班前丢一个尽调任务,第二天早上收完整报告。这次最大的变化是支持 MCP,能把 FactSet、S&P、Pi...

推荐理由:这是一次有分量的产品更新:Gemini Deep Research 拆成标准版和 Max 版,在付费 API 里公开预览,标准版偏速度和成本,Max 版给更多算力、反复搜索和推理。HKR 三项都站得住,但官方没公布定价、调用限制和两版实际性能差距,所以分数压在 78-84 这个区间。

The Verge · AI

YouTube 把 AI 换脸检测工具开放给名人,让他们自己搜、自己申请下架

YouTube 要把去年测试的 AI 换脸监测工具正式开放给好莱坞明星和公众人物。名人登记后,系统会自动扫描平台上用 AI 生成或替换了他们脸的视频,然后由本人或团队提交下架请求。注意,提交了不代表一定删——YouTube 会按隐私政策审核,不是所有请求都批准。这个工具去年秋天先给创作者试过,今年三月扩到了政治人物和记者,现在轮到明星。正文没披露具体什...

推荐理由:这是一次平台安全功能的扩展,不是模型新闻。YouTube 让已加入计划的名人能用工具搜仿冒视频并申请删除,审核仍走隐私规则流程。HKR 三项都成立,但整体还是一次中等体量的产品更新,所以重要性给到 74,放在 featured 层级。正文没披露具体覆盖多少名人、什么时候正式上线,这点先别太激动。

4月21日星期二

量子位 · 公众号

蚂蚁数科搞了个叫“大象”的百亿参数模型,跑分和效率都挺能打

蚂蚁集团的 Inclusion AI 团队被扒出是神秘模型“大象”的幕后作者。这个模型参数量 100B,上下文窗口 256K,一次能吐 32K 字,已经在 OpenRouter 上架。文章里测了修 bug、总结三千字会议纪要、跑轻量 agent 流程,效果都不错。AI BENCHY 跑分显示它平均每秒能出 2500 个 token,延迟大概 1 秒,一...

推荐理由:一个 100B 模型敢喊同规模 SOTA 还强调 Token 效率,钩子够硬。文章有实测数据也有失败案例,不是纯吹。训练细节、价格和官方模型卡都没披露,所以先别太激动,但方向值得跟。

Hacker News 首页

Brex 开源 CrabTrap:给 AI 智能体加一个 HTTP 代理,用 LLM 当裁判实时拦截危险请求

Brex 把内部用的安全工具 CrabTrap 开源了。它本质上是一个 HTTP 代理,插在你的 AI 智能体和外部服务之间,每次智能体要发请求都得先过它这关。它会对照你写的安全策略做判断,允许或拦截,而且判断方式分两条路:先走静态规则直接匹配,匹配不上再交给一个 LLM 裁判来拍板。后台日志会标清楚每个决定是规则拦的,还是模型判的。部署起来很快,官方...

推荐理由:这篇东西的看点不在开源本身,而在执行面选在了 HTTP 代理层。对从业者来说,这比 SDK 内置检查更通用,但正文没给延迟和误判数据,我会先打个折。钩子够抓人,机制也实在,所以 HKR 全亮,但分数停在 78 是因为关键性能指标全缺,别太激动。

Ben's Bites

Claude 新增设计面板,问几个问题就能出原型图

Anthropic 给 Claude 加了一个“设计”标签页,会先弹出 5 到 10 个问题跟你互动,然后直接生成线框图或高保真原型。作者实测发现,传图片转设计的流程在原型模式下效果不错。目前这个功能还在研究预览阶段,有独立的使用额度,20 美元月费套餐一周大概只能跑两三次大尺寸生成。文章更尖锐的吐槽在可用性上:Claude Cowork 很多能力依赖...

推荐理由:Anthropic 给 Claude 加了个 Design 标签页,对天天用 Claude 的人是个明确的信号。文章有实测细节——5-10 轮交互出原型、图像转设计流程可用、20 美元套餐每周只够跑两三次大生成——所以 HKR 三项都站得住。但这仍然是个单功能更新,不是平台级变化,我会先打个折。真正值得盯的是产品可用性:作者点名 Claude Cowork 依赖 connectors 和 plugins,但入口藏太深,这点先别太激动,等更多用户反馈再说。

机器之心 · 公众号

谢尔盖·布林重回一线盯 AI 编程,谷歌拉了一支突击队

谷歌悄悄组了一支 AI 编程突击队,由前 DeepMind 研究员 Sebastian Borgeaud 带队,谢尔盖·布林和 Koray Kavukcuoglu 直接参与,目标是提升长上下文编程能力和内部代码自动化。压力信号很直接:谷歌自己说约 50% 的代码已由编程 agent 生成、工程师负责审核,而 Anthropic 那边放话 Claude ...

推荐理由:HKR 三项都成立:布林回归的 hook 够强,谷歌 50% 代码由 agent 写的数字是硬信息,AI 编程的竞争态势也是圈内真痛点。但正文没披露团队规模、上线时间和具体模型版本,所以没给更高优先级。

OpenAI News

OpenAI 发了 ChatGPT Images 2.0,主打文字渲染、多语言和视觉推理

OpenAI 在 4 月 21 日官宣了 ChatGPT Images 2.0,说新模型在三个地方有提升:画面里的文字更准、多语言排版更稳、能根据复杂指令做视觉推理。官方放了一堆样图,从海报、漫画到杂志内页都有,看着确实比上一代强。但正文没披露模型架构、出图分辨率、价格、延迟和具体上线时间,也没给对比数据。文字渲染和多语言到底稳不稳,还得等实际用起来再...

推荐理由:OpenAI 自己发的图像模型更新,版本号直接叫 2.0,文字渲染又是老痛点,所以热度和落地价值都够。但我会先打个折:正文只给了三项改进的标题级信息,分辨率、价格、延迟、架构和可用范围全都没披露,现在只能当个预告看。真正该盯的是文字可读性和多语一致性有没有实测提升,这点先别太激动。

新智元 · 公众号

OpenAI 给 Codex 加了屏幕读取功能,奥特曼说这是“心灵感应”的第一步

OpenAI 在 4 月 21 日上线了 Codex 的 Chronicle 研究预览版,目前只开放给 ChatGPT Pro 用户,且仅限 Mac 端。它可以直接读取你最近的屏幕内容,省去反复交代背景信息的麻烦。OpenAI 声称数据“主要在本地处理”,但 The Next Web 报道指出部分情况会借助云端,截图会上传,本地记忆也未加密,上传比例和...

推荐理由:我会先打个折:这只是研究预览,功能边界和隐私细节都还模糊。但钩子够狠——Codex 开始读屏幕而不是等你喂上下文,等于把 agent 的记忆层从“你告诉它”推到“它自己看”。正文没披露云端辅助的具体触发条件和数据留存策略,这点先别太激动。对从业者来说,真正值得盯的是屏幕状态变成持续输入后,工作流设计和安全边界要怎么重画。

新智元 · 公众号

华为发布 Pura X Max,首发小艺伴随式 AI,能跨 App 读屏、记待办

华为在 4 月 20 日发布了 Pura X Max,同时推出鸿蒙 6.1 上的小艺伴随式 AI。调用方式有两种:双击导航条或语音唤醒。它能在你同意后读取屏幕内容,把不同 App 里的任务收进日历,还能直接联动高德地图和滴滴。核心卖点是系统级的跨应用操作和常驻侧边栏交互。正文没提价格、具体机型参数和覆盖范围,所以实际体验和稳定性还得等上手再看。

推荐理由:我会先打个折:正文没给价格、模型参数和适配覆盖率,所以只放在 featured 而不是更高。但 HKR 三条全中——常驻读屏助手这个钩子够强,操作流程和隐私开关写得明白,而且它踩中了 OS 级 agent 可能改写移动平台规则的那个点。

X · @dotey(宝玉)

GitHub Copilot 暂停 Pro、Pro+ 和学生版新注册,Pro 套餐砍掉 Claude Opus 模型

4 月 20 日,GitHub 对 Copilot 个人版动了次大手术:Pro、Pro+ 和学生版不再接受新用户,只剩免费版还能注册。官方说这是为了保住现有付费用户的服务质量。Pro+ 的使用额度被拉到 Pro 的 5 倍以上,Pro 用户如果老撞墙,官方建议加钱升 Pro+。最狠的一刀是 Pro 套餐直接移除了 Claude Opus 模型,Anth...

推荐理由:Copilot 个人版这次调整不是发新功能,而是卡入口、压额度、分层模型。Pro 用户被拿走 Claude Opus,Pro+ 额度拉到 Pro 的五倍以上,定价却没变——等于用供给端收缩来应对模型成本压力。信息来自 X 帖子而非 GitHub 官方公告,这点先打个折,但暂停注册和退款窗口本身已经够具体,值得从业者盯后续。

Hacker News 首页

OpenAI 广告合作方开始按“提示词相关性”卖 ChatGPT 广告位

一份泄露的提案显示,广告平台 StackAdapt 正在拉广告主测试 ChatGPT 内的广告,卖点是根据用户输入的提示词来匹配广告。千次展示成本(CPM)报价在 15 到 60 美元之间,试点项目最低要花 5 万美元。我会先打个折:正文没披露广告具体出现在聊天界面的哪个位置、竞价逻辑、实际能覆盖多少人,也没说什么时候正式上线。目前能确定的是,你在 C...

推荐理由:我会先打个折:现在能看到的只是 RSS 摘要,正文没展开,所以很多关键信息是空的。但“按提示词相关性卖 ChatGPT 广告位”这个钩子本身够尖锐,它把聊天上下文直接变成定向信号,这在 AI 产品变现里是个很敏感的动作。H 和 R 都成立,因为话题既抓眼球又踩中信任和商业模式的核心。K 明显弱,因为广告位、竞价、定价、规模、上线时间全都没披露,只能当个信号先盯着。

X · @claudeai

Claude 的 Cowork 模式现在能直接生成可实时刷新的仪表盘和追踪器,数据来自你绑定的应用和文件

Claude 在 Cowork 里新增了一个能力:生成“活的”小组件,比如仪表盘或进度追踪器。这些组件不是静态截图,每次打开都会自动拉取最新数据。官方说数据源可以是你连上的应用和文件,但具体支持哪些应用、文件类型以及权限怎么管,正文都没提。我会先打个折,等看到实际集成列表再判断实用性。

推荐理由:HKR 三项全中:钩子是能连应用和文件的 live artifacts,每次打开自动刷新。这是 Claude 工作流能力的一次实在升级,天然有 Claude 热度加成。但公告没写清楚连接器范围、权限模型和推送节奏,信息缺口明显,所以我会先打个折,放在 78 分,不进 p1。

彭博科技

Google 要发新的 AI 推理芯片,直接跟英伟达抢生意

Bloomberg 这条视频提到 Google 准备推出一批专做推理的新 AI 芯片,正面挑战英伟达。不过正文被付费墙挡了,没披露具体发布时间、型号、性能参数、定价和客户。我会先打个折:目前能确认的信号是推理芯片的供给竞争在升温,但产品到底多能打、什么时候落地,都还是未知数。

推荐理由:HKR-H 和 HKR-R 通过,因为这条消息把 Google 和 Nvidia 在推理芯片上的直接竞争摆上了台面。HKR-K 弱:报道只确认了推理这个方向,芯片叫什么、跑分多少、卖多少钱、什么时候出、谁会买,这些关键信息正文都没披露,所以信息缺口很大。

X · @dotey(宝玉)

OpenAI 给 Codex 加了 Chronicle,让它能“看”屏幕记住你在做什么

OpenAI 在 macOS 版 ChatGPT Pro 里灰度测试 Chronicle,这是 Codex 的 Memories 扩展。它会后台定时截屏、做 OCR、识别你用的工具,把近期屏幕活动整理成记忆,存为本地 Markdown 文件。你跟它说“这个报错”,它不用你解释就知道指什么。但要注意几点:后台 Agent 一直跑会很快吃掉 rate li...

推荐理由:OpenAI 让 Codex 能定时截屏、OCR 识别屏幕内容,然后写成记忆存到本地。这个功能目前只给 macOS 上的 ChatGPT Pro 用户灰度开放,欧盟、英国、瑞士用不了。我会先打个折:截图上传服务器处理后声称会删除、不用于训练,但官方自己也警告会放大网页 prompt 注入,而且记忆以明文 Markdown 放在 ~/.codex 目录下,泄露面不小。后台总结还会消耗 rate limit,这点先别太激动。整体信息量够、有可测试的细节,但受限于小范围灰度,所以放在 featured 而不是 p1。

彭博科技

Google 本周要发新一代 TPU,专做推理

Bloomberg 的视频预告说 Google 这周会公布新的定制芯片,定位是 AI 推理任务。正文被付费墙挡了,没拿到具体型号、性能、功耗和价格。我会先打个折:重点不是又发芯片了,而是这批 TPU 能不能把推理成本打下来、供货稳不稳。

推荐理由:标题说新芯片,但正文其实只给了两个信息:本周发布、面向推理。我会先打个折——型号、性能、功耗、价格一概没披露,现在激动还太早。之所以还放在 featured 里,是因为 Google 把新 TPU 直接框在推理上,这对算力成本和供给是个实打实的信号,AI 团队会追。但信息缺口太大,重要性停在 74 是合理的。

The Verge · AI

Epic 给《堡垒之夜》创作者发了 AI 角色工具,但明令禁止和 NPC 谈恋爱

Epic 在《堡垒之夜》里上线了一个叫“对话”的工具,让创作者可以把自己岛上的 NPC 变成能自由聊天的 AI 角色。创作者用提示词设定角色的人设、知识范围、行为和声音,玩家就能跟 NPC 进行不按剧本走的对话。标题特意警告“别想和 AI 约会”,但正文没具体说防越狱和内容审核机制到底怎么做的。去年 Epic 在游戏里试水过 AI 版达斯·维达,结果角...

推荐理由:Epic 给 Fortnite 创作者发了个新工具,能让岛上的 NPC 跟玩家自由聊天,用提示词定人设、知识和行为,还能选语音。标题特意警告别拿来搞约会对象,但正文没写具体怎么审核、什么话不能说,也没提成本和用的哪家模型。我会先打个折:可控性才是重点,不是“会聊天”本身。

Latent Space

用 Transformer 解决癌症临床试验 95% 的失败率——Noetik 的 Ron Alfa 和 Daniel Bear

95% 的癌症疗法通不过临床试验,Noetik 认为这主要是个配对问题:没搞清楚哪个病人、哪种肿瘤、该用哪种已有的药。他们训练了一个叫 TARIO-2 的自回归 Transformer,能从每个病人都会做的常规 H&E 染色切片里,直接预测出约 19,000 个基因的空间表达图谱。这种空间转录组数据原本是读肿瘤最丰富的方式,但标准治疗里几乎没有病人会做...

推荐理由:我会先打个折:正文没披露 TARIO-2 在独立验证集上的具体性能指标,也没说 5000 万协议是里程碑付款还是一次性,这点先别太激动。但这条消息的钩子很准——它没吹“AI 治愈癌症”,而是把 95% 的失败率解释成患者、肿瘤和疗法没对上号,然后用 transformer 从常规病理切片里预测近两万个基因的空间分布,相当于给肿瘤微环境画了一张高维地图。GSK 愿意掏钱,说明至少内部验证过了门槛。对从业者来说,值得盯的是这种“从便宜影像出昂贵组学数据”的省钱逻辑能不能复制到其他癌种,以及模型泛化到不同医院染色标准时会不会崩。

4月20日星期一

X · @Yuchenj_UW

Kimi K2.6 开源了,SWE-Bench Pro 跑分 58.6,声称超过 GPT-5.4 和 Claude Opus 4.6

Kimi K2.6 宣布开源,在 SWE-Bench Pro(一个测代码修 bug 能力的基准)上拿了 58.6 分。推文说这个分数压过了 GPT-5.4(xhigh 模式)和 Claude Opus 4.6(max effort 模式)。不过正文没披露模型权重、开源协议和具体的评测设置,可复现性要打个问号。发帖人觉得 Kimi 发版节奏越来越快,属于...

推荐理由:三条都踩中了:开源本身就是强钩子,SWE-Bench Pro 58.6 这个数可以验证但信息不全,开源对闭源的代码能力竞赛又是当下热点。分数我维持 81,因为目前看只有标题级信息,权重、许可证、评测设置全都没披露,先别太激动。

机器之心 · 公众号

智元机器人把2026年叫“部署态”元年,一口气甩出7套落地方案

智元在4月17号上海的活动上发了4款机器人、6个AI模型和7套标准化部署方案,把2026年定义为具身智能的“部署态”元年。远征A3续航标称8到10小时,WITA Omni 1.0的交互延迟目标是500毫秒以内,BFM模型用了一亿多帧图像和700小时动捕数据训练。他们还提到2025年出货超5100台、市占率39%,第1万台在今年3月下线。对从业者来说,重...

推荐理由:HKR三项都成立:文章开头就拿七套标准化方案说事,后面用出货量、市占率、延迟和训练数据做支撑。分数停在76,因为关键效果数据全是公司自己说的,客户侧的实际表现和独立验证正文没披露,我会先打个折。

彭博科技

爱奇艺启动 16 年来最大改组,要把 AI 生成内容塞进片单

爱奇艺开始了一场公司成立 16 年来最大规模的重组,目标是让 AI 在未来直接生成相当比例的影视内容。目前这篇报道的正文被付费墙挡住了,看不到具体用了什么模型、打算花多少钱、AI 内容占比多少、什么时候上线。能确认的信号是这次改组的动作很大,不是喊口号,但实际落地效果还得等更多细节。

推荐理由:Bloomberg的信源权威性把这条推过了featured线:一个主流视频平台把16年最大重组押在AI生成内容上,H和R都站得住。K偏弱是因为正文没披露模型、投入金额、内容占比和上线节点,所以分数停在74。真正值得盯的是组织调整的力度,不是“AI做内容”这句口号。

4月19日星期日

机器之心 · 公众号

高德在亦庄半马放出一只四足机器人“图图”,在开放路段不靠预设路线和遥控,跑完导盲避障任务

高德在2026年亦庄人形机器人半马上展示了一只叫“图图”的四足机器人,完成了一段开放环境下的导盲避障演示。官方说全程没有预设路线,也没有人遥控。背后的技术栈叫ABot,分两块:ABot-N0负责导航,在7个导航基准上拿了SOTA,其中SocNav得分88.3%,说明在社交场景里避让行人的能力不错;ABot-M0管操作,在Libero-Plus上拿了80...

推荐理由:HKR 三项都站得住:半马导盲这个设定本身就新鲜,技术栈和关键成功率数字也给了,而且场景选得够狠,天然带话题。分数维持在 80 不往上加,是因为正文没提导盲实测到底覆盖了哪些路况、有没有出过安全事故、什么时候能商用——这些缺口让判断得先打个折。

量子位 · 公众号

高德发布全栈具身智能体系 ABot,号称在 15 项指标上拿了最优

高德这次公开的 ABot 是一套想让机器人真正干活的全栈技术体系,分视觉感知、物理世界模型和视觉语言动作模型几块。ABot-3DGS 能用厘米级地图数据重建上万平米的三维场景,ABot-PhysWorld 则是一个 140 亿参数的扩散模型,用 300 万条真实机械臂操作视频训练,让机器人先在大脑里模拟动作再执行。文章说横扫 15 项 SOTA,但具体...

推荐理由:高德这次公开的 ABot 体系,我会先打个折——15 项 SOTA 具体是哪些基准、跟谁比,正文没列,挑战赛名称也没给,这点先别太激动。但能聊的东西确实有:ABot-3DGS 拿厘米级地图和轨迹数据生成了上万组 3D 场景,号称覆盖率 99%,如果属实,等于用地图老本行给具身训练铺了一条低成本数据管道;ABot-PhysWorld 用 14B 的 DiT 加 300 万条真实操作视频做物理判别训练,规模不小。真正该盯的是他们把世界模型和 VLA 闭环绑在一起做的思路,不是单点炫技。开源范围和时间表都没披露,落地成色还得等。

新智元 · 公众号

高德发布 ABot-Claw 和四足机器人 Tutu,在亦庄半马搞了次导盲演示

高德在 2026 亦庄机器人半马上展示了 ABot-Claw 智能体系统和四足机器人 Tutu,主打自主导盲。ABot-M0 在 Libero-Plus 上拿了 80.5%,比 Pi0 高出近 30 个百分点,说明在复杂操作任务上进步明显;ABot-N0 在 7 个导航基准上刷到了 SOTA。他们开源了一个叫 UniACT 的数据集,包含 600 万条...

推荐理由:我会先打个折:半马名次、商业化时间和价格正文都没提,所以别当量产信号看。真正值得盯的是 Map as Memory、云边协同和闭环纠错这套工程思路——它试图把导航、操作和记忆揉成一个能在线纠错的系统,而不是单点 demo。Libero-Plus 80.5% 的成功率比 Pi0 提升近 30 个百分点,说明操作端确实有进步;7 项导航 SOTA 和 600 万条开源轨迹则给复现留了口子。但所有这些数字都来自他们自己的评测,没有第三方验证,这点先别太激动。整体看,这是一次把具身智能拉到开放环境里遛一遛的尝试,工程整合的价值比单项指标更大。

4月18日星期六

机器之心 · 公众号

Anthropic 给 Claude 加了个设计功能,能直接出线框图、原型和幻灯片

Anthropic 在 Claude Pro、Max、Team 和 Enterprise 账号里上线了 Claude Design 的研究预览版,背后跑的是 Claude Opus 4.7。它能吃代码库、图片、DOCX、PPTX、XLSX 和网页截图,吐出来的东西可以导出到 Canva、PDF、PPTX 和 HTML。标题说 Figma 和 Adobe...

推荐理由:我会先打个折:标题说 Figma、Adobe 股价重挫,但正文没给出具体跌幅,这点先别太激动。真正值得看的是 Anthropic 把设计稿生成、设计系统读取、多人协作编辑和向 Claude Code 交接串成了一条线,这比单出一个画图工具要狠。不过目前还是研究预览版,没有用户测试数据、定价和实际落地案例,能不能真革了设计行业的命还得看后续。

新智元 · 公众号

Claude Opus 4.7 上线两天口碑翻车:跑分登顶,推理测试却暴跌

Anthropic 新模型 Claude Opus 4.7 上线不到 48 小时就吵翻了。在 Artificial Analysis 综合评分上它拿了 57 分并列第一,但换到 NYT Connections Extended 这个推理测试,准确率直接从上一代 4.6 的 94.7% 掉到 41.0%。另外,新模型换了一套分词器,同一段文本消耗的 to...

推荐理由:这条信息的价值不在“口碑崩了”的标题,而在于它把四个具体变化摆了出来:基准跑分领先、推理任务大幅退步、token 消耗变高、API 参数不兼容。对从业者来说,这比单纯报一个模型发布更有参考意义,因为它提示了升级可能带来的隐性成本。不过文章本身是发布 48 小时后的二次分析,不是 Anthropic 官方首发,所以重要性给到 83、放在 featured 层级是合理的。

新智元 · 公众号

B站吵翻了:Hermes 首次直播回应抄袭指控,MiniMax 提前卡位 Harness 赛点

MiniMax 说他们的 M2.7 模型现在能接手强化学习团队 30% 到 50% 的日常工作,自己跑通了超过 100 轮自我优化,评测指标提升了 30%。Hermes Agent 的日调用量从 20 亿涨到了近 3000 亿 token,M2.7 在 OpenRouter 上的日调用也超过了 250 亿 token。Hermes 负责人 Tommy ...

推荐理由:这篇不是一手发布或官方技术报告,而是把几条动态串起来的二手解读,所以重要性停在 83 分。我会先打个折:Hermes 直播否认抄袭本身不算大新闻,但配上 MiniMax 提前杀入 Harness 赛点、给出具体工作流占比和沙箱性能数据,就让整篇有了可读性。正文没披露 M2.7 具体在哪些任务上替代了人工、也没说 30% 提升的基线是什么,这点先别太激动。不过沙箱启动 20-40ms 和每分钟 60 万实例的并发能力如果是真的挺省钱,说明执行层的基础设施正在变成新战场。整体适合放进 featured,给做 Agent 的人一个信号:别光盯着模型跑分,...

Hacker News 首页

rtrvr.ai 把浏览器操作录成脚本,重放零 token 成本,还能让 AI 直接调用

rtrvr.ai 做了一个叫 AI Subroutines 的功能,核心思路是把你在浏览器里的一次操作录下来,变成一个可重复调用的工具脚本。重放时脚本直接在当前网页里跑,cookie、CSRF token、签名头这些认证信息全都不用手动处理,浏览器自己就带上了。录制时会从几百个网络请求里自动筛出真正有用的那几条,遇到 GraphQL 那种一更新就失效的...

推荐理由:rtrvr.ai 这个 Show HN 放出了一个叫 AI Subroutines 的功能,核心是把录过一次的浏览器操作存成可重复调用的工具,直接在当前标签页里执行,复用登录态和请求签名,省掉了反复调大模型的成本和延迟。我会先打个折——这是单家公司的产品更新,不是行业级事件,所以放在 featured 中段。但它的技术细节够实在:录制时把约 300 个请求压缩到约 5 个,GraphQL operation ID 不稳定就退回纯 DOM 操作,还支持一次调用批量分发 500 行参数。这些数字说明它在成本和延迟上确实有想法,不是空画饼。正文没披露多标...

X · @dotey(宝玉)

Anthropic 发布 Claude Design,用对话代替拖拽生成设计稿

Anthropic 推出了 Claude Design,一个靠聊天就能出设计稿的工具,背后跑的是新模型 Claude Opus 4.7。你描述需求,它直接生成图片,然后通过对话、批注、直接编辑或拖拽滑块反复改。团队第一次用的时候,它会读你的代码库和设计文件,自动生成一套设计系统(品牌色、字体、组件),后续项目自动套用。支持从文字、图片、文档或网页截取起...

推荐理由:Anthropic 把 Claude 塞进了设计环节,HKR 三项都站得住。文章给了开放节奏、底层模型和导出目标,信息量够上 featured。不过目前还是研究预览,不是模型级大更新,我会先打个折,重要性给 84。

4月17日星期五

X · @op7418(歸藏)

Claude 出了个设计工具,能直接生成网页、App 原型和 PPT

Claude 上线了一个设计工具,功能跟 lovable 类似,可以帮你生成网页、App 原型和 PPT。它支持导出 PPT 格式,也能把内容导出到 Canvas 继续编辑。正文没提产品叫什么、怎么收费、哪些套餐能用、有没有地区限制。从描述看,Claude 这次不只是聊天出文字,而是直接产出可交付的设计文件了。

推荐理由:这条消息本身信息量不大,就一个 RSS 摘要,但 Claude 上线设计工具这件事方向很明确——从对话界面走到能吐网页、APP 原型和 PPT,还打通了导出链路。我会先打个折,因为产品名、价格、套餐和地区限制全都没说,来源也只有一条 X 帖子和摘要,权威性偏弱。不过对从业者来说,这比模型跑分更值得盯,因为它直接关系到能不能把 AI 塞进设计交付流程里。

Hacker News 首页

Anthropic 实验室推出 Claude Design,用对话就能生成设计稿

Anthropic 在 4 月 17 日上线了 Claude Design,目前是研究预览版,Pro、Max、Team 和 Enterprise 用户都能用。它基于 Claude Opus 4.7,你给它文字描述、图片、文档(DOCX、PPTX、XLSX)甚至代码库,它就能生成设计稿、原型、幻灯片或单页宣传页。比较特别的是,它能直接读取你团队的代码和设...

推荐理由:这是 Anthropic 一次有分量的产品发布,不是小功能补丁。HKR 三项都站得住:形态新、部署细节够、工作流共鸣强。但研究预览的身份和没单列的价格让我把分控在 84,没给更高。真正值得盯的是它和 Claude Code 的交接链路,如果跑通,设计到代码的流转会变短。

X · @claudeai

Anthropic 实验室推出 Claude Design,用对话就能生成原型、幻灯片和单页文档

Claude Design 是 Anthropic 实验室放出的研究预览功能,Pro、Max、Team 和 Enterprise 用户今天开始陆续能用。它跑在 Claude Opus 4.7 上,官方说这是他们目前最强的视觉模型。用法很简单:你跟 Claude 聊需求,它直接出原型、幻灯片或单页文档。正文没提价格、输出限制和详细推送时间表。我会先打个折...

推荐理由:Anthropic 自己下场做设计生成,Claude 从纯文本助手变成能出视觉稿的工具,这个转向本身就值得关注。我会先打个折:帖子说 Opus 4.7 是“最强视觉模型”,但没给对比数据,也没说生成的文件能不能直接导出编辑。如果是真的,对快速出原型和汇报材料挺省钱,但别急着当生产工具用——格式限制和付费墙都没讲清楚。

新智元 · 公众号

智元机器人说已进入“部署态”,在工厂产线连续干了8小时没停

智元在4月17日的APC 2026上把2026年定义为“部署态元年”,核心案例是龙旗南昌工厂的Genie G2机器人:完成2283次上料任务,成功率超99.5%,单次节拍18到20秒,连续运行8小时。这些数字是公司自己公布的,正文没提有没有第三方审计。更值得看的信号是规模:智元称2025年出货超5100台,到2026年3月累计出货1万台,龙旗那边计划部...

推荐理由:HKR三条都踩中了。'Demo秀终结'这个角度有传播力,文章给出了工厂实测数据——8小时连续运行、2283次上下料、成功率超99.5%、单工序18-20秒,不是实验室摆拍。没给P1是因为这些数据全来自企业自报,正文没披露第三方审计或跨厂复现结果,我会先打个折。真正值得盯的是量产条件:2025年出货超5100台、2026年3月累计下线1万台,龙旗计划近千台部署,这些数字如果兑现,比单次Demo有分量得多。

Hacker News 首页

Discourse 明确表态:不会因为 AI 能扫漏洞就把代码闭源

论坛软件 Discourse 发博客回应了最近 Cal.com 因害怕 AI 扫描漏洞而闭源的举动,直接说他们不会走这条路。Discourse 已经以 GPLv2 协议开源了 13 年,他们认为闭源反而会削弱防守能力。文章里提到,他们团队用 GPT-5.3 Codex、GPT-5.4 和 Claude Opus 4.6 扫自己的公开代码库,最近一次月度...

推荐理由:这不是模型发布,是一线团队对“AI 会不会逼 SaaS 公司闭源”的直接回应。HKR 三项都踩实了:Cal.com 闭源制造了冲突钩子,具体的模型名和安全修复数字给了干货,最后落到开发者最焦虑的开源护城河问题上。不过它终究是单家表态,不是行业级转折,所以留在 featured 低位合理。

X · @dotey(宝玉)

Seedance 2.0 API 开放,视频生成能直接串进工作流了

火山引擎把 Seedance 2.0 的 API 放出来了,国内走方舟平台,海外走 BytePlus。国内定价 46 元/百万 token,纯视频生成大概 1 元/秒,海外价格正文没写。这个 API 支持文字、图片、音频、视频四种输入,还内置了人脸验证、肖像授权和一万多个预置虚拟人像,可以用代码或 Agent Skills 把整条视频制作流程自动化。官...

推荐理由:这是一次 API 开放和定价更新,不是新模型发布。海外同步上线是个实在的钩子,价格信息也够具体,但正文没披露模型参数和统一评测基准,那个“效率提升近 10 倍”的个案先打个折看。整体对从业者有参考价值,所以给 74 分。

X · @op7418(歸藏)

Seedance 2.0 API 全量开放,支持文图音视频四种输入,还能做人脸登记和肖像授权

火山引擎把 Seedance 2.0 的 API 全量放出来了,国内走火山引擎,海外走 BytePlus。这个接口一次能接收文字、图片、音频、视频四种输入,也开放了人脸登记和肖像授权功能,可以直接用自己的脸生成视频,平台还预置了一批虚拟人像特征。正文没提价格、调用频率限制、模型版本和地区可用性,这些得自己去查。作者最期待的是把视频生成接进 Skills...

推荐理由:这是一次实打实的产品更新,不是概念发布。H 打满是因为全量开放意味着从 demo 到可集成的跨越;K 打满是因为四种模态输入和肖像授权机制都写清楚了,不是模糊的“多模态”;R 打满是因为视频生成类 API 的落地需求一直很旺,合规控制又是企业接入的硬门槛。分数定在 75,因为价格、速率限制、地区铺开节奏和实际生成质量正文都没给,这些缺口让实用性先打个折,别急着吹。

Latent Space

Anthropic 发布 Claude Opus 4.7:每个推理档位都压过 4.6 一头,还新增了 xhigh 模式

Anthropic 推出了新旗舰模型 Claude Opus 4.7,价格没变,还是每百万输入/输出 token 收 5 美元和 25 美元。最直观的变化是性能档位全面上移:4.7 的低档(low)比 4.6 中档强,中档比 4.6 高档强,高档则超过了 4.6 的 max 档。此外还新增了一个叫 xhigh 的推理强度,Claude Code 现在默...

推荐理由:Anthropic 旗舰模型更新,给了一堆可验证的数字和变化点,不是空对空吹牛。HKR 三项全过:钩子清楚、信息量足、对 Claude 用户群高度相关。重要性给 90 没毛病,属于那种“先别激动但值得马上看”的更新。

r/LocalLLaMA

Qwen3.6 新增 preserve_thinking 开关,修了上一代多轮对话“失忆”的 bug

Qwen3.6 模型页面上多了一个 preserve_thinking 参数,默认要打开。它的作用是把模型上一轮的思考过程原样保留在上下文里,而不是像 Qwen3.5 那样每次重新序列化,导致 KV 缓存失效、模型记不住自己刚想过什么。作者给了一个很直观的测试:先让模型想两个 20 位数字,只说出第一个;下一轮再问第二个。开关关掉时模型会说自己没生成过...

推荐理由:这条 Reddit PSA 的价值在于挖出了一个藏在模型页里的开关。我会先打个折,因为这不是官方发布说明,而是社区踩坑分享,但信息密度够高:有复现步骤、有根因分析、还顺手标了 LM Studio 和 oMLX 的支持状态。对正在用 Qwen3.6 搭 agent 的人来说,知道 preserve_thinking 能让推理上下文跨轮保留,比看十篇通稿都实在。

X · @OpenAI

OpenAI 发布 GPT-Rosalind,一个专攻生物、制药和转化医学的推理模型

OpenAI 在 X 上丢了个新模型 GPT-Rosalind,定位是给生物学、药物发现和转化医学研究用的前沿推理模型。帖子只说了应用方向,没提模型规模、跑分、能不能用、多少钱、什么时候上线。我会先打个折——目前只有一句话官宣,具体能力、训练数据和验证结果都没披露,别急着当生产力工具。

推荐理由:我会先打个折:这就是个命名预告,没有模型卡、没有跑分、没有开放方式,所以别急着当产品发布看。但 OpenAI 把新模型直接挂上 Rosalind 这个名字、明说用在生物学和药物发现上,说明他们想把推理能力往严肃科研场景推,而不是又出一个通用聊天模型。对做 AI+科学的人,这个方向比参数更重要;对想复现或评估的人,现在信息缺口太大,只能等后续披露。