跳到正文

#MCP/工具调用

今日 5 条

4月22日星期三

OpenAI News

OpenAI 给美国医生、执业护士和药剂师免费开放了临床版 ChatGPT

OpenAI 推出了一个专为临床工作设计的 ChatGPT 版本,主要用来辅助写病历、查文献和做医学研究。目前这个版本对美国境内经过身份验证的医生、执业护士、医师助理和药剂师免费开放。它能联网搜索经过同行评审的医学资料并给出引用来源,可以把病历摘要、转诊信、预授权申请这类重复性工作做成固定流程,还能在查资料的同时自动累积继续医学教育学分。正文没披露具体...

推荐理由:这条消息的钩子在于 OpenAI 开始直接拉个人临床用户,而不是只做机构生意。我会先打个折:正文没写模型版本、免费额度上限、上线时间和认证怎么走通,所以实际落地节奏还不清楚。但方向本身值得盯——医疗场景的 AI 工具以前多是医院买单、IT 部门部署,现在直接给一线医生、护士和药师免费入口,试用和反馈循环会快很多。覆盖的三类场景(临床、文档、研究)也说明不是单点功能,而是想嵌入日常诊疗流。这点先别太激动,等认证流程和实际使用限制出来再看,但准入逻辑确实在变。

Hacker News 首页

Show HN 提交量翻了三倍,现在大部分是 AI 一键生成的页面

Adrian Krebs 用脚本扫了 500 个 Show HN 落地页,发现 67% 的页面至少命中 2 个 AI 设计特征,比如 Inter 字体、紫色渐变、卡片彩色左边框、图标功能网格这些模板化痕迹。检测方法是用 Playwright 跑无头浏览器,在页面里直接检查 DOM 和计算样式,靠 15 条硬规则判断,人工抽查下来误判率大概 5% 到 1...

推荐理由:这条值得推给做 AI 工具和产品的人看。Adrian Krebs 没在评模型能力,而是用一套土办法——Playwright 跑脚本检查 DOM 和样式——发现 Show HN 现在 67% 的页面都命中至少两个 AI 设计特征。我会先打个折:这是单人实验,不是严格审计,误报他自己也认了 5% 到 10%。但信号比数字本身重要:AI 默认生成的前端模板正在让产品页面快速趋同,这对靠差异化吃饭的早期项目不是好事。正文没披露具体是哪 15 个特征,也没给误报的详细拆解,所以别当行业报告用,当个警钟看刚好。

The Verge · AI

Meta 开始记录员工电脑操作,用来训练能替你干活的 AI 助手

Meta 在美国员工的工作电脑上装了一个叫 MCI 的工具,会记录鼠标移动、点击、键盘输入,还会偶尔截屏。这些数据不是用来考核绩效,而是喂给 AI 模型,教它们像人一样操作电脑,以后自动处理员工现在做的重复性工作。Meta 说不会拿来做绩效评估,但正文没提数据会保留多久、员工能不能选择不用,也没说会不会推广到美国以外的地区。

推荐理由:我会先打个折:这不是产品发布或模型开源,而是一条内部工具被路透社挖出来的报道,所以信息缺口很明显。正文只说了美国员工和工作应用,保留多久、能不能退出、范围会不会扩大都没提。但这件事的传播力很强——Meta 直接拿员工的操作痕迹去教 agent 怎么像人一样用电脑,而且明确说数据不用于绩效考核,反而让人更想知道采集边界到底在哪。如果是真的,这种数据比外包标注便宜得多,但隐私和劳资关系的雷也埋得深。

OpenAI News

OpenAI 在 ChatGPT 里上线了团队版智能体,能自己跑流程、跨工具干活

OpenAI 给 ChatGPT 的企业版、教育版等付费计划加了一个叫“工作区智能体”的功能。你可以把它理解成能共享给整个团队用的自动化助手,背后由 Codex 驱动,在云端运行,人不在线它也能继续干活。它能跨多个工具(比如 Slack、CRM)执行多步骤任务,像自动筛选销售线索、写跟进邮件、每周五拉数据出报表、审核软件采购请求并生成 IT 工单。团队...

推荐理由:OpenAI 在 ChatGPT 里加了 workspace agents,等于把 Codex 塞进云端去跑跨工具的工作流,从纯聊天往团队自动化工作台又挪了一步。我会先打个折:正文没写价格、没列支持的工具、也没给延迟或成功率这些硬指标,所以重要性停在 86 分。H 打钩是因为从对话到 agent 的转变本身就有话题性;K 打钩是因为 Codex 驱动云端执行这个事实是新的,但信息缺口也明显;R 打钩是因为它直接踩在团队协作和自动化的关注点上,对做类似产品的团队会有压力。

OpenAI News

OpenAI 给 Responses API 加了 WebSocket,让 Codex 这类 agent 跑起来更快

OpenAI 发现,当模型推理速度从每秒 65 个 token 飙到近 1000 个 token 时,API 本身的处理开销反而成了拖慢 agent 循环的瓶颈。他们给 Responses API 加上了 WebSocket 支持,思路是把多次独立的 HTTP 请求换成一个长连接,在连接存活期间缓存住对话状态和可复用的上下文,只传新的工具调用结果,省掉...

推荐理由:这是 OpenAI 面向开发者的系统层更新:用 WebSocket 长连接加连接级缓存,把 agent 循环里反复建连、重复请求的开销压下去。HKR 三项都踩中了,但正文没给出延迟降了多少、吞吐多大、适合什么负载,所以只能算中等偏上的 featured,不能拉满。真正值得盯的是长连接怎么省掉往返成本,这不是换模型,是工程侧省钱省时间的优化。

FT · 科技

OpenAI 正谈着往一支私募股权合资基金里投最多 15 亿美元

OpenAI 打算掏钱当 LP,和私募股权机构成立一家合资公司,专门把 AI 塞进 PE 投的那些公司里干活。金额上限是 15 亿美元。这篇报道正文被付费墙挡住了,没披露合作方是谁、交易结构怎么搭、时间表怎么排。这跟发新模型没关系,更像是 OpenAI 在赌企业端落地——通过私募的钱和项目渠道,把自己的模型铺进更多传统行业。

推荐理由:FT 信源报出的 OpenAI 资本动作,15 亿美元上限给了 K 分,私募渠道的部署意图给了 H 和 R 分。合资方、结构和落地时间全缺,所以分数压在 80 出头:放 featured,不上头版。

新智元 · 公众号

马斯克给 Cursor 定了两条路:要么 600 亿美元卖给 SpaceX,要么交 100 亿合作费

SpaceX 给 AI 编程工具 Cursor 开出了硬性合作条件:今年内要么被 SpaceX 以 600 亿美元收购,要么支付 100 亿美元的合作费。这笔账背后是马斯克旗下 xAI 已经在用 Colossus 超算给 Cursor 的 Composer 功能做模型训练,而 Cursor 到 2026 年 2 月年化收入已超 20 亿美元、日活用户破...

推荐理由:这条消息的料主要在那组交易条款上:600 亿买断或 100 亿续约,数字够大,结构也够绑人。HKR 三项都站得住——钩子强、事实硬、对行业格局有直接冲击。不过正文没给原始文件,也没多方信源交叉验证,所以分数停在 featured 高位,不拉满到 p1。我会先打个折,等看到更实的证据再往上调。

X · @dotey(宝玉)

Anthropic 没发公告,悄悄把 Claude Code 从 20 美元 Pro 套餐里拿掉了

有人在 Anthropic 的功能对比表里发现,Pro 套餐对应的 Claude Code 一栏变成了叉号,多篇帮助文档也删掉了“Pro 套餐包含 Claude Code”的说法。但 Claude Code 产品页面和客服机器人还写着包含,部分 Pro 用户反馈目前仍能使用,正文没披露 Anthropic 的正式解释或生效时间。如果这个变更落地,开发者...

推荐理由:这条值得上 featured,因为门槛变化一旦落地,Claude Code 的入门价直接翻五倍,对个人开发者冲击不小。但 Anthropic 没给正式说明,生效时间和现有 Pro 用户怎么处理都不清楚,所以不往更高层级放。我会先打个折:正文没披露官方回应,现有信息都来自页面比对和用户反馈,这点先别太激动。

TechCrunch · AI

SpaceX 与 Cursor 合作开发 AI 编程工具,并手握 600 亿美元收购期权

SpaceX 宣布和 AI 编程助手 Cursor 达成合作,要一起搞下一代“写代码和知识工作”的 AI。更关键的是,协议里藏了一个收购期权:SpaceX 有权在今年晚些时候以 600 亿美元买下 Cursor。这个价格高得离谱,但正文没披露期权的触发条件、有效期、支付方式,也没说收购后 Cursor 团队和产品怎么整合。文章点出了一个更根本的软肋:C...

推荐理由:这条消息我会先打个折,因为正文没披露收购期权的期限、触发条件和钱怎么付,600 亿这个数先别太激动。但它的钩子很实在:SpaceX 和 Cursor 绑在一起,还带了个天价收购选项。更值得盯的是摘要里点出的短板逻辑——Cursor 和 xAI 都没有能跟 Anthropic、OpenAI 头部产品打平的自有模型。这意味着合作可能是用工程场景和数据换工具链深度,而不是纯技术碾压。对 AI 从业者来说,这比一个孤立的融资新闻更有嚼头,因为它直接关系到你每天写代码用的工具未来会站哪队。

Hacker News 首页

Anthropic 把 Claude Code 从 20 美元月费的 Pro 套餐里拿掉了,新用户没法用

Anthropic 悄悄改了规则,新订阅 20 美元/月 Pro 套餐的用户不再包含 Claude Code 编程工具。老 Pro 和 Max 用户暂时不受影响。官方说法是“在约 2% 的新个人用户里做测试”,但帮助文档已经从“Pro 或 Max 套餐可用”改成了“Max 套餐可用”,官网定价页也同步去掉了 Pro 的 Claude Code 入口。正...

推荐理由:这条消息在三个维度上都站得住:Pro 缩水本身就是个意外转折,文章用帮助页存档和官方回应把证据链补上了,而且开发者对定价和权益变动天然敏感。我会先打个折——目前只影响新用户测试群,正式政策时间表和回溯范围正文都没披露,所以重要性停在 76 是合理的。

The Verge · AI

SpaceX 签了个“可能买也可能不买”的协议,标的 Cursor,开价 600 亿美元

SpaceX 跟 AI 编程工具 Cursor 达成了一个二选一的交易框架:要么花 600 亿美元把 Cursor 买下来,要么付 100 亿美元分手费走人。文章没披露具体的交易结构、时间表,也没说跟 SpaceX 传闻中的 IPO 怎么挂钩。RSS 摘要里提了一句,这笔交易可能帮马斯克旗下的 xAI 在编程工具上追赶 Anthropic,但正文里没展...

推荐理由:标题说可能收购,但真正有信息量的是那笔 100 亿美元退出费——它更像一个约束机制,而不是简单的“不买了就赔钱”。正文只披露了顶层的两个数字,交易怎么设计、什么时候推进、跟 xAI 追 Anthropic 之间到底什么关系,全都没说。所以我会先打个折:事实够硬,但缺口也大,放在 featured 合适,别拔到 P1。

彭博科技

SpaceX 签了协议,有权在今年晚些时候用 600 亿美元买下 AI 编程工具 Cursor

SpaceX 说它签了一份协议,拿到了今年晚些时候收购 AI 编程创业公司 Cursor 的权利,交易作价 600 亿美元。如果最终不推进收购,SpaceX 也可以选择付 100 亿美元来维持双方的合作关系。不过正文没披露触发收购的具体条件、合作范围,也没提监管审批的细节。

推荐理由:Bloomberg 转引的 RSS 摘要爆出个不常见的交易结构:SpaceX 签了协议,最早今年晚些时候可以 600 亿美元买下 Cursor,不推进收购的话也要为双方合作掏 100 亿美元。先别太激动,这不是已完成并购,是买了个选择权。正文没披露什么条件下会触发收购、合作具体做什么、监管怎么批,这些缺口让 600 亿这个数得打个折看。但数字本身够大,结构够怪,航天公司跑去拿 AI 编程工具的收购权,放在一起就值得从业者盯一眼。

X · @dotey(宝玉)

OpenAI 图片生成升级到 2.0,能听懂复杂指令、写对多国文字,所有 ChatGPT 和 Codex 用户都能用了

ChatGPT 的图片生成功能今天全面升级到 2.0,免费用户也能用。这次最大的改进是能处理复杂构图了,比如带文字的 UI 界面、密集排版,小字和图标渲染比之前靠谱很多。输出分辨率最高 2K,宽高比从 3:1 到 1:3 都支持,做横幅海报可以直接出图。多语言文字生成也有提升,OpenAI 说中文、日文、阿拉伯文这些非英文文本能写得语义连贯,不再乱码。...

推荐理由:这是一次有料的 OpenAI 产品更新:ChatGPT Images 2.0 同时铺到 ChatGPT、Codex 和 gpt-image-2 API,分辨率、宽高比、非英文文字稳定性都有具体数字,thinking 模式还加了联网搜索和自检。HKR 三项全中。不过原文是短摘要式转载,没写价格,也没说 thinking 模式什么时候给 Enterprise 用,这点先别太激动。

X · @OpenAI

OpenAI 发了 ChatGPT Images 2.0,说画图更准、能直接拿来用

OpenAI 在 X 上官宣了 ChatGPT Images 2.0,定位是能处理复杂视觉任务、出图直接可用的图像模型。帖子提到三点升级:编辑更精细、版式更丰富,以及加入了“思考级智能”,但没解释这具体指什么能力。视频演示看起来效果不错,不过正文没披露模型规模、定价、延迟和推送范围,我会先打个折——等看到实测和成本再说。

推荐理由:OpenAI 官方发的帖文,信源权威性没问题,加上“Images 2.0”这个名头,话题性和行业影响都够,所以 H 和 R 都给了。但我把分压在 featured 门槛附近,因为这条帖文信息量太薄:没模型细节、没定价、没延迟、没基准测试、也没说清楚谁现在能用,K 完全站不住。真正值得盯的是可编辑性和版式控制这两点,但光靠这条帖文还远不到能复现的程度,先打个折观望。

FT · 科技

顶尖律所 Sullivan & Cromwell 向法官承认用了 AI 生成内容,结果出现“幻觉”

这家收费每小时超 2000 美元的律所,在一起破产案中因为 AI 工具出错向法官道歉。正文被付费墙挡住,没披露具体用了哪款 AI、出了多少错、法院后续怎么处理。但能看出一个尴尬的事实:即使有高收费的人工审核,也没拦住 AI 瞎编的内容被提交上去。

推荐理由:标题写“幻觉”容易让人以为又是模型乱编,但这事更值得盯的是流程问题——每小时 2000 多美元的人工审核,照样漏掉了软件驱动的错误。信息缺口很大:工具、错误数量、法院后续都没披露,所以别急着往模型能力上归因。FT 的信源权威性能撑到 73 分和 featured,但缺这么多关键事实,分数没法再往上走。

The Verge · AI

OpenAI 更新图片生成器,现在能联网搜资料来画图了

ChatGPT Images 2.0 这次最大的变化不是画质,而是能上网查资料。你选一个会思考的模型,它就能根据一个提示词生成一组图片,比如直接搜网页信息来画一本杂志封面。背后跑的是 GPT Image 2 模型,目前 Plus、Pro、Business 和 Enterprise 用户能用。正文没提什么时候全面推送、有没有用量限制、价格会不会变,这点先...

推荐理由:我会先打个折:正文没写具体上线时间、调用上限和价格变动,所以别急着算成本。但这次更新把“联网取数”和“多图生成”塞进一个工作流,等于让模型先查资料再画图,还能一次出好几张。对需要快速配图、做素材的人,这比单张生成实用得多。不过实际效果还得看联网检索准不准、多图一致性怎么样,这点先别太激动。

X · @dotey(宝玉)

Google 把 Gemini Deep Research 拆成两个版本:一个求快求省,一个烧算力出深度报告

Google 把 Gemini Deep Research 拆成了标准版和 Max 版,背后都是 Gemini 3.1 Pro 模型。标准版走速度和成本优先路线,适合嵌在产品里做即问即答;Max 版会反复搜索、推理、打磨报告,官方举的例子是分析师下班前丢一个尽调任务,第二天早上收完整报告。这次最大的变化是支持 MCP,能把 FactSet、S&P、Pi...

推荐理由:这是一次有分量的产品更新:Gemini Deep Research 拆成标准版和 Max 版,在付费 API 里公开预览,标准版偏速度和成本,Max 版给更多算力、反复搜索和推理。HKR 三项都站得住,但官方没公布定价、调用限制和两版实际性能差距,所以分数压在 78-84 这个区间。

The Verge · AI

YouTube 把 AI 换脸检测工具开放给名人,让他们自己搜、自己申请下架

YouTube 要把去年测试的 AI 换脸监测工具正式开放给好莱坞明星和公众人物。名人登记后,系统会自动扫描平台上用 AI 生成或替换了他们脸的视频,然后由本人或团队提交下架请求。注意,提交了不代表一定删——YouTube 会按隐私政策审核,不是所有请求都批准。这个工具去年秋天先给创作者试过,今年三月扩到了政治人物和记者,现在轮到明星。正文没披露具体什...

推荐理由:这是一次平台安全功能的扩展,不是模型新闻。YouTube 让已加入计划的名人能用工具搜仿冒视频并申请删除,审核仍走隐私规则流程。HKR 三项都成立,但整体还是一次中等体量的产品更新,所以重要性给到 74,放在 featured 层级。正文没披露具体覆盖多少名人、什么时候正式上线,这点先别太激动。

4月21日星期二

Hacker News 首页

Brex 开源 CrabTrap:给 AI 智能体加一个 HTTP 代理,用 LLM 当裁判实时拦截危险请求

Brex 把内部用的安全工具 CrabTrap 开源了。它本质上是一个 HTTP 代理,插在你的 AI 智能体和外部服务之间,每次智能体要发请求都得先过它这关。它会对照你写的安全策略做判断,允许或拦截,而且判断方式分两条路:先走静态规则直接匹配,匹配不上再交给一个 LLM 裁判来拍板。后台日志会标清楚每个决定是规则拦的,还是模型判的。部署起来很快,官方...

推荐理由:这篇东西的看点不在开源本身,而在执行面选在了 HTTP 代理层。对从业者来说,这比 SDK 内置检查更通用,但正文没给延迟和误判数据,我会先打个折。钩子够抓人,机制也实在,所以 HKR 全亮,但分数停在 78 是因为关键性能指标全缺,别太激动。

The Verge · AI

苹果新 CEO 还没上任,AI 这关就不好过

苹果宣布硬件出身的 John Ternus 将在 9 月 1 日接替库克,但官方公告里一个字都没提 AI。Ternus 在苹果干了 25 年,是近 30 年来第一个硬件背景的 CEO。文章没说他打算怎么搞 AI、怎么改 Siri,也没提组织架构会怎么动。真正麻烦的是去年 WWDC 之后,苹果在 AI 上的落后已经摆上台面了。

推荐理由:这条人事新闻本身够重,而且用 AI 缺口来框新 CEO 的挑战,角度抓得准,所以 H 和 R 都过了。没进更高档是因为 K 偏弱:正文只给了交接日期和硬件出身,AI 怎么补、Siri 怎么救、团队动不动,全都没说。我会先打个折,等后续有实质信息再往上调。

Ben's Bites

Claude 新增设计面板,问几个问题就能出原型图

Anthropic 给 Claude 加了一个“设计”标签页,会先弹出 5 到 10 个问题跟你互动,然后直接生成线框图或高保真原型。作者实测发现,传图片转设计的流程在原型模式下效果不错。目前这个功能还在研究预览阶段,有独立的使用额度,20 美元月费套餐一周大概只能跑两三次大尺寸生成。文章更尖锐的吐槽在可用性上:Claude Cowork 很多能力依赖...

推荐理由:Anthropic 给 Claude 加了个 Design 标签页,对天天用 Claude 的人是个明确的信号。文章有实测细节——5-10 轮交互出原型、图像转设计流程可用、20 美元套餐每周只够跑两三次大生成——所以 HKR 三项都站得住。但这仍然是个单功能更新,不是平台级变化,我会先打个折。真正值得盯的是产品可用性:作者点名 Claude Cowork 依赖 connectors 和 plugins,但入口藏太深,这点先别太激动,等更多用户反馈再说。

机器之心 · 公众号

谢尔盖·布林重回一线盯 AI 编程,谷歌拉了一支突击队

谷歌悄悄组了一支 AI 编程突击队,由前 DeepMind 研究员 Sebastian Borgeaud 带队,谢尔盖·布林和 Koray Kavukcuoglu 直接参与,目标是提升长上下文编程能力和内部代码自动化。压力信号很直接:谷歌自己说约 50% 的代码已由编程 agent 生成、工程师负责审核,而 Anthropic 那边放话 Claude ...

推荐理由:HKR 三项都成立:布林回归的 hook 够强,谷歌 50% 代码由 agent 写的数字是硬信息,AI 编程的竞争态势也是圈内真痛点。但正文没披露团队规模、上线时间和具体模型版本,所以没给更高优先级。

新智元 · 公众号

OpenAI 给 Codex 加了屏幕读取功能,奥特曼说这是“心灵感应”的第一步

OpenAI 在 4 月 21 日上线了 Codex 的 Chronicle 研究预览版,目前只开放给 ChatGPT Pro 用户,且仅限 Mac 端。它可以直接读取你最近的屏幕内容,省去反复交代背景信息的麻烦。OpenAI 声称数据“主要在本地处理”,但 The Next Web 报道指出部分情况会借助云端,截图会上传,本地记忆也未加密,上传比例和...

推荐理由:我会先打个折:这只是研究预览,功能边界和隐私细节都还模糊。但钩子够狠——Codex 开始读屏幕而不是等你喂上下文,等于把 agent 的记忆层从“你告诉它”推到“它自己看”。正文没披露云端辅助的具体触发条件和数据留存策略,这点先别太激动。对从业者来说,真正值得盯的是屏幕状态变成持续输入后,工作流设计和安全边界要怎么重画。

新智元 · 公众号

华为发布 Pura X Max,首发小艺伴随式 AI,能跨 App 读屏、记待办

华为在 4 月 20 日发布了 Pura X Max,同时推出鸿蒙 6.1 上的小艺伴随式 AI。调用方式有两种:双击导航条或语音唤醒。它能在你同意后读取屏幕内容,把不同 App 里的任务收进日历,还能直接联动高德地图和滴滴。核心卖点是系统级的跨应用操作和常驻侧边栏交互。正文没提价格、具体机型参数和覆盖范围,所以实际体验和稳定性还得等上手再看。

推荐理由:我会先打个折:正文没给价格、模型参数和适配覆盖率,所以只放在 featured 而不是更高。但 HKR 三条全中——常驻读屏助手这个钩子够强,操作流程和隐私开关写得明白,而且它踩中了 OS 级 agent 可能改写移动平台规则的那个点。

FT · 科技

Anthropic 和亚马逊谈了个 1000 亿美元的算力基建大单

Anthropic 跟亚马逊达成了一项总规模 1000 亿美元的 AI 基础设施协议,核心是锁定芯片和算力供应。今年 Anthropic 出过几次服务中断,这次合作主要是为了把计算容量提前占住,而不是普通的战略合作。不过正文被付费墙挡住了,具体的合同期限、钱怎么付、芯片从哪来、交付规模这些关键信息都没披露。

推荐理由:FT 报了一条 Anthropic 与 Amazon 的 1000 亿美元 AI 基础设施协议,金额大到今天必须写。H 端靠千亿数字和算力绑定撑起点击欲;K 端有新事实,但期限、资金来源、芯片来源、交付规模全都没披露,我会先打个折;R 端踩中了模型厂对云和硬件的依赖这个活神经,不是空泛合作,是把供给瓶颈写进了合同。

Computing Life · Share · 鸭哥调研

SpaceX 给 Cursor 开了两张牌:600 亿收购或 100 亿合作,但人已经先走了

SpaceX 宣布可以在年内用 600 亿美元买下 Cursor 母公司 Anysphere,或者支付 100 亿美元换技术合作。600 亿比 Cursor 正在谈的 500 亿独立融资估值高约 20%,但正文没披露是现金还是股票,考虑到 SpaceX 现金储备不够,用股票支付的话实际到手价值会打折。100 亿合作的实质是 xAI 用自家 Coloss...

推荐理由:这篇我会先打个折:支付形式没披露,最终走哪条路也还没定,所以不能给 P1。但它的钩子很强——600 亿收购 vs 100 亿合作,数字对比本身就让人想点开。正文补了几个关键事实:报价比 Cursor 当前估值高 20%,训练用的是 xAI 的 Colossus 集群,而且 xAI 已经在 3 月挖走两名工程负责人。这些信息拼在一起,指向一个更值得盯的趋势:科技圈正在从买公司转向买人,如果最后落到 100 亿合作,普通员工未必能跟着喝汤。对 AI 从业者来说,这比单纯的收购新闻更有判断价值。

X · @claudeai

Claude 的 Cowork 模式现在能直接生成可实时刷新的仪表盘和追踪器,数据来自你绑定的应用和文件

Claude 在 Cowork 里新增了一个能力:生成“活的”小组件,比如仪表盘或进度追踪器。这些组件不是静态截图,每次打开都会自动拉取最新数据。官方说数据源可以是你连上的应用和文件,但具体支持哪些应用、文件类型以及权限怎么管,正文都没提。我会先打个折,等看到实际集成列表再判断实用性。

推荐理由:HKR 三项全中:钩子是能连应用和文件的 live artifacts,每次打开自动刷新。这是 Claude 工作流能力的一次实在升级,天然有 Claude 热度加成。但公告没写清楚连接器范围、权限模型和推送节奏,信息缺口明显,所以我会先打个折,放在 78 分,不进 p1。

X · @AnthropicAI

Anthropic 跟亚马逊扩大合作,给 Claude 锁定了最多 5 吉瓦的算力

Anthropic 宣布加深与亚马逊的合作,为训练和部署 Claude 锁定了最高 5 吉瓦的算力。这批算力从这个季度开始陆续到位,到 2026 年底预计先上线近 1 吉瓦。5 吉瓦是个什么概念?大概相当于几个大型数据中心的满负荷运转,说明他们接下来要把模型规模或服务量再往上拉一个台阶。不过正文没披露合同金额、具体用什么芯片、数据中心建在哪,所以实际成...

推荐理由:标题里的 5 吉瓦别直接信,那是远期上限,真正有谱的是今年底先到 1 吉瓦。正文没提合同金额、用什么芯片、数据中心在哪,所以成本结构和实际性能都还是问号。我会先打个折看交付节奏,但能在这个时间点锁产能,对 Anthropic 的训练和部署确实是颗定心丸。

The Verge · AI

Epic 给《堡垒之夜》创作者发了 AI 角色工具,但明令禁止和 NPC 谈恋爱

Epic 在《堡垒之夜》里上线了一个叫“对话”的工具,让创作者可以把自己岛上的 NPC 变成能自由聊天的 AI 角色。创作者用提示词设定角色的人设、知识范围、行为和声音,玩家就能跟 NPC 进行不按剧本走的对话。标题特意警告“别想和 AI 约会”,但正文没具体说防越狱和内容审核机制到底怎么做的。去年 Epic 在游戏里试水过 AI 版达斯·维达,结果角...

推荐理由:Epic 给 Fortnite 创作者发了个新工具,能让岛上的 NPC 跟玩家自由聊天,用提示词定人设、知识和行为,还能选语音。标题特意警告别拿来搞约会对象,但正文没写具体怎么审核、什么话不能说,也没提成本和用的哪家模型。我会先打个折:可控性才是重点,不是“会聊天”本身。

4月20日星期一

r/LocalLLaMA

用免费 Colab T4 和 Mac 给苹果端侧 3B 模型训练 LoRA 适配器

作者搭了一套 QLoRA 流程来微调苹果那个跑在手机上的 3B 模型,把显存需求从大约 24GB 压到 1GB 内存加 5GB 显存,免费版 Colab T4 或者一台 24GB 内存的 Mac 就能跑。帖子说 A100 跑 LoRA、T4 跑 QLoRA、Mac 跑 QLoRA 训出来的适配器效果差不多,都能把准确率从 40% 左右拉到 75%,如果...

推荐理由:一篇带名字的第一手实验,内存和准确率数字可复现,HKR 三项全中,比普通教程贴强。分数没上 85 是因为来源只是单篇 Reddit 帖子,权威性有限,跑分范围也窄。

r/LocalLLaMA

Reddit 网友拿 9 个模型做功能规划对比,Claude Opus 4.6 生成的规格书最贵也最详细

一位 Reddit 用户让 9 个模型给一款 Go 语言记账 App 设计“负载追踪”功能,再用 Claude Code 给生成的规格文档打分排名。Claude Opus 4.6 排第一,产出一份 19KB 的规格书,过程中读了 44 次代码,花了 2.47 美元;GLM 5.1 排第二,Qwen 3.6 35B fp8+vLLM 排第三。作者自己强调...

推荐理由:这是一次有名有姓的个人实测,给出了真实工作流里的数据,所以 H、K、R 三项都站得住。但天花板不高:只测了一个功能、排名由 Claude Code 自己打分、正文没提人工验收结果,我会先打个折,放在 featured 里偏低的位置。

r/LocalLLaMA

TRELLIS.2 图片转 3D 模型现在能在苹果芯片 Mac 上跑了,不用 NVIDIA 显卡

有开发者把微软的 TRELLIS.2 移植到了 Apple Silicon 上,用一张照片就能生成约 40 万个顶点的 3D 网格。在 24GB 内存的 M4 Pro 上跑一次大概 3 分半钟,其中贴图烘焙只要 18 秒。这次移植把原来五个依赖 CUDA 的扩展换成了 PyTorch MPS 和自定义后端,不再需要 NVIDIA 显卡或云端算力。不过正...

推荐理由:这是社区移植,不是微软官方发布,但三个点都站得住:不用 NVIDIA 就能在 Mac 上做图生 3D,给了 M4 Pro 24GB 的具体跑分,而且重写 5 个 CUDA 扩展这件事本身就说明工作量。来源是 Reddit 帖子,权威性一般,但信息够具体,先按 featured 处理。

机器之心 · 公众号

Anthropic 编程智能体负责人讲 vibe coding 的正确姿势:2 周变 1 天,但别让 AI 碰核心逻辑

Anthropic 研究员 Erik Schluntz 分享了他团队用 Claude 写代码的真实工作流。他们最近合并了一个 2.2 万行的生产环境改动,大部分代码由 Claude 生成,把原本两周的工作压缩到了一天。他的做法是先花 15-20 分钟让 AI 通读代码仓库、做规划,然后只让 AI 改叶子节点(也就是依赖最少、影响范围最小的模块),核心逻...

推荐理由:这是一篇来自 Anthropic 内部的实战经验,不是泛泛而谈。有 22000 行生产合并、两周变一天的硬数字,也有可复用的流程规则,比如先让模型花 15 到 20 分钟探索代码库再动手、改动锁在叶子节点、核心路径必须人审。对正在纠结怎么把 coding agent 放进真实流水线的团队来说,参考价值很高。保持 featured 不升 p1,因为它本质是实践课,不是模型或产品重大发布。

r/LocalLLaMA

用本地 Qwen3.6 给 Claude Code 当副手,每次任务省下 30 倍 Opus token

一位 Reddit 用户把 Qwen3.6 通过 LM Studio 接成 Claude Code 的 subagent,让本地模型干提取和审计的粗活,Claude 只做最后决策。在两个审计任务里,Opus 的边际 token 消耗降了约 30 倍:一个 23 个文件的路由审计从 1.3 万 token 降到 400 token,一个 18 个文件的 ...

推荐理由:一个 Reddit 用户拿自己的两台机器做了两组任务对比,数字很直接:23 个路由文件审计从 13k token 降到 0.4k,18 个 Astro 文件盘点从 89k 降到 3k,省了约 30 倍 Opus token。机制是把提取、盘点、审计这类工作交给本地 LM Studio 跑的 Qwen 子代理,Claude Code 只做调度。正文没藏着掖着,承认 Qwen 和 Opus 各有漏检,不是单方面碾压。我会先打个折:只有两个任务、一个人跑、没大规模验证,但思路和数字对想省 Opus 费用的人有直接参考价值。

Hacker News 首页

TRELLIS.2 图生 3D 模型现在能在 Mac 上跑了,不用 Nvidia 显卡

开发者 shivampkumar 把微软那个 40 亿参数的 TRELLIS.2 模型移植到了苹果芯片上,靠 PyTorch 的 MPS 后端驱动,一张图就能生成 3D 模型。他把原本依赖 Nvidia 硬件的 flash_attn、nvdiffrast 和自定义稀疏卷积算子全换成了纯 PyTorch 实现,包括稀疏 3D 卷积、SDPA 注意力机制和...

推荐理由:这不是微软官方模型发布,而是一个可复现的本地移植,对实际干活的人有参考价值。我会先打个折:3.5 分钟生成一个网格不算快,但考虑到不用联网、不用 Nvidia,这个结果挺实在。正文把替换掉的组件和替代方案都列清楚了,信息量够,所以放在 featured 而不是 p1。

The Verge · AI

Vercel 被黑,攻击入口是一个被黑的第三方 AI 工具

Vercel 确认发生了一起安全事件,影响了一小部分客户。黑客正在兜售窃取的数据,泄露信息包括员工姓名、邮箱和活动时间戳。Vercel 说攻击路径是一个被黑的第三方 AI 工具,但没说是哪家供应商,也没公布具体受影响的范围。

推荐理由:我会先打个折:Vercel 没说是哪家 AI 工具,也没说多少客户被波及,所以别急着下结论。但这事值得上推荐,因为攻击路径从“偷账号”变成了“供应链的 AI 工具被攻破”,对正在接 AI 的团队是个实打实的提醒。泄露字段具体,有姓名、邮箱和时间戳,不是空泛的“数据泄露”。黑客 ShinyHunters 在卖数据,可信度又加一层。唯一缺的是供应商名字和影响面,正文没披露,所以只能给 featured 低位,不能更高。

4月19日星期日

量子位 · 公众号

马斯克在抖音卖老干妈?其实是 OpenAI 新模型生成的假图

这篇文章展示了用 OpenAI GPT Image 2 生成的几张假图,包括“马斯克抖音直播卖老干妈”和“GTA-6 联动海报”,画面里还伪造了 10 万+ 的在线观看人数。文章说 Image 2 现在能画出很逼真的海报、游戏截图,还能在图上写出可读的长文字,背后可能用了类似 Codex 的界面生成流程。但正文没提这个模型的定价、推送范围和具体上线时间...

推荐理由:HKR 三项全中:钩子够抓人,能力展示很具体,信任崩塌这个点从业者都会关心。没给 p1 是因为正文没披露开放范围、价格和正式发布时间,信息有缺口,我会先打个折。

r/LocalLLaMA

实测 8 个模型当桌游主持人:27B 小模型叙事质量干翻了 405B 巨无霸

作者用 6 个固定跑团场景测了 8 个模型,让它们当桌游主持人。评分用了 8 项自动指标加 3 个 LLM 裁判打分,整轮测试只花了约 0.02 美元。最终 google/gemma-3-27b-it 以 4.33 的综合叙事分排第一。标题说 27B 赢了 405B,但正文被屏蔽了,没披露那个 405B 具体是哪个模型,也没给出完整排名。这点先别太激动...

推荐理由:这篇来自 Reddit 的个人评测,钩子够锋利——小模型在叙事质量上干翻大模型,HKR 三项全中。我把它留在 featured 而不是更高,是因为正文截断了,405B 具体是哪个模型、完整排名都没给出来,信息有缺口,先别太激动。

r/LocalLLaMA

拆解 LangGraph 的 Pregel 执行模型、检查点内部机制和 DeepAgents

这篇帖子把 LangGraph 拆开看,它本质上是对 Pregel 运行时的一层高级封装,核心就三个东西:PregelNode(执行节点)、channel(节点间传数据的通道)和 reducer(定义数据怎么合并)。帖子提到用四张 Postgres 表存检查点,执行流程是 Plan → Execute → Update 的 superstep 循环,c...

推荐理由:这篇文章不是 API 教程,而是把 LangGraph 的并行执行、检查点写放大和子图边界放到同一个 Pregel 运行时模型里看,对做 agent 的人有实操参考价值。正文没给基准测试或生产案例,所以分数没往上拉。

4月18日星期六

量子位 · 公众号

OpenClaw 的坑已经踩进奶茶店了

古茗和银泰百货拿 OpenClaw 做测试,踩了 5 个部署的雷:默认端口 18789 直接暴露、至少 8% 的 Skill 是恶意插件、权限越界、一次跑飞吃掉 20 多分钟 token、旧系统防护太弱。实际出过的事包括 agent 把正常堡垒机端口关了导致运维被锁在外面,还有 agent 申请麦克风这种不相关的权限。真正的问题不是聊天体验,而是 ag...

推荐理由:这篇不是泛泛的 AI 安全评论,而是用古茗和银泰的实际测试,列出了 5 类可验证的落地风险和一个真实运维事故。我会先打个折:目前只是个案级别的测试结果,没有官方修复方案,也没有大规模影响或多家交叉验证,所以到不了 P1。但 H、K、R 三项都站得住——事故有钩子、细节可复现、痛点够深,给 featured 没问题。