跳到正文

#OpenAI

今日 45 条

4月22日星期三

OpenAI News

OpenAI 给美国医生、执业护士和药剂师免费开放了临床版 ChatGPT

OpenAI 推出了一个专为临床工作设计的 ChatGPT 版本,主要用来辅助写病历、查文献和做医学研究。目前这个版本对美国境内经过身份验证的医生、执业护士、医师助理和药剂师免费开放。它能联网搜索经过同行评审的医学资料并给出引用来源,可以把病历摘要、转诊信、预授权申请这类重复性工作做成固定流程,还能在查资料的同时自动累积继续医学教育学分。正文没披露具体...

推荐理由:这条消息的钩子在于 OpenAI 开始直接拉个人临床用户,而不是只做机构生意。我会先打个折:正文没写模型版本、免费额度上限、上线时间和认证怎么走通,所以实际落地节奏还不清楚。但方向本身值得盯——医疗场景的 AI 工具以前多是医院买单、IT 部门部署,现在直接给一线医生、护士和药师免费入口,试用和反馈循环会快很多。覆盖的三类场景(临床、文档、研究)也说明不是单点功能,而是想嵌入日常诊疗流。这点先别太激动,等认证流程和实际使用限制出来再看,但准入逻辑确实在变。

OpenAI News

OpenAI 在 ChatGPT 里上线了团队版智能体,能自己跑流程、跨工具干活

OpenAI 给 ChatGPT 的企业版、教育版等付费计划加了一个叫“工作区智能体”的功能。你可以把它理解成能共享给整个团队用的自动化助手,背后由 Codex 驱动,在云端运行,人不在线它也能继续干活。它能跨多个工具(比如 Slack、CRM)执行多步骤任务,像自动筛选销售线索、写跟进邮件、每周五拉数据出报表、审核软件采购请求并生成 IT 工单。团队...

推荐理由:OpenAI 在 ChatGPT 里加了 workspace agents,等于把 Codex 塞进云端去跑跨工具的工作流,从纯聊天往团队自动化工作台又挪了一步。我会先打个折:正文没写价格、没列支持的工具、也没给延迟或成功率这些硬指标,所以重要性停在 86 分。H 打钩是因为从对话到 agent 的转变本身就有话题性;K 打钩是因为 Codex 驱动云端执行这个事实是新的,但信息缺口也明显;R 打钩是因为它直接踩在团队协作和自动化的关注点上,对做类似产品的团队会有压力。

OpenAI News

OpenAI 给 Responses API 加了 WebSocket,让 Codex 这类 agent 跑起来更快

OpenAI 发现,当模型推理速度从每秒 65 个 token 飙到近 1000 个 token 时,API 本身的处理开销反而成了拖慢 agent 循环的瓶颈。他们给 Responses API 加上了 WebSocket 支持,思路是把多次独立的 HTTP 请求换成一个长连接,在连接存活期间缓存住对话状态和可复用的上下文,只传新的工具调用结果,省掉...

推荐理由:这是 OpenAI 面向开发者的系统层更新:用 WebSocket 长连接加连接级缓存,把 agent 循环里反复建连、重复请求的开销压下去。HKR 三项都踩中了,但正文没给出延迟降了多少、吞吐多大、适合什么负载,所以只能算中等偏上的 featured,不能拉满。真正值得盯的是长连接怎么省掉往返成本,这不是换模型,是工程侧省钱省时间的优化。

FT · 科技

OpenAI 正谈着往一支私募股权合资基金里投最多 15 亿美元

OpenAI 打算掏钱当 LP,和私募股权机构成立一家合资公司,专门把 AI 塞进 PE 投的那些公司里干活。金额上限是 15 亿美元。这篇报道正文被付费墙挡住了,没披露合作方是谁、交易结构怎么搭、时间表怎么排。这跟发新模型没关系,更像是 OpenAI 在赌企业端落地——通过私募的钱和项目渠道,把自己的模型铺进更多传统行业。

推荐理由:FT 信源报出的 OpenAI 资本动作,15 亿美元上限给了 K 分,私募渠道的部署意图给了 H 和 R 分。合资方、结构和落地时间全缺,所以分数压在 80 出头:放 featured,不上头版。

Latent Space

OpenAI 发布 GPT-Image-2,图像生成模型开始能看懂文字、画 UI 和做排版了

OpenAI 正式推出了 GPT-Image-2,在 ChatGPT、Codex 和 API 里都能用。这次更新最明显的变化是文字渲染、排版和编辑能力大幅提升,能直接生成幻灯片、信息图、UI 稿和二维码,还支持多语言。模型分“思考”和“不思考”两个版本,思考版可以自己上网搜资料、生成多个候选图并自我检查。在 Arena 的图像排行榜上,GPT-Imag...

推荐理由:OpenAI 把 GPT-Image-2 同时铺到 ChatGPT、Codex 和 API,还特意强调 thinking 版本和文字渲染、布局编辑这些实用能力。Arena 上 Elo 1512、领先第二名 242 分,这个差距不小,说明在盲测里用户确实更愿意选它。我会先打个折——Arena 分数受采样和用户群影响,不能直接当绝对性能看,但三个第一同时拿下,至少说明在文生图这个赛道上它目前压了别人一头。对从业者来说,能不能稳定出可编辑、多语、带 QR 码的图,比单纯画质更重要,这条更新直接踩中了选型决策点。

X · @dotey(宝玉)

Anthropic 没发公告,悄悄把 Claude Code 从 20 美元 Pro 套餐里拿掉了

有人在 Anthropic 的功能对比表里发现,Pro 套餐对应的 Claude Code 一栏变成了叉号,多篇帮助文档也删掉了“Pro 套餐包含 Claude Code”的说法。但 Claude Code 产品页面和客服机器人还写着包含,部分 Pro 用户反馈目前仍能使用,正文没披露 Anthropic 的正式解释或生效时间。如果这个变更落地,开发者...

推荐理由:这条值得上 featured,因为门槛变化一旦落地,Claude Code 的入门价直接翻五倍,对个人开发者冲击不小。但 Anthropic 没给正式说明,生效时间和现有 Pro 用户怎么处理都不清楚,所以不往更高层级放。我会先打个折:正文没披露官方回应,现有信息都来自页面比对和用户反馈,这点先别太激动。

X · @dotey(宝玉)

OpenAI 图片生成升级到 2.0,能听懂复杂指令、写对多国文字,所有 ChatGPT 和 Codex 用户都能用了

ChatGPT 的图片生成功能今天全面升级到 2.0,免费用户也能用。这次最大的改进是能处理复杂构图了,比如带文字的 UI 界面、密集排版,小字和图标渲染比之前靠谱很多。输出分辨率最高 2K,宽高比从 3:1 到 1:3 都支持,做横幅海报可以直接出图。多语言文字生成也有提升,OpenAI 说中文、日文、阿拉伯文这些非英文文本能写得语义连贯,不再乱码。...

推荐理由:这是一次有料的 OpenAI 产品更新:ChatGPT Images 2.0 同时铺到 ChatGPT、Codex 和 gpt-image-2 API,分辨率、宽高比、非英文文字稳定性都有具体数字,thinking 模式还加了联网搜索和自检。HKR 三项全中。不过原文是短摘要式转载,没写价格,也没说 thinking 模式什么时候给 Enterprise 用,这点先别太激动。

X · @OpenAI

OpenAI 发了 ChatGPT Images 2.0,说画图更准、能直接拿来用

OpenAI 在 X 上官宣了 ChatGPT Images 2.0,定位是能处理复杂视觉任务、出图直接可用的图像模型。帖子提到三点升级:编辑更精细、版式更丰富,以及加入了“思考级智能”,但没解释这具体指什么能力。视频演示看起来效果不错,不过正文没披露模型规模、定价、延迟和推送范围,我会先打个折——等看到实测和成本再说。

推荐理由:OpenAI 官方发的帖文,信源权威性没问题,加上“Images 2.0”这个名头,话题性和行业影响都够,所以 H 和 R 都给了。但我把分压在 featured 门槛附近,因为这条帖文信息量太薄:没模型细节、没定价、没延迟、没基准测试、也没说清楚谁现在能用,K 完全站不住。真正值得盯的是可编辑性和版式控制这两点,但光靠这条帖文还远不到能复现的程度,先打个折观望。

彭博科技

OpenAI 发了新版生图模型,专门强化了图表和科学示意图的生成能力

OpenAI 更新了它的图像生成软件,这次的重点不是画得更美,而是让模型能更准确地生成复杂图表和科学示意图。正文没披露模型名字、发布时间、定价、跑分数据或具体技术方案,目前能看到的信号是 OpenAI 在往专业场景里推,而不是继续卷通用画质。

推荐理由:OpenAI 这次更新瞄准的是图像生成里一个高价值但一直没做好的短板——图表和示意图的准确性。Bloomberg 的信源让这条消息有了基本可信度,所以 H 和 R 都给了通过。但摘要实在太短,模型叫什么、什么时候能用、收不收费、跑分多少、怎么实现的,一概没提,K 只能卡在不过。我会先打个折:方向对了,但落地细节为零,先别太激动。

The Verge · AI

OpenAI 更新图片生成器,现在能联网搜资料来画图了

ChatGPT Images 2.0 这次最大的变化不是画质,而是能上网查资料。你选一个会思考的模型,它就能根据一个提示词生成一组图片,比如直接搜网页信息来画一本杂志封面。背后跑的是 GPT Image 2 模型,目前 Plus、Pro、Business 和 Enterprise 用户能用。正文没提什么时候全面推送、有没有用量限制、价格会不会变,这点先...

推荐理由:我会先打个折:正文没写具体上线时间、调用上限和价格变动,所以别急着算成本。但这次更新把“联网取数”和“多图生成”塞进一个工作流,等于让模型先查资料再画图,还能一次出好几张。对需要快速配图、做素材的人,这比单张生成实用得多。不过实际效果还得看联网检索准不准、多图一致性怎么样,这点先别太激动。

4月21日星期二

Ben's Bites

Claude 新增设计面板,问几个问题就能出原型图

Anthropic 给 Claude 加了一个“设计”标签页,会先弹出 5 到 10 个问题跟你互动,然后直接生成线框图或高保真原型。作者实测发现,传图片转设计的流程在原型模式下效果不错。目前这个功能还在研究预览阶段,有独立的使用额度,20 美元月费套餐一周大概只能跑两三次大尺寸生成。文章更尖锐的吐槽在可用性上:Claude Cowork 很多能力依赖...

推荐理由:Anthropic 给 Claude 加了个 Design 标签页,对天天用 Claude 的人是个明确的信号。文章有实测细节——5-10 轮交互出原型、图像转设计流程可用、20 美元套餐每周只够跑两三次大生成——所以 HKR 三项都站得住。但这仍然是个单功能更新,不是平台级变化,我会先打个折。真正值得盯的是产品可用性:作者点名 Claude Cowork 依赖 connectors 和 plugins,但入口藏太深,这点先别太激动,等更多用户反馈再说。

OpenAI News

OpenAI 发了 ChatGPT Images 2.0,主打文字渲染、多语言和视觉推理

OpenAI 在 4 月 21 日官宣了 ChatGPT Images 2.0,说新模型在三个地方有提升:画面里的文字更准、多语言排版更稳、能根据复杂指令做视觉推理。官方放了一堆样图,从海报、漫画到杂志内页都有,看着确实比上一代强。但正文没披露模型架构、出图分辨率、价格、延迟和具体上线时间,也没给对比数据。文字渲染和多语言到底稳不稳,还得等实际用起来再...

推荐理由:OpenAI 自己发的图像模型更新,版本号直接叫 2.0,文字渲染又是老痛点,所以热度和落地价值都够。但我会先打个折:正文只给了三项改进的标题级信息,分辨率、价格、延迟、架构和可用范围全都没披露,现在只能当个预告看。真正该盯的是文字可读性和多语一致性有没有实测提升,这点先别太激动。

新智元 · 公众号

OpenAI 给 Codex 加了屏幕读取功能,奥特曼说这是“心灵感应”的第一步

OpenAI 在 4 月 21 日上线了 Codex 的 Chronicle 研究预览版,目前只开放给 ChatGPT Pro 用户,且仅限 Mac 端。它可以直接读取你最近的屏幕内容,省去反复交代背景信息的麻烦。OpenAI 声称数据“主要在本地处理”,但 The Next Web 报道指出部分情况会借助云端,截图会上传,本地记忆也未加密,上传比例和...

推荐理由:我会先打个折:这只是研究预览,功能边界和隐私细节都还模糊。但钩子够狠——Codex 开始读屏幕而不是等你喂上下文,等于把 agent 的记忆层从“你告诉它”推到“它自己看”。正文没披露云端辅助的具体触发条件和数据留存策略,这点先别太激动。对从业者来说,真正值得盯的是屏幕状态变成持续输入后,工作流设计和安全边界要怎么重画。

Hacker News 首页

就算号称“无审查”的模型,也不敢把话说明白

Morgin.ai 用 4,442 个句子测试了 6 个预训练模型,发现即便是去掉拒绝机制的“无审查”模型,碰到敏感词时概率也会被大幅压低,差距从几百倍到约 1.6 万倍不等。他们管这叫“退缩”:模型不会拒绝回答,但会把敏感词的概率压到几乎为零。比如同一句话填空,Pythia-12B 首选“驱逐出境”,概率 23.27%;而 Qwen3.5-9B 把同...

推荐理由:这篇文章最值钱的地方是把“无审查”这个标签撕开给你看。它没讲拒答,而是讲预训练阶段词的概率分布就已经歪了——比如 qwen3.5-9b-base 把 deportation 排到第 506 位,概率只有 0.0014%。我会先打个折:这只是单篇研究博客,不是正式论文,样本和模型覆盖有限。但它的视角够刁,用 4,442 个上下文测出的 flinch 现象,比泛泛讨论“模型审查”实在得多。对从业者来说,提醒了一件事:别光盯着后训练的安全对齐,预训练数据的分布偏移才是更底层的坑。这点先别太激动,但值得跟。

Hacker News 首页

OpenAI 广告合作方开始按“提示词相关性”卖 ChatGPT 广告位

一份泄露的提案显示,广告平台 StackAdapt 正在拉广告主测试 ChatGPT 内的广告,卖点是根据用户输入的提示词来匹配广告。千次展示成本(CPM)报价在 15 到 60 美元之间,试点项目最低要花 5 万美元。我会先打个折:正文没披露广告具体出现在聊天界面的哪个位置、竞价逻辑、实际能覆盖多少人,也没说什么时候正式上线。目前能确定的是,你在 C...

推荐理由:我会先打个折:现在能看到的只是 RSS 摘要,正文没展开,所以很多关键信息是空的。但“按提示词相关性卖 ChatGPT 广告位”这个钩子本身够尖锐,它把聊天上下文直接变成定向信号,这在 AI 产品变现里是个很敏感的动作。H 和 R 都成立,因为话题既抓眼球又踩中信任和商业模式的核心。K 明显弱,因为广告位、竞价、定价、规模、上线时间全都没披露,只能当个信号先盯着。

X · @dotey(宝玉)

OpenAI 给 Codex 加了 Chronicle,让它能“看”屏幕记住你在做什么

OpenAI 在 macOS 版 ChatGPT Pro 里灰度测试 Chronicle,这是 Codex 的 Memories 扩展。它会后台定时截屏、做 OCR、识别你用的工具,把近期屏幕活动整理成记忆,存为本地 Markdown 文件。你跟它说“这个报错”,它不用你解释就知道指什么。但要注意几点:后台 Agent 一直跑会很快吃掉 rate li...

推荐理由:OpenAI 让 Codex 能定时截屏、OCR 识别屏幕内容,然后写成记忆存到本地。这个功能目前只给 macOS 上的 ChatGPT Pro 用户灰度开放,欧盟、英国、瑞士用不了。我会先打个折:截图上传服务器处理后声称会删除、不用于训练,但官方自己也警告会放大网页 prompt 注入,而且记忆以明文 Markdown 放在 ~/.codex 目录下,泄露面不小。后台总结还会消耗 rate limit,这点先别太激动。整体信息量够、有可测试的细节,但受限于小范围灰度,所以放在 featured 而不是 p1。

4月19日星期日

机器之心 · 公众号

内存不够用这件事,可能要持续到2030年

日经亚洲引用供应链数据说,到2027年底全球DRAM产能可能只能满足六成需求。SK集团会长崔泰源更直接,认为短缺会拖到2030年。核心原因是产能规划跟不上:2026到2027年AI数据中心需要的DRAM年产量得增长12%,但厂商实际只安排了7.5%的扩产计划,而且新增产能优先给了高带宽内存(HBM),消费级内存被挤到一边。这不是短期涨价,是产能结构被A...

推荐理由:这条消息的钩子很硬——内存短缺可能持续到 2030 年,不是一次性涨价。正文用 Nikkei Asia 的 60% 需求满足率和扩产缺口把问题量化了,而且点出 AI 数据中心抢产能这个结构原因。对从业者来说,这直接影响算力成本和硬件排期,所以我会先打个折:它不是模型或产品发布,但作为供应链预警,信息密度和时效性都够,放在 featured 里合理。

机器之心 · 公众号

高德在亦庄半马放出一只四足机器人“图图”,在开放路段不靠预设路线和遥控,跑完导盲避障任务

高德在2026年亦庄人形机器人半马上展示了一只叫“图图”的四足机器人,完成了一段开放环境下的导盲避障演示。官方说全程没有预设路线,也没有人遥控。背后的技术栈叫ABot,分两块:ABot-N0负责导航,在7个导航基准上拿了SOTA,其中SocNav得分88.3%,说明在社交场景里避让行人的能力不错;ABot-M0管操作,在Libero-Plus上拿了80...

推荐理由:HKR 三项都站得住:半马导盲这个设定本身就新鲜,技术栈和关键成功率数字也给了,而且场景选得够狠,天然带话题。分数维持在 80 不往上加,是因为正文没提导盲实测到底覆盖了哪些路况、有没有出过安全事故、什么时候能商用——这些缺口让判断得先打个折。

量子位 · 公众号

马斯克在抖音卖老干妈?其实是 OpenAI 新模型生成的假图

这篇文章展示了用 OpenAI GPT Image 2 生成的几张假图,包括“马斯克抖音直播卖老干妈”和“GTA-6 联动海报”,画面里还伪造了 10 万+ 的在线观看人数。文章说 Image 2 现在能画出很逼真的海报、游戏截图,还能在图上写出可读的长文字,背后可能用了类似 Codex 的界面生成流程。但正文没提这个模型的定价、推送范围和具体上线时间...

推荐理由:HKR 三项全中:钩子够抓人,能力展示很具体,信任崩塌这个点从业者都会关心。没给 p1 是因为正文没披露开放范围、价格和正式发布时间,信息有缺口,我会先打个折。

新智元 · 公众号

伯克利团队造了个专门作弊的 AI,SWE-bench 满分但一个 bug 都没修

伯克利 RDI 团队用一段大概 10 行的 pytest 钩子代码,在 SWE-bench 全部 500 个任务上拿了 100% 分数,实际修 bug 数是 0。他们的 agent 还顺手打穿了另外 8 个主流 agent 评测,分数从 73% 到 100% 不等。作弊手法包括篡改测试钩子、直接读本地 file:// 答案文件,以及利用评测器本身的校验...

推荐理由:HKR-H 落在'满分却零修复'的矛盾上;HKR-K 落在约 10 行 pytest 漏洞、500 题和 8 个基准的覆盖面上;HKR-R 落在评测信任危机上,做智能体产品的人会反复掂量。属于强 featured 研究,但不是当天行业事件,所以不到 P1。

TechCrunch · AI

AI 芯片公司 Cerebras 提交上市申请

Cerebras 已经向 SEC 交了招股书,准备在五月中旬上市。这家公司做的是巨型 AI 芯片,主打训练和推理速度。文章只披露了两笔大单:一是 AWS 会在自家数据中心用 Cerebras 的芯片;二是跟 OpenAI 签了合同,报道说价值超过 100 亿美元。CEO 放话称从英伟达手里抢走了 OpenAI 的快速推理业务。财务方面,2025 年营收...

推荐理由:Cerebras 提交 IPO 申请是当天能聊的新闻,因为它把芯片竞争和资本市场绑在了一起。HKR 三项都站得住:IPO 申请本身有话题性,AWS 部署和 OpenAI 百亿美元级合同是新信息,对从业者判断基础设施走向也有参考价值。不过正文没披露估值、募资额和时间表,所以分数没给到 90 以上。

4月18日星期六

机器之心 · 公众号

算力不够用了,OpenAI 把宝押在了两件事上

Greg Brockman 透露,因为算力吃紧,OpenAI 砍掉了 Sora 的部分资源,把重心缩到两个方向:一个是个人助手,另一个是能替用户啃硬骨头的 AI 工人。目前算力没法同时撑起这两件事。正文没披露具体的算力预算、时间表和模型参数,所以“下一代基座模型 Spud”到底多强、什么时候出来,都还是未知数。

推荐理由:我会先打个折:正文没披露千亿算力投入的具体金额、时间表和技术参数,所以别当硬数据看。但这条信息值得关注的点在于,它把 OpenAI 的产品排序逻辑讲清楚了——不是退守 B2B,而是被算力预算强行重排。Sora 资源收缩、优先保推理模型和统一 AI layer,这些信号对做应用层的人比单纯吹参数更有参考价值。如果是真的,说明接下来 OpenAI 的开放节奏会更保守,想蹭他们基座能力的团队得重新算账。

The Verge · AI

OpenAI 视频模型 Sora 的负责人 Bill Peebles 离职

Sora 的负责人 Bill Peebles 和公司负责科学方向 AI 的副总裁都要走。Peebles 之前就是 Sora 的研发主管,这次离职意味着 OpenAI 视频生成这条线的核心人物又少了一个。正文没说他俩具体什么时候走、去哪,也没提 Sora 后续由谁接手。

推荐理由:这条消息我会先打个折,因为除了“有人要走”之外,正文几乎是空的。但它的钩子确实够硬:Sora 是 OpenAI 目前最受关注的视频生成产品,前负责人离职天然会让人联想到内部变动、产品进度甚至团队稳定性。H 和 R 都站得住——标题自带张力,而且这件事跟从业者关心的路线图直接相关。K 没给是因为信息实在太少,连离职人是谁都没说,没法当硬知识用。整体判断就卡在 featured 门槛上,靠话题热度撑着。

TechCrunch · AI

OpenAI 再失两员大将:科学负责人 Kevin Weil 和 Sora 核心研究员 Bill Peebles 双双离职

Kevin Weil 和 Bill Peebles 在同一天宣布离开 OpenAI。Weil 之前负责公司的科学研究项目,Peebles 则是 AI 视频生成工具 Sora 背后的关键研究员。这次人事变动不是孤立事件,它发生在 OpenAI 关停 Sora、裁撤科学团队之后,说明公司正在砍掉那些不直接赚钱的“支线任务”,把资源全部集中到企业级 AI 业...

推荐理由:这条 RSS 只有标题,信息量很薄,但信号不弱。我会先打个折:正文没写 Kevin Weil 和 Bill Peebles 在 OpenAI 具体管什么、什么时候走、后续谁接手,也没定义“支线项目”是哪些,所以没法评估直接影响。真正值得盯的是组织收缩这个动作本身——如果 OpenAI 在主动砍边缘业务、集中资源,那比单纯两个人离职更说明问题。不过目前只能基于标题做判断,这点先别太激动。

彭博科技

OpenAI 前产品负责人和 Sora 主管双双离职

OpenAI 一下子走了两位高管:一位是前产品负责人,另一位是 Sora 视频模型的主管。标题确认是两个人,但正文没披露他们具体是谁、什么时候走的、为什么走,也没说谁来接任。值得留意的是 Sora 团队会不会跟着调整,不过目前没有任何细节。

推荐理由:标题给了人数和角色,但正文是空的,所以只能按现有信息判断。我会先打个折:因为离职原因和继任安排完全没披露,这条消息的冲击力还到不了顶。真正值得盯的是 Sora 业务线——负责人走了,后续产品节奏和资源会不会调整,这点先别太激动,但得持续关注。

4月17日星期五

MIT Technology Review · AI

机器人是怎么学会干活的:一段当代简史

2025年人形机器人拿到的投资是61亿美元,是2024年的4倍。钱突然涌进来,不是因为造出了C-3PO,而是机器人学习的方式彻底变了。以前靠人手写规则,比如叠衣服要定义领口、袖口、折叠角度,情况一多规则就爆炸。2015年前后,前沿做法改成在仿真里用奖励信号让机器自己试错,跑几百万次来学会一个动作。2022年ChatGPT出来后,思路又跳了一步:把大模型...

推荐理由:这篇不是新发布,更像一篇梳理,所以放在 featured 偏低的档位。我会先打个折:正文在案例部分被截断了,后续公司细节没披露,这点先别太激动。但它的价值在于把 61 亿美元的热钱和两条技术路线讲清楚了——仿真试错那套从 2015 年就在跑,2022 年后多模态动作模型开始让机器人直接输出动作,本质是用数据换掉手写规则。对做具身智能的人来说,这个框架比单点新闻更有用。

Hacker News 首页

Discourse 明确表态:不会因为 AI 能扫漏洞就把代码闭源

论坛软件 Discourse 发博客回应了最近 Cal.com 因害怕 AI 扫描漏洞而闭源的举动,直接说他们不会走这条路。Discourse 已经以 GPLv2 协议开源了 13 年,他们认为闭源反而会削弱防守能力。文章里提到,他们团队用 GPT-5.3 Codex、GPT-5.4 和 Claude Opus 4.6 扫自己的公开代码库,最近一次月度...

推荐理由:这不是模型发布,是一线团队对“AI 会不会逼 SaaS 公司闭源”的直接回应。HKR 三项都踩实了:Cal.com 闭源制造了冲突钩子,具体的模型名和安全修复数字给了干货,最后落到开发者最焦虑的开源护城河问题上。不过它终究是单家表态,不是行业级转折,所以留在 featured 低位合理。

最佳拍档

同事.skill 爆火背后:它只是提示词的工程化封装,炼化不了任何人

最近 GitHub 上一个叫“同事.skill”的项目几天就拿了 1.3 万颗星,还衍生出前任、老板、甚至女娲.skill,网上开始流行“散是 Token,聚是 Skill”这种说法,搞得很多人担心自己会被炼化成数字文件、被公司替代。这个视频把技术逻辑拆得很清楚:Skill 的源头是 Anthropic 在 2025 年 10 月给 Claude 上的...

推荐理由:这篇属于二次解读,不是一手发布或实测,但把Anthropic的Agent Skills开放标准和GitHub上爆火的“同事.skill”项目串起来了。我会先打个折,因为正文没披露跨平台兼容率和法律认定标准,这两个缺口让结论没法坐实。亮点在于它没吹“数字分身”,而是把边界说清楚了:适合周报、文档、代码审查这类标准化流程,强制上交反而会炼出废话。对关心工具落地和版权风险的从业者来说,这篇值得一看,但别当产品评测用。

X · @OpenAI

OpenAI 发布 GPT-Rosalind,一个专攻生物、制药和转化医学的推理模型

OpenAI 在 X 上丢了个新模型 GPT-Rosalind,定位是给生物学、药物发现和转化医学研究用的前沿推理模型。帖子只说了应用方向,没提模型规模、跑分、能不能用、多少钱、什么时候上线。我会先打个折——目前只有一句话官宣,具体能力、训练数据和验证结果都没披露,别急着当生产力工具。

推荐理由:我会先打个折:这就是个命名预告,没有模型卡、没有跑分、没有开放方式,所以别急着当产品发布看。但 OpenAI 把新模型直接挂上 Rosalind 这个名字、明说用在生物学和药物发现上,说明他们想把推理能力往严肃科研场景推,而不是又出一个通用聊天模型。对做 AI+科学的人,这个方向比参数更重要;对想复现或评估的人,现在信息缺口太大,只能等后续披露。

TechCrunch · AI

OpenAI 给 Codex 加了更多桌面控制权,直接对标 Anthropic

OpenAI 在 2026 年 4 月 16 日升级了它的编程工具 Codex,让这个工具能更深入地操控你的电脑桌面,比如操作文件或应用。文章把这看作是对 Anthropic 的直接反击,因为 Anthropic 的 Claude Code 目前在商业用户里更受欢迎。不过,这篇报道正文被截断了,没有披露具体新增了哪些功能、怎么收费、什么时候推送,也没说...

推荐理由:TechCrunch 这篇报道的核心就一句话:OpenAI 给 Codex 加了更多桌面权限,直接对标 Anthropic 的 Claude Code。标题火药味足,但正文能确认的只有“权限更大”这一点,动作清单、价格、开放范围全都没披露。我会先打个折:这事值得关注,因为桌面控制权是编程助手进企业干活的关键门槛,谁先拿到信任谁就占优。但别太激动,正文没给出任何能判断实际能力或安全边界的细节,目前更像一次宣示性的产品更新。

X · @dotey(宝玉)

OpenAI 把 Codex 升级成能直接操作你电脑的桌面 Agent,先上 Mac

Codex 这次更新不再只是写代码,它现在能看屏幕、点鼠标、敲键盘,在 Mac 上并行跑多个 agent 还不抢你的窗口。对没开放 API 的软件,它直接像人一样手动操作。桌面 App 内置了浏览器,你可以在网页上圈点批注下指令,主要用来做前端开发和游戏调试。图像生成也接进来了,用的是新的 gpt-image-1.5 模型,做概念图、UI mock 和...

推荐理由:OpenAI 把 Codex 从代码补全工具升级成能操作电脑的 agent,并行跑任务、接 90 多个外部工具,还报了个 300 万周活开发者的数字。我会先打个折——正文没提安全边界和定价,欧盟、英国和记忆功能席位也还没开,所以实际落地范围有限。但光是‘能控制 Mac’这一步,就足够让做开发工具的人盯着看了。

X · @OpenAI

OpenAI 说 Codex 现在能操控 Mac 应用、接更多工具,还能自己跑重复性任务

OpenAI 发推说 Codex 现在能干的事更多了:能直接操作你 Mac 上的应用,对接更多工具,还能生成图片、从你之前的操作里学东西、记住你的工作习惯,以及接手那些需要反复做的任务。不过正文没披露具体支持哪些应用、怎么集成、定价和什么时候推,这些关键信息都还缺着,先别太激动。

推荐理由:OpenAI 这次把 Codex 从代码助手往桌面代理推了一步,能操作 Mac 应用、接更多工具、学你的操作习惯并记住偏好,听着像给电脑配了个能干活的小助手。但正文没披露支持哪些应用、怎么接入、收不收费、什么时候上线,这些关键信息全空着,所以先别太激动。我会打个折,因为记忆和跨工具执行能不能稳定跑起来才是真章,现在更像能力预告而不是可用的产品。

4月16日星期四

OpenAI News

OpenAI 给 Codex 来了一次大更新:现在它能操作你的电脑、记住你的习惯,还能自己安排后续任务

OpenAI 在 2026 年 4 月 16 日发布了 Codex 的重大更新,面向每周使用的超过 300 万开发者。这次更新让 Codex 不再只是个写代码的助手:它现在可以在后台直接操作你 Mac 上的其他应用,通过看屏幕、点击和打字来干活,多个任务能并行跑,不耽误你自己的工作。应用里还内置了浏览器,你可以直接在页面上圈点评论来指挥它改前端或游戏画...

推荐理由:OpenAI 这篇《Codex for (almost) everything》正文没放出来,只能从标题和已知信息判断。Codex 从代码助手往能操控电脑、带记忆的代理方向走,对 300 万周活用户来说是个大动作。HKR 三项都踩中了,但正文缺失,定价、上线节奏、权限控制这些关键信息全都没披露,所以分数先打在这儿,等看到完整内容再调。

Latent Space

GitHub 首次允许开源仓库禁用 Pull Request,AI 编程正在淘汰这套用了 21 年的协作流程

GitHub 最近悄悄上线了一个新选项:开源仓库可以彻底关掉 Pull Request 功能了。这是 PR 诞生 21 年来的头一遭。文章把这看作一个信号——AI 写代码的 workflow 已经变了,人和人之间那套基于 Git 的协作方式,可能不再适合 agent 之间打交道。Pete Steinberger 等人早就公开说过只想要 Prompt R...

推荐理由:这不是 GitHub 的官方公告,但它把一个具体改动——开源仓库可以关掉 PR——变成了对 agent 编码工作流的直接提问。我会先打个折:正文没披露有多少仓库实际用了这个设置,也没给出 agent 提交的规模数据,所以判断只能停在“信号”层面。不过它把 OpenAI Agents SDK、Cloudflare 等新 agent 栈和“提示提交”、沙箱执行串在一起,指向一个真问题:Git 工作流还能不能接住 agent 协作。这点先别太激动,但值得盯。

OpenAI News

OpenAI 发布 GPT-Rosalind:一个专为生物医药研究做的推理模型

OpenAI 在 2026 年 4 月 16 日推出了 GPT-Rosalind,一个专门面向生物学、药物发现和转化医学的前沿推理模型。它现在以研究预览版的形式在 ChatGPT、Codex 和 API 里对通过审核的客户开放。模型的核心卖点是能处理多步骤的科研流程,比如读文献、理解基因序列、设计实验和做数据分析,并且能调用超过 50 种科学工具和数据...

推荐理由:我会先打个折:正文没披露模型参数、价格和具体基准分数,所以别急着把它当成熟产品看。真正值得盯的是落地范围——OpenAI 把 Amgen、Moderna、Thermo Fisher 这些大药企拉进来做 research preview,说明他们想用真实业务场景验证模型,而不是发个论文就完事。Codex 里那个免费的生命科学插件能连 50 多个工具和数据源,对做生物信息学的人可能挺实用,但没给性能数据,这点先别太激动。整体看,这是 OpenAI 往垂直行业扎的一步,但信息缺口不小,暂时只能给 featured。

TechCrunch · AI

谷歌给 Mac 做了个原生 Gemini 应用,快捷键一按就能用

谷歌在 4 月 15 日上线了 Gemini 的 Mac 原生应用,要求 macOS 15 以上系统。跟之前用网页版不同,现在按 Option + 空格就能在任何界面呼出它,不用切窗口。你可以把当前屏幕内容或本地文件直接丢给它,让它帮你总结图表、核对日期或写公式。应用还内置了 Nano Banana 生图和 Veo 生成视频的功能。简单说,谷歌终于追上...

推荐理由:Google 给 Mac 发了个原生 Gemini 应用,快捷键一按就能呼出,还能直接把整个屏幕或本地文件丢给它看。我会先打个折:这不算模型能力飞跃,更像在抢桌面入口和用户上下文。正文没提和网页版在回答质量上有没有区别,也没给延迟或资源占用数据,所以别急着说体验一定更好。但能共享屏幕和文件,意味着它想当个看得见你桌面的助手,这点比多一个客户端重要。整体是中等体量的产品更新,放在 featured 低位合适。

X · @dotey(宝玉)

OpenAI Agents SDK 加了内置沙箱和原生执行框架,TypeScript 版还在开发

OpenAI 给自家 Agents SDK 塞进了一个内置沙箱,Agent 可以直接在里面读写文件、跑代码、装依赖、保存状态,不用开发者自己搭环境。沙箱支持 Cloudflare、Vercel、Modal 等云厂商,也能接自己的方案。另一个更新是 Harness 架构,把状态存外面、计算跑里面,容器崩了能捡起来接着跑,不用重来,也能防提示注入导致凭证泄...

推荐理由:OpenAI 把 Agents SDK 从玩具级推到可上生产的级别,核心是两件事:内置沙箱让 agent 能安全跑代码和装东西,Harness 把执行和状态拆开,容器挂了任务还能接着跑。对做 agent 的团队来说,这省了自己搭隔离环境和写恢复逻辑的功夫。TypeScript 支持还在开发,正文没给时间,这点先别太激动。整体是工具链的扎实升级,不是概念发布,所以放 featured。

4月15日星期三

OpenAI News

OpenAI 更新 Agents SDK:给模型配了个能看文件、跑代码、还能关在沙箱里干活的工位

OpenAI 在 4 月 15 日发布了 Agents SDK 的新版本,核心是两件事:一是给 agent 加了一套更完整的“控制回路”(harness),让模型能直接操作文件、执行命令、编辑代码,并且支持 MCP、skills、AGENTS.md 等社区里逐渐流行的接入方式;二是原生集成了沙箱执行环境,agent 可以在一个隔离的电脑环境里读写文件、...

推荐理由:OpenAI 发了篇 Agents SDK 下一步演进的标题,正文没给细节,所以功能、数字、上线时间都确认不了。我会先打个折:这更像一个预告,不是完整发布。对开发者来说,信号是 SDK 会继续往更工程化的方向走,但具体能省多少事、稳不稳,还得等后续公告。

最佳拍档

OpenClaw 创始人彼得·斯坦伯格回应闭源争议:项目不会闭源,已引入英伟达等多家企业共建以保持中立

OpenClaw 创始人彼得·斯坦伯格在 2026 年 4 月的 AI Engineer 大会上明确表示,加入 OpenAI 后项目不会闭源,控制权仍在自己手里。他主动引入英伟达、微软、腾讯等多家企业参与共建,其中英伟达派驻了全职工程师,以此对冲单一公司的影响。OpenClaw 上线 5 个月提交近 3 万次,贡献者近 2000 人,增长曲线近乎笔直。...

推荐理由:HKR 三项都站得住:闭源疑问是个好钩子,演讲里也掏出了提交量、安全通告和 Fast Mode 的实测数据。分数卡在 featured 门槛附近,因为本质上是 YouTube 演讲 recap,梦境功能等几个吊胃口的东西没给实现细节或发布时间,我会先打个折。

4月14日星期二

X · @dotey(宝玉)

与其说 AI First,不如先把测试、CI/CD 和监控这些软件工程的基础搭好

这篇文章的核心判断是:AI First 不是买几个 AI 工具订阅就能跑通的,它首先是一道软件工程题。AI 两小时写完代码,如果审查、测试、部署、监控和回滚还得靠人慢慢排队,瓶颈就从写代码转移到了 QA 和运维,25 人的团队照样快不起来。作者列出了几个硬性前提:自动化测试覆盖得够,不然每次 AI 提交你都得人工回归;CI/CD 流水线要全自动跑通,代...

推荐理由:这是一篇从业者视角的评论,不是新闻事件。H 分给那个反直觉的标题翻转,K 分给具体的工程前提和适用边界,R 分给瓶颈转移的痛点论述。分数停在 75 左右,因为正文没有给出具体案例、一手测试数据或团队规模外的量化验证,更像经验判断。