跳到正文

产品更新

AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。

842 条精选相关主题模型发布行业动态AI 编码

最新精选

第 121–140 条 · 共 842 条

6月3日星期三

AI HOT 精选

Claude Code 能按任务自动生成专属工作流了,用 JS 脚本调度子智能体干活

Claude Code 加了一个动态工作流功能,你给它一个任务,它会现场写一段 JavaScript 来指挥多个子智能体分工协作。你可以指定用哪个模型、工作区隔离到什么程度,适合做研究、安全分析、代码审查这类复杂活,写好的工作流还能共享和复用。不过正文没提具体会多烧多少 token,也没说这个功能现在是不是所有人都能用,这点先别太激动。

推荐理由:HKR 三项都过,但文章只给了机制层面的细节,token 增量、推送范围和定价都没提。因为跟 Claude Code 直接相关,所以放在中量级产品更新里偏高的位置。

AI HOT 精选

Runway 把 Aleph 2.0 视频编辑放上 API,最长能改 30 秒 1080p 多镜头片段

Runway 的 Aleph 2.0 视频编辑功能现在可以通过 API 调用了,你可以把它直接嵌进自己的应用或产品里。它支持对最长 30 秒、1080p 的多镜头视频做局部修改,只动你想改的那部分,其他画面不变。正文没提价格、调用频率限制、处理延迟和地区可用性,这些实际落地要用的信息都还没给。

推荐理由:Runway 是视频生成的核心玩家,Aleph 2.0 把局部视频编辑能力开放成 API,上限拉到 30 秒和 1080p。这是个实用的产品更新,不是模型级大版本发布,重要性中等偏上。

TechCrunch · AI

微软开源新工具,用文字描述就能给 AI 模型出考卷

微软发布了一个叫 ASSERT 的开源框架,让开发者直接用自然语言写测试要求,就能自动生成一套评估 AI 行为的考题和回归测试。正文没披露它具体支持哪些模型、打分指标怎么算,也没提使用限制。

推荐理由:我会先打个折:正文没披露这个框架支持哪些模型、具体用什么指标、以及跑起来的硬件或环境要求,所以实际能省多少事还不好说。但方向本身挺对——让开发者用自然语言写测试意图,而不是手搓脚本,确实能降低回归测试的门槛。微软把它开源出来,至少说明不是内部玩具。这点先别太激动,等看到跑分和兼容性再判断值不值得集成。

Hacker News 首页

微软发布 MAI-Thinking-1,一个主打复杂推理的中等成本模型

微软一口气发了七款 MAI 系列模型,这篇公告只重点介绍了 MAI-Thinking-1。官方说它擅长解决复杂问题,在 SWE-Bench Pro(一个测代码修改能力的榜单)上拿了高分,价格定在“中等权重”档位。但正文没披露参数量、具体跑分、定价细节和上线时间,所以实际性价比和落地表现还得等更多信息。

推荐理由:HKR 三条都踩中了:微软给模型起名 Thinking,又放出 7 个 MAI 模型,正好打在它和 OpenAI 若即若离的关系上,话题性够。但正文只说了发布,没参数、没评测、没时间表,信息密度很低,所以分数卡在 76 这个 featured 门槛上,没往上拉。

AI HOT 精选

Claude Platform 推出命令行工具,终端里直接跑 API 和托管智能体

这个 CLI 工具把 Claude Platform 的所有 API 端点都搬到了终端里。你可以直接在命令行调用 Messages API、启动 Claude 托管的智能体,然后把返回结果用管道传给 shell 做后续处理。官方提到,用 Claude Code 这类编码智能体来理解这个 CLI 也没问题。正文没披露性能开销或额外费用,实际用起来会不会增...

推荐理由:Claude Platform CLI 在 HKR 三项上都站得住,是个实用的开发者工具更新。不过公告只给了能力范围,安装流程、权限控制、安全限制和定价都没提,我会先打个折——实际落地好不好用,还得看这些缺口怎么补。

FT · 科技

Anthropic 要把网络安全模型 Mythos 推到 15 个以上的国家

Anthropic 计划将 Mythos 这个专门做网络安全的模型开放给更多地区,覆盖超过 15 个国家,大约 150 家机构会用上。正文被付费墙挡住了,没披露具体是哪些国家、什么时候开始、以及模型本身的技术细节或效果数据。

推荐理由:HKR 三项都过。Mythos 扩张有具体数字和地缘安全话题性,但正文只给了接入范围,没提能力细节、具体国家名单或使用条款,所以放在 featured 低分段。

TechCrunch · AI

微软给开发者发了份说明书,让 AI 代理的行为能按规矩来

微软发布了一份 AI 代理的行为规范说明书,让开发、合规和安全团队能把想让代理遵守的规则,写进可移植的策略文件里。正文没提版本号、开源协议、支持哪些开发框架,也没说什么时候正式上线。

推荐理由:我会先打个折:正文没披露版本号、开源协议和具体支持的框架,所以没法判断落地有多顺滑。但“可移植策略文件”这个机制本身是实在的,它让开发、合规、安全三拨人能用同一份文件定规矩,不用各说各话。对正在搭 Agent 的团队来说,规则能不能跨栈迁移是个真需求,这点先别太激动,但值得放进 featured 里提醒大家关注。

AI HOT 精选

微软推出 Scout 个人助手,基于 OpenClaw,能常驻在 Outlook 和 Teams 里干活

微软发了 Microsoft Scout,一个能一直挂在 Outlook、OneDrive、Teams 里的 AI 助手。企业可以把它分给员工,让它帮忙管日历、处理报销、起草邮件。微软副总裁 Omar Shahine 说这是他们第一次给客户一个真正的个人助手,功能比应用内嵌的 Copilot 更宽。不过正文没提 OpenClaw 具体是什么、怎么跟现有...

推荐理由:这篇就是微软 workplace agent 的产品更新,给了集成范围和任务类型,但没给定价、上线时间,也没技术细节。信息量够上 featured 低段,但别指望从这篇看出落地节奏。

The Verge · AI

微软在 Build 2026 上发了 Project Solara,一个给 AI 硬件跑智能体的安卓系统

微软在 Build 2026 大会上公布了 Project Solara,一个专门为跑 AI 智能体的硬件设计的操作系统。它底层是安卓,不是 Windows。现场展示了两个概念机:一个是类似 Echo Show 的桌面设备,用人脸识别解锁后可以直接调用各种 AI 智能体;另一个是可穿戴工牌,带摄像头和指纹扫描,能唤醒 AI 智能体。正文没披露具体上市时...

推荐理由:我会先打个折:正文没给发货时间、开发者接口和定价,所以别当产品发布看。亮点是微软在 Build 2026 上拿出的 Project Solara,一个跑在 Android 上的 AI 硬件系统,不是 Windows。现场有两台概念机,一台放桌上的带人脸识别,一台可佩戴的徽章带摄像头和指纹,说明微软在试探 agent 硬件长什么样。系统层面用 Android 意味着生态借力,但也绕开了自家系统,这点挺有意思。隐私那块正文没展开,只提了人脸和指纹,具体怎么处理数据没说。

AI HOT 精选

Google DeepMind 放出 Co-Scientist:让多个 Gemini 智能体组队,自己辩论、自己迭代科学假设

Google DeepMind 发了个叫 Co-Scientist 的系统,核心是用多个 Gemini 智能体搭成一个科研小组:有的负责生成假设,有的负责挑刺辩论,再让假设在内部迭代进化。官方说法是能帮科学家在复杂问题上找新思路。不过正文没披露具体用的是哪一版 Gemini、有没有跑过基准测试、开放方式是什么、什么时候能用上,这些关键信息目前都还是空白。

推荐理由:我会先打个折:正文没披露模型版本、评测结果和开放时间,所以目前只能当一次研究发布来看,别太激动。但 Gemini 被架成多智能体科研系统这个动作本身,说明 DeepMind 在认真推“AI 做科学假设”这件事,不是单次推理,而是让多个 agent 互辩、演进想法,思路比单纯刷榜有意思。对从业者来说,这更像一个方向信号,离能用的产品还有距离。

Latent Space

GitHub COO 聊怎么让平台接住 AI 代理的代码洪流

GitHub COO Kyle Daigle 说,2026 年 AI 驱动的代码提交量涨了 14 倍,这给原本按人类节奏设计的 GitHub 基础设施带来了很大压力,公开的宕机问题也跟这有关。他聊了 Copilot 的演变:从代码补全到命令行工具、桌面应用、云端代理和 SDK,以及 WorkIQ、MCP 这些让模型接入 Slack、邮件等公司上下文的方...

推荐理由:HKR 三项都成立:GitHub 高管给出 14 倍 AI 代码提交这个具体数字,把 Copilot、Actions、MCP、WorkIQ 和云端 agent 串成一条线来讲,信息量够。不是重大产品发布,所以重要性停在 80 分。

AI HOT 精选

OpenAI Codex 出了 Python SDK,一行命令就能把编程 Agent 塞进自己应用里

OpenAI Codex 发布了 Python SDK,安装命令是 pip install openai-codex。这意味着开发者可以直接在自己的代码里调用 Codex 的编程和生图能力,不用再单独打开 Codex 界面。更省事的是,SDK 能复用你已经在 Codex 上的登录状态,省去再搞一套鉴权的麻烦。不过正文没提 API 怎么收费、用的是哪个模...

推荐理由:我会先打个折:正文只说了怎么装和怎么登录,没给 API 价格、模型版本或限流条件,所以别急着算账。但这件事本身挺实在——Codex 不再只是个聊天窗口,而是能当零件用,pip 一装就能集成。对开发者来说,复用登录态省了一步鉴权麻烦,但没写清楚调用上限,真上生产还得自己测。整体是实用的产品更新,信息有缺口但不妨碍它值得关注。

AI HOT 精选

OpenAI 给 Codex 加了 Sites 功能,能把想法直接变成团队可用的网页或小应用

Codex 现在可以把你的工作内容、想法和计划直接转成一个交互式网站或应用,团队通过一个链接就能打开、使用和分享。这个功能会先推给 Business 和 Enterprise 用户,正文没提价格,也没说什么时候开放给其他套餐。

推荐理由:我会先打个折:正文没披露定价、权限边界,也没给实际效果案例,所以别急着把它当成成熟的生产力工具。但 Codex 从写代码延伸到直接出可交互站点,这个方向本身挺省钱——省掉了从代码到可演示原型中间的那一步。对企业和团队用户来说,一个 URL 就能让非技术人员上手试用,协作摩擦会小很多。这点先别太激动,等看到具体质量表现和计费方式再说。

TechCrunch · AI

OpenAI 在 Codex 里塞了六个白领岗位插件,覆盖数据分析、创意、销售、产品设计、股票研究和投行

OpenAI 给 Codex 应用上线了六个新插件,分别瞄准数据分析、创意产出、销售、产品设计、股票投资和投行业务。每个插件都打包了工具集成、操作指令和上下文,让 Codex 能模拟特定岗位的工作流。正文没提定价和开放范围,我会先打个折——没看到实际跑通的效果和成本之前,别急着把它当正式员工用。

推荐理由:OpenAI 把 Codex 从程序员工具扩成白领插件包,六个方向覆盖了数据、创意、销售、产品、股票和投行,动作不小。但正文没提定价、实际效果和推送范围,所以我会先打个折,把它放在中等权重的产品更新档。

6月2日星期二

TechCrunch · AI

Anthropic 把 Claude 的安全工具 Mythos 铺到 15 国的关键基础设施,覆盖电力、水务、医疗和通信

Anthropic 正在把自家的安全漏洞项目 Project Glasswing 和模型 Mythos 开放给 15 个国家的 150 家机构,专门盯电力、水务、医疗和通信这些命脉系统。按他们的说法,这些系统一旦被攻击,可能影响上亿人。正文没具体说 Mythos 是直接部署在本地还是通过 API 调用,也没披露这 150 家机构是免费试用还是付费签约,...

推荐理由:HKR 三项全中:规模有、行业有、安全痛点也有。没给更高分是因为正文只说了铺开范围,Mythos 具体怎么控、怎么评、出过什么问题都没提,所以先打个折。

AI HOT 精选

Holo3.1 发布:一套能在本地快速跑起来的电脑/手机操作模型

H公司把他们的电脑操作模型升级到了 Holo3.1,这次主打的是“哪里都能跑”。模型基于 Qwen 系列,一口气放出 0.8B、4B、9B 和 35B-A3B 四个尺寸,并且首次提供了 FP8、Q4 GGUF 和 NVFP4 这些压缩版本,方便直接在个人设备上做本地推理。35B-A3B 的旗舰版在 AndroidWorld 测试里拿到了 79.3% 的...

推荐理由:Holo3.1 把电脑操作智能体做成了本地可跑的版本,而且最小模型只有 0.8B 参数,对想在个人设备上试水的开发者来说门槛很低。四个尺寸加三种量化格式一起发,部署灵活度拉满,不是只给一个玩具。我会先打个折:正文没披露具体任务成功率或延迟数据,所以实际效果还得自己测。但就凭本地运行和量化支持这两点,已经够让做私有化部署的人点进去看了。

Ben's Bites

Claude Opus 4.8 发布,Claude Code 学会写脚本派子任务并行干活

Anthropic 发了新模型 Claude Opus 4.8,主要卖点是 Claude Code 现在能先写一个调度脚本,再同时拉起多个子代理并行处理复杂任务。不过有开发者提醒,这并不证明松散的 multi-agent 架构靠谱,反而是围绕小代理循环的确定性工作流更稳。模型本身被 Simon Willison 评价为“温和但有用的升级”,更诚实、更少...

推荐理由:HKR 三项都成立,因为这是一次有实质内容的 Anthropic/Claude 发布和 Claude Code 代理更新。文章没给基准测试、定价和上下文窗口数据,所以分数压在 85–94 这个区间。

AI HOT 精选

Anthropic 扩大 Project Glasswing 计划,新增约 150 家关键基础设施机构

Anthropic 把 Project Glasswing 的合作范围从约 50 家扩到约 150 家新机构,覆盖超过 15 个国家,新增了电力、水务、医疗、通信和硬件等关键基础设施行业。这些机构都有一个共同点:一旦代码库被攻破,影响可能超过 1 亿人。前期合作方用 Claude Mythos Preview 已经扫出超过 1 万个高危或严重漏洞,现在...

推荐理由:Anthropic把Project Glasswing铺到约150个新组织,横跨15个以上国家,HKR三项都有实打实的数字和行业支撑。不过正文没披露具体的安全机制或模型能力变化,所以分数就停在featured低段,先别太激动。

The Verge · AI

我试了 Google 的 AI 管家 Gemini Spark,它规划行程的方式让我又惊又怕

过去四年所有 AI 产品演示都说能帮你规划旅行,但实际用起来只会推荐每个城市最俗套的六件事。我用 Spark 的体验完全不同——它是 Google 一个野心很大的常驻 AI 管家。不过这篇报道只放了开头,正文没披露 Spark 什么时候上线、怎么收费、有没有跑分,也没说测试条件能不能复现,所以它到底多能打,我会先打个折。

推荐理由:我会先打个折:这篇是 The Verge 的上手体验,不是产品发布稿,所以别当官方公告看。标题的情绪冲击力够强,能勾住人,但正文只披露了旅行规划这一个场景的差异,发布时间、定价、可复现的测试条件一概没提,信息密度其实不高。不过它踩中了两个从业者会关心的点:一是 agent 常驻系统带来的自主性和安全边界问题,二是 Google 在这个方向上给竞品施加的压力。综合来看,有话题性但缺硬信息,放在 featured 级别是合适的。

r/LocalLLaMA

NVIDIA 在 Hugging Face 上放出 Cosmos 3 世界模型,能同时吃文字、图片、视频并生成视频、音频和动作指令

NVIDIA 把 Cosmos 3 系列模型挂上了 Hugging Face,这次发了两个尺寸:Nano 版 160 亿参数,Super 版 640 亿参数。它是个全模态世界模型,输入可以混着来——文字、图片、视频甚至动作轨迹都行,输出也不止视频,还能直接吐图片、音频和下一步的动作指令。不过 Reddit 原帖的正文被网络策略挡了,实际跑起来的硬件门槛...

推荐理由:我会先打个折:正文没披露 benchmark 分数、许可证和训练细节,所以不能直接断定它比现有方案强。但 NVIDIA 把 16B 和 64B 两个规格的世界模型公开放在 HF 上,这件事本身就值得从业者看一眼——至少多了一个能本地跑、能接动作输出的多模态基座选项。对做机器人仿真和视频生成的人来说,输入支持动作轨迹、输出能直接给动作指令,说明它不只是生成漂亮画面,而是想往物理交互方向靠。这点先别太激动,因为没看到在真实机器人任务上的验证,但方向对,且开源降低了试错成本。