跳到正文

产品更新

AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。

841 条精选相关主题模型发布行业动态AI 编码

最新精选

第 81–100 条 · 共 841 条

6月5日星期五

AI HOT 精选

Meta 把未启用的人脸识别代码塞进了智能眼镜 App,已推送到超 5000 万台设备

安全研究员从 Meta 智能眼镜的配套 App 里拆出了一套叫 NameTag 的人脸识别功能代码。这套代码虽然没开启,但核心组件已经通过应用更新,静默分发到了下载量超 5000 万次的设备上。它的工作流程是:用三个 AI 模型分别完成人脸检测、图像裁剪和把人脸转成生物特征模板(faceprints),然后跟手机本地数据库做比对。识别成功会弹通知,没认...

推荐理由:这篇东西挖出了 Meta 智能眼镜 App 里藏着的 NameTag 人脸识别代码,虽然没开启,但核心组件已经通过更新静默塞进了超 5000 万次下载的设备里。我会先打个折:它毕竟不是官方发布或重大事故,只是一篇基于代码拆解的深度报道,所以重要性我给到 82,刚好跨过 featured 门槛。HKR 三条全过:热点是隐藏代码加 5000 万设备规模,知识量有三模型本地比对的具体流程,关联度则踩中了中美算力差距和效率竞赛的从业者神经。正文没确认功能已对用户开放,所以分数没再往上拉。

r/LocalLLaMA

微软没出 Qwen3.6-27B 或 Gemma-4-31B 这种尺寸的模型,而是发了一组 MAI 系列

Reddit 上有人吐槽微软应该发类似 Qwen3.6-27B 或 Gemma-4-31B 这种中等体量的开源模型,结果他们放出来的是七个 MAI 模型。其中 MAI-Thinking-1 参数规模标的是 1T A35B,上下文窗口 256K;MAI-Code-1-Flash 是 137B A5B,同样 256K 窗口。帖子正文被网络策略挡了,看不到更...

推荐理由:微软一口气放出 7 个 MAI 模型,带推理和代码变体,256K 上下文窗口,信息量够得上 HKR-K 和 R。帖子拿 Qwen3.6 和 Gemma-4 当参照物,说微软早该发这类中型模型,这个追赶角度撑起了 H。不过来源是 Reddit 吐槽帖,正文还被网络策略挡了,缺基准测试、许可证和定价细节,所以停在 featured 档,上不了 P1。

Hacker News 首页

Lowfat:一个命令行过滤器,帮作者省了 91.8% 的 LLM token

Lowfat 是一个可插拔的 CLI 过滤工具,能自动把 kubectl、docker、grep 这类命令输出的冗余信息(比如表格边框、空行、重复标题)裁掉,只保留关键内容再喂给大模型。作者自己用了两个月,原始输出总共 440 万个 token,过滤后只用了 30 万,省下 410 万 token,换算下来节省了 91.8%。它可以作为 shell 包...

推荐理由:我会先打个折:这是个个人 Show HN 项目,不是大厂发布,但 91.8% 的 token 节省率配上两个月的实测数据,说服力够强。它解决的不是什么高深问题,就是把 kubectl、docker 这类命令输出里的表格边框、空行、重复标题裁掉,只留干货再喂模型。这事做 agent 的人都懂——工具返回一堆格式垃圾,token 烧得飞快,上下文还被撑爆。Lowfat 的思路简单粗暴,但正好打在痛点上。不过正文没提兼容性边界和极端情况,这点要留意。整体看,数据扎实、痛点真实,放在 featured 门槛上没问题。

新智元 · 公众号

蔚蓝科技卖了2.5万台四足机器人,90%进了普通人家

蔚蓝科技的四足机器人已经卖出2.5万台,覆盖295个城市,其中家庭用户占了九成。他们新发布的BabyAlpha A3算力比上一代提升了1000倍,能在机器上直接跑一个70亿参数的大模型。不过正文因为环境异常没加载出来,具体的技术细节和价格信息暂时看不到。

推荐理由:HKR三项都过了:标题抓人,数据有料,话题踩在家庭机器人和端侧大模型的竞争神经上。不过正文因为环境异常没加载出来,技术细节和价格都看不到,信息主要来自公司单方面口径,不是独立验证的行业突破,所以放在featured的低位。

量子位 · 公众号

与其砸100亿做人形机器人,不如先让10万台机器狗进家庭

蔚蓝科技的BabyAlpha系列机器狗已经卖出25397台,其中九成是家庭用户买回去用的。他们最新的A3机型能在本地跑一个70亿参数的大模型,官方给出的推理速度是每秒280个token。不过正文因为环境验证问题没加载出来,具体配置、价格和实际体验细节暂时看不到。

推荐理由:HKR 三项都过:有明确的走访对象和销量数据,有端侧推理的具体指标,话题也切中中美算力差距和效率竞赛。但正文因为环境问题没加载出来,缺少配置、价格和实际体验细节,本质上还是一篇带有观点的产品进展评论,不是模型发布或平台级事件,所以放在 featured 档的偏上位置。

Computing Life · Share · 鸭哥调研

Grok Build 0.1:xAI 押注并行广度,但还没交出成绩单

xAI 在 2026 年 5 月推出了编程 agent Grok Build 0.1,CLI 和 API 先后上线。它跟 Claude Code 走的是两条路:Claude 靠单个深度 agent 加 1M 上下文窗口死磕复杂重构,Grok Build 则用 8 个并行子 agent 各干各的,靠速度(100+ tokens/秒)和广度抢活。定价是 A...

推荐理由:xAI 的 Grok Build 0.1 走了一条和 Claude Code 完全不同的路:不拼单 agent 的深度和超长上下文,而是用 8 个子 agent 并行干活,靠推理速度抢时间。这个思路本身有信息量,但文章没给基准测试结果,也没说清楚并行方案在实际项目里到底省不省钱、会不会互相踩脚。定价只提了 A 开头,后面断了,隐私条款也没展开。所以先放 featured,等有实测数据或者成本细节再往上调。

AI HOT 精选

ChatGPT 记忆功能今天大升级,但具体怎么升还没说

Sam Altman 发推说 ChatGPT 的记忆功能今天有重大升级。正文没披露记忆机制怎么改、覆盖哪些用户、有没有新的控制选项、是否收费、以及分批推送的时间表。我会先打个折,等官方补细节再判断实际变化有多大。

推荐理由:HKR-H 和 HKR-R 通过,因为 Sam Altman 的推文指向一次记忆升级,但 HKR-K 不通过:正文没披露机制、用户范围、控制选项和推送时间表,信息缺口太大。

AI HOT 精选

OpenAI 在生成接口里直接返回内容审核分数,不用再单独调一次审核接口

OpenAI 把内容审核评分塞进了 Responses API 和 Completions API 的返回结果里。你现在发一次请求就能同时拿到生成内容和对应的安全分数,不用像以前那样先调生成接口、再调审核接口。拿到分数后,你可以自己决定怎么用:记日志、做路由分发、人工复核,或者直接拦截。正文没披露这个审核模型的延迟会增加多少、准确率怎么样,也没说和独立...

推荐理由:HKR-K 和 HKR-R 都成立:OpenAI 把审核分数塞进生成响应里,开发者可以据此做路由和拦截,省掉一次单独审核调用的开销。HKR-H 偏弱,因为这只是公开信和功能更新,不是已生效的法律或硬性安全突破,所以放在 featured 档位。正文没给出法案文本和执行时间表,实际省钱效果还得看调用量和审核精度,但方向上是给安全管线减负。

TechCrunch · AI

苹果首次放行 AI 代理进 iMessage 商家聊天,Poke 拔得头筹

苹果批准了 Poke 接入 Messages for Business,这是该平台第一个能直接跟用户发短信干活的 AI 代理。Poke 本身做的就是让用户通过短信使唤 AI 助手,这次相当于把它的服务嵌进了苹果官方的商家消息通道。不过正文没披露苹果的审核标准是什么、这次开放的范围有多大,也没提商业分成怎么算。

推荐理由:HKR-H/K/R 都过,但正文很薄:只确认了 Poke 获批和“首个”身份,没给出审核规则、铺开节奏或商业条款。这更像一条门槛级的产品动态,够 featured,但信息密度撑不起 78 分以上的段位。

AI HOT 精选

Codex 加了个 iOS 应用构建插件,不用切窗口就能预览和改代码

OpenAI 给 Codex 接入了 Build iOS Apps 插件,现在你可以在 Codex 的内置浏览器里直接跑 iOS 应用、打开 SwiftUI 预览,改完代码也能热重载,不用来回切换工具。正文没提这个插件是官方做的还是第三方贡献的,也没说支持哪些 iOS 版本或设备型号。

推荐理由:HKR 三项都过:钩子是 Codex 直接处理 iOS 应用测试,有 SwiftUI 预览和热重载这些具体细节。但这是一封公开信和政策呼吁,不是已生效的法律,正文也没给出法案文本和执行时间表,所以放在 featured 而不是更高。

AI HOT 精选

Replit Agent 接入 Shopify,描述卖什么就能自动搭好一个独立站

Replit 和 Shopify 打通了:用户在 Replit Agent 里说一句想卖什么,Agent 会直接生成自定义店铺页面、创建 Shopify 商店并上架商品。建完去 Shopify 认领店铺、设好支付就能开卖。正文没提收费方式、支持的地区和具体上线时间,如果是真的,对想快速试水电商的人挺省事。

推荐理由:HKR 全过:Shopify 打通流程对开发者有实感,但这是公开信和政策呼吁,不是已生效法律,法案文本和执行时间表都缺失,所以停在 featured 档。判断挂在信息缺口上——没提收费和地区,省钱与否得等后续。

AI HOT 精选

Boson AI 和 LMSYS 把 Higgs Audio v3 TTS 跑在了 SGLang-Omni 上,一个 4B 参数的语音合成模型,主打低延迟...

Higgs Audio v3 TTS 是 Boson AI 的语音合成模型,参数量大约 4B,底层用了 Qwen3-4B。它支持 100 种语言,在内部测试集上词错率/字错率能压到个位数。这个模型专门为语音助手那种边说边生成的场景设计,不等句子结束就能开始合成,后续文本到了还能保持声音、情绪和节奏连贯。开发者可以直接在输入文本里插标签来控制 20 多种...

推荐理由:H 和 K 靠 4B/100 语言/流式合成这几个硬指标撑住。R 偏弱,因为文章没给延迟、定价和权重,更像一个能力宣告而非可立刻复用的发布,所以放在 featured 低位。

6月4日星期四

AI HOT 精选

neolab 发布 Nex-N2-Pro,一个 397B 参数的混合专家推理模型,跑分自称摸到 GPT-5.5 水平

这个模型基于 Qwen3.5-397B-A17B 改造,总参数量 397B,用了混合专家架构(MoE,把任务分给不同子模型处理,省算力)。它能处理 26 万多字的长上下文,也支持图像识别。官方说它在 Terminal Bench 2.1、GDPVal、SWE-Verified 这几个测试集上拿了最高分,性能对标 GPT-5.5 和 Claude Opu...

推荐理由:HKR 三项都过:标题的 benchmark 钩子够强,正文也给了模型尺寸、上下文和 token 缩减的具体数字。但这是一封公开信和政策呼吁,不是已生效的法律,法案文本和执行时间表都没披露,所以放在 featured 而不是更高。

r/LocalLLaMA

英伟达放出 Nemotron-3-Ultra 超大 MoE 模型,550B 总参数但只激活 55B,最低要 8 张 H200 才能跑

英伟达在 Hugging Face 上发布了 Nemotron-3-Ultra-550B-A55B-BF16,一个混合专家(MoE)模型。总参数量 550B,但每次推理只激活其中 55B 参数,相当于用 55B 模型的算力去撬动大得多的知识容量。上下文窗口拉到 1M token,能一口气处理很长的文档。硬件门槛不低,官方列的最低配置是 8 张 H200...

推荐理由:这条消息干货集中在规模和硬件门槛上:550B 总参数、55B 激活、100 万 token 上下文,最低 8×H200 或 16×H100。我会先打个折——正文没给任何基准测试分数、许可证细节和具体开放时间,所以没法判断实际效果和可用性。亮点是硬件要求本身就是一个筛选器,能直接筛出一批会认真评估的人。缺点也明显:没有性能数据,光看参数和上下文长度,只能说明“理论上能处理很长的内容”,但不知道推理质量怎么样。这点先别太激动。整体属于有信息量但缺验证的发布,适合放进 featured 提醒大家关注后续评测。

Hacker News 首页

Infracost 做了个本地工具,让编程助手在写基础设施代码时就能看到云成本,实测能省 67% 的 API 费用

Infracost 发布了 Cost.dev,一个本地命令行工具,可以嵌进 Claude Code、Cursor 这类编程助手的流程里。它的核心作用是:在你让 AI 写云资源代码(比如 Terraform)的时候,实时告诉你这套配置每个月要花多少钱,并给出省钱建议。他们拿裸用 Claude 做基准测试,结果显示这个工具能让模型输出的 token 量减少...

推荐理由:Infracost 发了个本地命令行工具 Cost.dev,专门给写代码的 Agent 做云成本估算,核心卖点是让模型输出更省 token、调用更省钱。他们给出的数字挺好看:Claude 输出 token 最多降 79%,API 成本最多降 67%。我会先打个折——这是厂商自己的数据,没有第三方验证,实际效果得看具体场景和 Agent 的实现方式。但思路本身是实用的,直接在本地跑,不依赖外部服务,对控制 Agent 的 API 支出和云资源浪费有直接帮助。正文没披露支持哪些云平台、和现有 CI/CD 流程怎么集成,这些信息缺口让实用性打了一点折扣。...

新智元 · 公众号

分子之心发布 MMDesign,声称靶点命中率超过 90%

分子之心推出了一个叫 MMDesign 的 AI 平台,专门用来从头设计生物大分子药物。他们在 12 个治疗靶点上做了测试,每个靶点只挑了 14 到 50 个分子去做湿实验验证,结果有 11 个靶点都测出了特异性结合,算下来靶点成功率超过了 90%。不过正文因为访问环境异常没加载出来,具体用了什么模型架构、训练数据规模、以及和哪些国际顶尖模型做了对比,...

推荐理由:我会先打个折:正文没披露这 12 个靶点具体是什么、难度如何,也没说湿实验的具体指标和对照组,所以 90% 这个数先别太激动。但亮点在于,每个靶点只筛了 14 到 50 个分子就进湿实验,如果数据属实,意味着前期筛选成本压得很低。对做 AI 制药的人来说,这比跑分更有参考价值。整体偏产品发布,但数字够具体,放在 featured 档合理。

AI HOT 精选

微软 AI 负责人说 Anthropic 模型太贵,正在自己搞更便宜的替代品

微软 AI 负责人 Mustafa Suleyman 公开说 Anthropic 的模型成本太高,公司已经在开发内部替代模型来降本。他没透露具体模型名称、能便宜多少、什么时候上线。这件事的背景是微软一边给 OpenAI 投了几百亿美元,一边还在大量采购别家模型当备选,现在连备选都觉得贵了。正文没披露自研模型是基于开源方案还是完全从头训,也没说性能对标的...

推荐理由:HKR三项都过了。微软点名Anthropic贵,自己下场做便宜替代,这个动作本身就够抓眼球。但正文缺了关键信息——模型叫什么、能便宜多少、什么时候能用,这些都没说,所以分数先打个折,放在featured里偏低的位置。

机器之心 · 公众号

谷歌放出 Gemma 4 12B,120 亿参数模型能在 16G 显存的笔记本上跑

谷歌发了 Gemma 4 系列的新成员,一个 120 亿参数的中等尺寸模型。它主打本地运行,16GB 显存或统一内存的笔记本就能带起来。架构上没走传统多模态那套编码器路线,直接原生支持音频输入,还带了一个叫 MTP 的推测解码模块来压延迟。模型用 Apache 2.0 协议开源。不过正文因为环境验证没加载出来,具体跑分、训练数据、实际推理速度这些关键信...

推荐理由:Gemma 4 12B 的卖点很直给:一个不算小的模型,能在普通笔记本上跑,还用了 Apache 2.0 协议。这对想自己折腾、又不想被云服务绑住的开发者来说,是个实在的更新。我会先打个折,正文没提具体推理速度和实际任务表现,光看参数和硬件门槛还不够,得等实测。但就凭“16G 笔记本能跑”这个钩子和宽松的开源协议,值得推给关注本地部署和成本控制的读者。

机器之心 · 公众号

办公室都在用嘴打字,敲键盘快成老手艺了

这篇文章本身没加载出来,微信页面显示环境异常需要验证,所以正文内容我没看到。从标题和已有的英文摘要看,讲的是 AI 语音输入工具正在进入办公和开发场景。Wispr Flow 这个产品全球下载量超过 250 万,12 个月留存率 70%,年用户增长 100 倍,说明用的人确实在猛增,而且用了就回不去。OpenAI 的 gpt-4o-transcribe ...

推荐理由:HKR 三项都站得住,但这是一篇带数据的工作流趋势观察,不是模型发布或平台级更新,放在 featured 里属于门槛线附近的那一类。我会先打个折,不把它当硬核技术突破看,但“打字正在变古老技艺”这个判断加上 250 万下载和 70% 留存,确实能让人重新想一遍语音交互的落地速度。

The Verge · AI

亚马逊给仓库机器人 Proteus 加了语音交互,工人可以直接用自然语言派活

亚马逊发布了新版 Proteus 仓库机器人,核心变化是工人不用再通过专用软件下指令,直接说话就能给它派任务,像跟同事沟通一样。Proteus 最早在 2022 年亮相,外形像个大号扫地机,负责在仓库里搬重货、推大车。这次升级主要是交互方式从代码/软件切到了自然语言,但正文没披露具体部署了多少台、单台成本多少,也没说语音指令在嘈杂仓库里的准确率怎么样。...

推荐理由:我会先打个折:Amazon 只说了 Proteus 能听懂人话,没给任何规模数据,所以重要性卡在 featured 门槛附近。亮点是交互方式从编程界面直接跳到口语对话,对一线工人上手门槛降得明显;但没披露部署量,效果和稳定性都还是未知数。如果是真的跑通了,省培训成本、提响应速度都说得通,这点先别太激动。