跳到正文

产品更新

AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。

841 条精选相关主题模型发布行业动态AI 编码

最新精选

第 21–40 条 · 共 841 条

7月13日星期一

AI HOT 精选

Codex 和 ChatGPT Work 暂时取消 5 小时用量上限,GPT 5.6 Sol 开始省用量

过去两天上了三个更新:Plus、Business、Pro 套餐的 5 小时使用限制暂时拿掉了;GPT 5.6 Sol 做了效率优化,每次请求消耗的用量会变少,但具体能省多少正文说等量化后再公布;同时活跃用户到了 600 万,一小时内会重置用量。暂时取消的“暂时”是多久、效率提升的幅度多大,这两点正文都没给,先别急着算账。

推荐理由:Codex 和 ChatGPT Work 一起更新,取消 5 小时限制对重度用户是实打实的利好。GPT 5.6 Sol 说效率提升、每次消耗变少,但正文没给具体数字,600 万活跃用户和一小时内重置用量也算有料。不过“暂时”取消是多久、效率到底省多少都没说,所以分数没上 80。

7月10日星期五

AI 群聊日报

GPT-5.6 Sol 发布日:跑分领先但群友实测还是给 Fable 打工,有人让它读完整个 GitHub 写遗书

OpenAI 把 Codex 客户端改名叫 ChatGPT,GPT-5.6 Sol 正式上线。官方跑分在 Terminal-Bench 2.1、BrowseComp 和 Agents' Last Exam 三项领先,价格只有 Fable 的一半,但群里用同一个代码库实测的结论是 Fable 还是好很多,5.6 的定位迅速收敛成给 Fable 当打工仔—...

推荐理由:GPT-5.6 Sol 上线是当天最大事件,这条群聊日报的价值在于补上了官方跑分之外的社区实测对比。信息密度高,有第一手判断。我会先打个折,因为来源是群聊整理而非一手信源,部分细节依赖群友自述,但整体信号很清晰。

6月18日星期四

AI HOT 精选

Claude Design 更新:跨项目记住你的品牌规范,还能和 Claude Code 搭着用

Anthropic 给 Claude Design 加了两个实用能力:一是它能跨项目记住你的设计系统,比如颜色、字体、组件这些,不用每次都重新教它;二是它现在能和 Claude Code 协同,你可以在编辑器里直接改设计稿。正文没提具体上线时间,也没说这是免费功能还是付费功能。

推荐理由:Anthropic 给 Claude Design 加了跨项目设计记忆和 Claude Code 协同,两个能力都算实在,不是画饼。但正文没提上线时间和是否收费,信息密度刚好够上 featured,再高就给不了了。

6月10日星期三

AI HOT 精选

Magnetar 用几百个 AI 智能体替代分析师做股票研究,人只负责批交易

彭博社消息,管理 180 亿美元的对冲基金 Magnetar Capital 在新产品里砍掉了人类分析师,改用几百个 AI 智能体去搜投资点子、研究公司、推荐仓位和预测趋势。人只保留最后一道关卡:批准交易。正文没披露这些智能体的具体架构、回测表现或风控细节,所以实际效果和稳定性还不好判断。

推荐理由:我会先打个折:正文没给架构、回测和风控细节,所以实际靠不靠谱还不好说。但“几百个智能体替代分析师”这个钩子够硬,180亿规模的对冲基金下场试水,人只留最后一道审批,信息量虽然薄,冲击力够强。HKR全中,放在featured档没问题。

AI HOT 精选

Google Gemini 3.5 实时翻译开放公测,支持 70 多种语言、2000 个语言对

Google 把 Gemini 3.5 的实时翻译功能放出来了,现在通过 Gemini API 就能用。它做的是语音到语音的低延迟翻译,覆盖 70 多种语言,能组合出 2000 个语言对,冷门小语种也包含在内。开发者可以把它接进实时对话、客服、直播或跨国会议里。主推文提到这消息被 Anthropic Fable 5 的声量盖过去了,还顺带提了阿里 Qw...

推荐理由:HKR 三项都成立:Google 把实时语音翻译做成 API 公开预览,对开发者有直接吸引力,也给了语言覆盖和语言对的具体数字。但文章只提了功能开放,没写价格、延迟基准和可用区域,信息有缺口,所以重要性停在 78。

AI HOT 精选

Claude 托管智能体新增定时运行和环境变量保险库

Claude 的托管智能体(Managed Agents,让模型进业务流程干活的工具)现在支持用 cron 表达式设定时任务,到点自动跑,不用人守着。同时上线了 Vaults 功能,用来存 API 密钥、数据库密码这类敏感信息。智能体跑任务时能调用这些变量,但模型本身读不到明文——密钥只在网络边界上才被替换成真实值。正文没披露定时任务的最小间隔和 Va...

推荐理由:Claude 的托管智能体现在能设 cron 定时任务,到点自己跑,不用人盯。同时上了 Vaults 功能存 API 密钥、数据库密码这些敏感信息,智能体跑任务时可以调用,但模型本身读不到明文——密钥只在网络边界上才被替换成真实值。正文没披露定时任务的最小间隔和 Vaults 的访问控制粒度,这点先别太激动。整体是给智能体补运维能力,不是模型升级,所以分数就卡在这个位置。

AI HOT 精选

OpenRouter 的 Advisor 工具页面 404 了,正文没披露任何细节

OpenRouter 原本要介绍一个叫 Advisor 的工具,让 GPT-4o Mini 这类便宜模型在生成过程中可以随时去问 Claude Fable 等更强模型。但博客页面直接返回 404,文章不存在。定价、延迟、路由策略这些关键信息全都没公开,目前只能看到标题和摘要里的概念,没法判断实际效果和成本。

推荐理由:我会先打个折:OpenRouter 这篇博客直接 404,正文没披露定价、延迟、路由策略和实际效果,目前只有标题和摘要里的概念。概念本身有意思——让便宜模型在生成中途去问强模型,相当于给低成本模型配了个随时可叫的顾问,不是简单的 fallback 或静态路由。这点先别太激动,因为没数据验证到底省不省钱、延迟高不高、强模型被调用的频率和策略全都不清楚。对正在搭模型路由栈的团队来说,这个方向确实踩中了成本与质量的平衡点,但信息缺口太大,只能当产品信号看。

AI HOT 精选

上手 Claude Fable:Anthropic 的新模型让 AI 自己干活儿了

Ethan Mollick 提前试用了 Anthropic 的 Mythos 级模型 Claude 5 Fable。他的结论是,这模型比他用过的所有公开模型都强出一大截,而且人和 AI 的关系可能要变了。Fable 能自己连续跑十几个小时,执行好几页纸的指令。Mollick 让它从零做一个等时线地图,模型自己派了一堆子 AI 去查了 2200 多个航班...

推荐理由:Ethan Mollick 提前摸了 Claude Fable,说它比所有公开模型都强一截,能自己连续跑十几个小时、执行好几页纸的指令,甚至自己派子 AI 去查 2200 多个航班做地图。听着像模型能当项目经理使了,但正文没披露参数量、跑分、成本和什么时候能用,这点先别太激动。H 和 R 分高是因为新模型名加推理/代码定位确实抓眼球,K 分低是因为除了一个用例,关键信息全是缺口。Anthropic 光环有加成,但缺价格和基准测试,所以没到必写级别。

AI HOT 精选

Claude Fable 5 和 Mythos 5 发布:编程最强、能打游戏,但安全限制会误拦 5% 的对话

Anthropic 发了两个新模型:Claude Fable 5 和 Claude Mythos 5。Fable 5 是面向普通用户的安全版,Mythos 5 是给网络安全防御方用的无限制版,目前只通过美国政府合作项目开放。Fable 5 在软件工程、知识工作和视觉任务上都是新标杆——Stripe 测试时,它一天干完了原本一个团队两个月的代码迁移活;在...

推荐理由:Anthropic 一次发了两个模型,Fable 5 是普通用户能用的安全版,Mythos 5 是给网络安全防御方用的无限制版,目前只走美国政府合作渠道。Fable 5 在软件工程、知识工作和视觉任务上都刷了新纪录——Stripe 拿它做代码迁移,一天干完原本一个团队两个月的活。药物设计速度也快了 10 倍,这个数字挺夸张,但正文没披露具体测试条件和对比基线,先打个折看。定价方面,Fable 5 每百万 token 输入 10 美元、输出 50 美元,比前代贵了不少,得算算性价比。整体看,这是一次 Claude 主线模型的实质性更新,有定价、有基准...

AI HOT 精选

Cohere 发了第一个编程模型 North Mini Code,免费开源,上下文窗口 256K

Cohere 在 OpenCode 上放出了他们的第一个编程模型 North Mini Code,完全开源,上下文窗口能塞进 256K token,相当于一次能读很长的代码库。目前免费可用,正文没披露具体跑分、支持哪些语言和推理速度,实际编码能力得自己测一下才知道。

推荐理由:Cohere 终于出了编程模型,免费开源这点挺实在,256K 上下文意味着一次能吞下大半个代码库,省得来回切文件。但正文没给跑分、没提支持哪些语言、也没说推理快慢,实际好不好用得自己跑一遍才知道。我会先打个折,等有实测数据再往上调。

Hacker News 首页

Claude Fable 5 与 Mythos 5 系统卡:一个模型,两套安全锁

Anthropic 发了份 319 页的系统卡,讲的是同一个新模型拆成了两个版本:Fable 5 给大众用,但加了安全锁,不让它在生物、网安这类高危领域干活;Mythos 5 则把相关限制解开了,只开放给 Project Glasswing 等少数受信合作伙伴。先说能力,Mythos 5 是他们训过最强的模型,在漏洞开发这类网安测试里把 Opus 4....

推荐理由:Anthropic 在同一天发了 Claude 5 的两个版本和配套系统卡,Mythos 5 自称最强、但只给受信伙伴用,Fable 5 则在高危领域加了限制。这种能力分级和透明披露的做法,对关注模型安全与能力边界的从业者来说是个重要信号。放在 85–94 这个区间没问题,因为信息够新、够具体,而且直接关系到 Claude 用户和开发者的实际使用。

AI HOT 精选

GitHub Copilot CLI 现在能建自定义 AI 智能体,把一次性终端指令变成可重复跑的工作流

GitHub Copilot CLI 新增了自定义智能体功能,让模型能读懂你团队的技术栈和常用流程,把以前在终端里零散敲的提示词变成一套可复用的自动化工作流。正文没披露具体的配置方式、推送范围和是否额外收费,所以实际落地成本还不清楚。

推荐理由:GitHub 官方产品更新,HKR 拿到 H 和 R:自定义 Copilot CLI 智能体对开发者工作流有实际影响。K 偏弱,因为配置方式、推送范围和是否额外收费都没披露,所以定在 featured 门槛。

6月9日星期二

AI HOT 精选

Google 放出 Gemini 3.5 Live Translate,话没说完就开始翻,支持 70 多种语言

Google 发了 Gemini 3.5 Live Translate,一个实时语音转语音翻译模型。它不等对方把整句话讲完,边听边翻,用流式更新把结果推出来,延迟压到几秒,还能保留原声的语速、音高和语调。支持 70 多种语言,目前通过 Gemini Live API、Google Meet 预览版和 iOS/Android 的 Google 翻译 Ap...

推荐理由:HKR 三项都成立:Google 把实时语音翻译绑定了 70+ 语言和说话人未结束就开始的流式输出。分数留在 82,因为正文没披露具体上线范围、定价和基准测试结果,实际效果和可用性还得等验证。

AI HOT 精选

一位开发者用 GPT-5.5 替代 OCR 流程,把 2.3 万篇 ChinaRxiv 论文免费开放并配上更完整的英文翻译

这件事的起点很简单:有人觉得传统的 OCR(光学字符识别)管道太复杂,直接用 GPT-5.5 来读论文、做翻译,结果把 23,000 多篇 ChinaRxiv 上的论文免费放出来了,还带了比之前更完整的英文翻译。正文没披露具体成本、延迟和翻译质量对比,所以没法判断这套方案在准确率和开销上到底比 OCR 好多少。如果是真的省钱又省事,对需要批量处理中文论...

推荐理由:我会先打个折:这不是 OpenAI 官方模型发布,而是一个开发者用例,所以推荐分在 78–84 这个区间。HKR 三项都踩中了——用 GPT-5.5 砍掉 OCR 管道是个很具体的钩子,23,000+ 篇论文的规模也给了实感,对做文档处理和研究的人确实有用。但正文没披露成本、延迟和翻译质量对比,这点先别太激动,没法判断准确率和开销到底比 OCR 好多少。如果是真的省钱又省事,那对批量处理中文论文的场景挺有参考价值。

r/LocalLLaMA

苹果在 WWDC 发布了 CoreAI,一个给自家芯片用的端侧推理引擎,用来替代 CoreML

苹果在 WWDC 上公布了 CoreAI,定位是 CoreML 的继任者,专门在苹果芯片上跑模型推理。模型得先用 Python 脚本转一道才能用,目前支持的模型列表主要是 2025 年年中左右的版本。帖子正文没给出任何性能数据,速度、内存占用、功耗这些关键指标一概没提,所以实际跑起来快不快、省不省资源还不好说。另外原帖链接返回了 403,说明 Redd...

推荐理由:帖子本身信息很薄:CoreAI 接棒 CoreML、需要 Python 转换脚本、模型支持范围有限,这些是事实。但吞吐量、延迟、功耗一概没提,原帖链接还返回了 403,说明来源本身就不完整。苹果的本地推理引擎变动确实值得关注,但这点先别太激动,因为验证不了实际省不省资源。

AI HOT 精选

一个编程 Agent 串起两个 HuggingFace Space,自动生成了一个巴黎地标 3D 画廊

作者让一个编程 agent 自己动手,把 ideogram-ai/ideogram4 和 VAST-AI/TripoSplat 这两个 Space 串了起来。流程是:先用 ideogram4 生成巴黎地标的图片,再把图片喂给 TripoSplat,从单张图片重建出 3D 高斯泼溅文件(.ply),接着转成体积小约 3 倍的 .ksplat 格式,最后用...

推荐理由:我会先打个折:这不是模型或平台发布,而是一篇 Hugging Face Spaces 的实操教程。但作者把两个现成 Space 串起来,让 agent 自己跑通从文字到 3D 场景的流程,还给出了约 3 倍的压缩数据,对做 agent 编排和轻量 3D 管线的人挺实用。正文没披露生成质量和延迟的具体测试,这点先别太激动。整体放在 featured 档位合适。

AI HOT 精选

Qwen3.7-Max 靠一份 15 万字文档,4 小时做出能跑的手机和网页应用

实验里 Qwen3.7-Max 不看设计稿、不接后端,只读一份约 15 万字的产品调研文档,在隔离环境里分别生成了安卓 APK 和一个 Web 应用,单端耗时约 4 小时,中间没人插手。模型本身看不懂图,它是通过像素坐标反推布局来还原界面。做法是把任务拆成规划、架构、编码等阶段,每步做完就检查——静态检查、编译自检(0 error)、Web 端 34 ...

推荐理由:我会先打个折:正文没披露失败率、重试次数、人工介入点,也没说这15万字文档本身质量如何。但亮点在于它把模型看不懂图这个短板说清楚了——靠像素坐标反推布局,不是真懂设计。任务拆成规划、架构、编码并逐段自检的做法,让4小时出双端这件事有了可复现的骨架。如果是真的挺省钱,但没给对比基线,先别太激动。

AI HOT 精选

Cursor 把欧洲总部放在伦敦,计划招 200 人;SpaceX 手里攥着 600 亿美元收购它的选择权

Cursor 是做 AI 编程助手的,你告诉它想开发什么功能,它能自动生成代码。这次它把欧洲总部定在伦敦,主要是看中当地技术人才多、语言多元,方便服务整个欧洲市场。公司计划年底前把欧洲团队从现在的七八十人扩到 200 人左右,还会在巴黎、慕尼黑等城市设小办事处。一个关键背景是,很多欧洲客户(尤其是金融、医疗这类强监管行业)要求数据必须留在欧洲境内,所以...

推荐理由:Cursor 把欧洲总部放在伦敦,年底前团队要翻倍到 200 人,这本身是常规扩张。但 SpaceX 手里那个 600 亿美元的收购选择权让整件事变味了——一个做代码助手的公司被这种量级的选项挂着,估值想象力直接拉满。正文没披露触发条款和行权条件,这点先别太激动。另外提到 100 亿的合作伙伴数字,也没说清是收入口径还是 GMV,我会先打个折看。整体信息密度高,但信源单一,所以停在 77 分不进 78 那档。

AI HOT 精选

小米 MiMo 1T 模型跑出每秒超 1000 token,靠混合量化和并行解码把速度提了 10 倍

小米 MiMo 和 TileRT 给 1T 参数旗舰模型加了个 UltraSpeed 模式,输出速度首次超过 1000 tokens/s。模型这边用了 FP4 混合量化,只量化 MoE 的 Expert 部分,搭配 DFlash 的块级 masked 并行推测解码,coding 场景下平均一次能接受 6.30 个 token,相当于猜对的命中率不低。系...

推荐理由:我会先打个折:正文没提硬件配置、batch size、并发数,也没说测试用的 prompt 长度和具体环境,所以这个 1000 tokens/s 的绝对值先别太激动。但亮点是技术组合说得清楚——FP4 只量化 MoE 的 Expert 部分,不是全模型瞎压,搭配 DFlash 的块级 masked 并行推测解码,coding 场景下一次能猜对 6.30 个 token,命中率不低,说明这套方案在代码生成这种结构化输出上确实有效。小米给旗舰模型开 UltraSpeed 模式,还定了三倍 Pro 版的价格,摆明了是要在推理速度和 API 商业化上抢个身...

AI HOT 精选

SpaceX 要把 AI 数据中心搬上近地轨道,单颗卫星持续算力约 120 kW,延迟 6-8 毫秒

马斯克公布了 SpaceX 的 AI1 轨道 AI 数据中心卫星方案。每颗卫星峰值功率 150 kW,持续计算功率约 120 kW,大致相当于一个 NVIDIA GB300 机架的算力。卫星跑在 600-800 公里高的近地轨道,通过激光链路互联,带宽约 1 Tbps,往返延迟 6-8 毫秒。散热靠双面散热器,排热能力 1,400 W/m²;太阳能板效...

推荐理由:我会先打个折:发射时间、单颗卫星成本、实际跑过什么推理任务,正文都没提,所以别急着把它当成马上能用的方案。但亮点是实打实的——150 kW峰值功率、120 kW持续算力,直接对标一个GB300机架,散热靠双面散热器做到1,400 W/m²,这些数字说明散热和供电在工程上是认真算过的。激光链路1 Tbps、往返6-8毫秒的延迟,对近地轨道来说算低,但跟地面数据中心比还是高出一截,适合对延迟不那么敏感的大批量推理任务。整体看,这是个有硬核参数支撑的轨道算力方案,不是画饼,但离落地还差关键信息。