跳到正文

产品更新

AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。

841 条精选相关主题模型发布行业动态AI 编码

最新精选

第 61–80 条 · 共 841 条

6月8日星期一

Hacker News 首页

小米发布 MiMo-V2.5-Pro-UltraSpeed,万亿参数模型跑到每秒 1000 个 token

小米和 TileRT 合作,把一个 1 万亿参数的大模型在 8 张普通 GPU 上跑到了每秒生成 1000 多个 token。他们用了两招:一是只对 MoE 专家模块做 FP4 量化,把模型体积和显存带宽压力打下来,同时保住推理质量;二是用了一种叫 DFlash 的投机解码方法,一次能猜对更长的 token 串,减少反复验证的等待时间。目前这个速度只在...

推荐理由:小米把一个1万亿参数的MoE模型塞进8张普通GPU,靠FP4量化只压缩专家模块,再配上能一次猜对更长token串的DFlash投机解码,把生成速度拉到每秒1000多个token。这个速度如果是真的挺省钱,但正文没交代测试用的什么卡、上下文多长、精度损失多少,我会先打个折。

AI HOT 精选

Hivemind 给 AI 编程助手加了个“记性”,能把每次干活的经验存下来复用

Hivemind 这个工具现在开放了持续学习功能,专门给 AI 编程智能体用。它会自动收集 Claude Code、Codex、Cursor、Hermes、Pi 这些助手干活时的操作轨迹,把成功的套路提炼成可复用的技能,存到你自己的云盘里,再同步给所有助手。内置的 SkillOpt 负责持续训练这些技能,效果上,Claude Code 准确率涨了 19...

推荐理由:HKR三项都站得住,但这是Hivemind的一次功能更新,不是大厂动作,也没有其他来源交叉验证。52个场景的测试结果让它有干货,够格进低位的featured。

AI HOT 精选

小米 MiMo 在单台 8 卡服务器上把万亿参数模型跑到每秒 1000+ token

小米和 TileRT_AI 放出了一个叫 MiMo-V2.5-Pro-UltraSpeed 的版本,用一台普通的 8 卡 GPU 节点就跑起了 1 万亿参数的 MoE 模型,输出速度超过每秒 1000 个 token。这个速度不是靠 Cerebras 或 Groq 那种专用硬件堆出来的,对常规部署来说挺省钱。他们开了限时免费聊天可以上手试,API 价格...

推荐理由:小米这个版本最吸引人的点是用普通 8 卡 GPU 节点把 1T MoE 模型跑到每秒上千 token,没靠 Cerebras 那种专用硬件,部署成本听起来低了不少。我会先打个折:正文没披露具体任务类型、精度损失、首 token 延迟和实际 API 定价,所以这个速度是在什么条件下测的还不清楚。限时免费聊天可以上手试,但长期性价比得等更多数据。这点先别太激动,不过如果属实,对常规推理部署确实挺省钱。

AI HOT 精选

微软AI负责人说超级智能快来了,但不会抢你饭碗

Mustafa Suleyman 在播客里聊了几个事。他判断超级智能不会造成大规模失业,但没给出具体论证。微软去年10月跟 OpenAI 签了新合同,一边继续合作,一边拿到了独立研发超级智能的许可,已经建了团队、在训前沿模型,本周 Build 大会还发了7个全模态模型。他点名批评 Anthropic 把 Claude 说成有意识,认为现在消费者对 AI...

推荐理由:Mustafa Suleyman 在播客里抛了个大判断——超级智能不会造成大规模失业,但正文没给出具体论证,这点先别太激动。信息量主要靠两个事实撑着:一是微软去年10月跟OpenAI签的新合同,既续了合作又拿到了独立研发超级智能的许可,团队和前沿模型训练都已经在跑了;二是本周Build大会发了7个全模态模型。他还点名批评Anthropic把Claude说成有意识,认为现在消费者对AI的理解还太浅。整体是CEO访谈,不是产品发布,所以分数卡在78-84这个区间。

AI HOT 精选

阿里云把 AgentScope 的 Java 版升到 2.0,主打企业级智能体在 JVM 环境里跑生产

这个版本把架构改成了分布式无状态,能挂在 K8s 上自动扩缩容,会话断了也能恢复。多租户用 Workspace 做数据隔离,权限控制做得比较细,还加了人工介入的环节。长期运行靠 HarnessAgent 管上下文和容错。开源地址在推文链接里,但正文没给出性能基准或实际部署规模的数据。

推荐理由:阿里云把 AgentScope 的 Java 版推到了 2.0,这次改动挺实在:架构拆成分布式无状态,能挂在 K8s 上自动扩缩容,会话断了也能接上。多租户用 Workspace 做数据隔离,权限粒度更细,还加了人工介入环节,长期任务靠 HarnessAgent 管上下文和容错。我会先打个折——正文没给性能基准,也没说实际部署规模,所以这些能力到底省多少资源、稳不稳,还看不出来。开源地址在推文链接里,但没披露定价或落地案例。整体是给 Java 技术栈的企业把智能体往生产环境推了一步,信息缺口明显,先放在 featured 这档。

AI HOT 精选

微信在测试右滑拉起的 AI 助手,能直接调小程序干活,还和主流手机厂商打通了

腾讯正在灰度测试一个藏在微信里的 AI 助手,右滑就能呼出。它用自然语言指令直接调用数百万个小程序,比如帮你点咖啡。微信还跟华为、荣耀、小米、OPPO、vivo 合作,让手机系统助手也能跨应用调微信的服务,6 月 8 号已经放出了开发者接入指引。不过原文因为环境异常没加载出完整内容,具体的技术实现和开放范围正文没披露。

推荐理由:这条消息的钩子很足——微信开始把自己当成 agent 运行环境,不是只聊天,而是直接调小程序干活,还同步打通了手机厂商的系统级入口。我会先打个折,因为原文没加载完整,技术方案、开放范围、模型选型这些关键信息正文都没披露,所以暂时不能给更高分。但右滑入口加开发者指引加五家厂商合作,三个点放在一起,已经足够让从业者重新评估微信在 agent 分发上的位置。

AI HOT 精选

微信 AI 开始内测,开发者有两种方式让小程序被 AI 直接操作

微信开放平台发了接入指引,确认微信 AI 在内测。开发者可以选两种模式:自动模式是授权平台读小程序源码,不用额外开发,AI 就能分析页面并直接操作;开发模式是自己写技能提交审核,让 AI 调用。两种模式不冲突,可以同时开,也不影响现有小程序服务。官方说“微信 AI”这个名字可能还会改。

推荐理由:这条消息对微信生态的开发者很关键,因为官方终于给出了接入路径,不是画饼。自动模式等于让 AI 直接读你的小程序源码去干活,省掉额外开发,但正文没提对复杂页面的理解准确率怎么样,这点先别太激动。开发模式更灵活,但需要自己写技能并审核,上线节奏和审核标准也没说。整体看,平台动作明确,但模型能力、收费方式和正式开放时间都还是空白,所以分数卡在 featured 门槛附近。

AI HOT 精选

苹果发了第三代基础模型,一共五款,从手机端到云端都有

苹果在 2026 年 6 月 8 日公布了第三代 Apple Foundation Models(AFM),这次是和 Google 合作定制的。五款模型里,两款跑在设备上:AFM 3 Core 是 30 亿参数的密集模型,质量比上一代好;AFM 3 Core Advanced 是 200 亿参数的稀疏模型,但每次只激活 10 到 40 亿参数,靠的是把...

推荐理由:苹果这次一口气发了五款模型,分设备端和服务器端两条线,还拉上 Google 做定制,信息量够硬。30 亿参数的密集模型和 200 亿参数但每次只激活一小部分的稀疏模型,思路很明确:在手机上跑得动,在云端也能控成本。正文没给具体跑分和定价,所以我会先打个折,但官方发布本身就有分量,尤其对做端侧推理和隐私计算的人。

AI HOT 精选

ChatGPT 要变成 AgentGPT 了

OpenAI 准备给 ChatGPT 做上线以来最大的一次改版,从聊天机器人转成一个能直接干活的 Agent 平台。它会整合自家的编程工具 Codex、图像生成,还会接入 Canva、Booking 这类第三方应用。高管放话说“聊天已死”,目标是做成跨平台的个人 AI 助手,以后甚至不用你手动输入提示词。改版预计几周内在网页和手机端上线。商业压力不小:...

推荐理由:这条消息把改版讲得挺清楚,但来源只是一条 X 帖子,正文没披露正式上线时间、开放范围和定价,我会先打个折。高管那句“聊天已死”听着唬人,实际产品还没交付,这点先别太激动。整体判断是:方向重要,落地细节还缺,所以放在 84 分这个位置。

6月7日星期日

r/LocalLLaMA

一台笔记本跑通 Qwen3.6 35B-A3B:我的本地模型“从零到一”时刻

一位 Reddit 用户分享了自己在笔记本上跑通 Qwen3.6 35B-A3B 的体验。他的机器是华硕 Zenbook Pro 14,配了 RTX 4060 8GB 显存和 64GB 内存。用 llama.cpp 加载 unsloth 的 IQ3_XXS 量化版模型,在 3.2 万 token 上下文时生成速度约 27 token/秒,拉到 25.6...

推荐理由:这是单个用户的 Reddit 实测,不是官方发布或论文,但硬件、量化方式、上下文长度和速度都给得很具体,对想在自己机器上跑大模型的人有直接参考价值。我会先打个折,因为只有一台机器的数据,不代表普遍表现,但信息密度够上 featured,分数放在 72–77 这个区间合理。

AI HOT 精选

北海道农民雇了个叫 Codex 的工程师,用 AI 干了 8 件农活

北海道农民富安弘毅把 ChatGPT 和 Codex 当工程师用,做了 8 件事:拍照识别西兰花病害、用卫星 NDVI 数据看作物长势、拿 ESP32 加 LINE 机器人远程开关温室卷帘、给农场群聊写了个管温度和排期的机器人、从聊天记录里自动统计播种数量、研究 RTK-GPS 自动转向原理并算了自建要花多少钱、用 Airtable 搭了农场管理数据库...

推荐理由:我会先打个折:全文只有一个人、一个农场,没有产量对比或省了多少工时的数字,所以不能当行业证据用。但它的价值不在严谨,而在把 AI 写代码这件事从屏幕拉到了泥地里——一个农民没找外包、没学编程,直接用 Codex 做出了 8 个能跑的工具。这种'非程序员用 AI 写代码干物理世界的活'的案例现在还很少,对国内做 agent 和 coding 方向的人是个挺新鲜的参照。

FT · 科技

OpenAI 计划对 ChatGPT 做上线以来最大一次改版,但具体怎么改正文没披露

FT 这篇报道的正文被付费墙和安全验证挡住了,只拿到了一个摘要片段。里面提到 OpenAI 正在筹划 ChatGPT 自发布以来最大规模的一次改版,想把聊天机器人重新定位成通往更高利润产品的入口,为可能的 IPO 铺路。公司估值写的是 8500 亿美元。至于这次改版到底会加什么功能、什么时候上线、怎么收费、产品机制是什么,正文都没披露,这些关键信息目前...

推荐理由:FT 这篇报道的正文被付费墙和安全验证挡住了,只拿到一个摘要片段。里面提到 OpenAI 正在筹划 ChatGPT 自发布以来最大规模的一次改版,想把聊天机器人重新定位成通往更高利润产品的入口,为可能的 IPO 铺路。公司估值写的是 8500 亿美元。至于这次改版到底会加什么功能、什么时候上线、怎么收费、产品机制是什么,正文都没披露,这些关键信息目前是空的。所以这条消息的新闻价值在于信号本身——OpenAI 在认真考虑把 ChatGPT 从免费流量池变成付费产品管道——但具体怎么落地、靠不靠谱,现在完全没法判断。我会先打个折,等有功能细节和定价策略...

TechCrunch · AI

OpenAI 推出锁定模式,关掉联网功能来防提示注入攻击

OpenAI 给 ChatGPT 加了一个叫 Lockdown Mode 的开关,主要给处理敏感数据的商业用户和个人用。打开后,ChatGPT 会禁用实时网页浏览(只能读缓存内容)、从网页抓取和显示图片、深度研究以及让模型进业务流程干活的 agent 模式。这么做的目的是降低一种叫“提示注入”的攻击风险——攻击者会把恶意指令藏在网页或文件里,诱导模型把...

推荐理由:OpenAI 把提示注入防御做成了一个用户可操作的开关,不是后台补丁,而是直接限制四个高风险功能。对处理敏感数据的企业和个人来说,这是个实打实的安全选项,虽然会牺牲一部分能力,但换来了更可控的环境。安全/产品类新闻里算有分量,但比不上模型发布或重大能力更新。

6月6日星期六

AI HOT 精选

GitHub 开源 Spec Kit:先写产品规范再让 AI 写代码,把 vibe coding 的流程反过来

GitHub 把 Spec Kit 开源了,专门解决 AI 编程里一个常见毛病:需求还没说清楚,模型就开始写代码,结果边界漏了、反复返工。这个工具包把流程倒过来——先写产品功能规范,再让 AI 根据规范去澄清差距、做技术计划、拆任务,最后交给 agent 执行。规范本身成了可执行的开发合约,不是一份看完就扔的文档。目前支持 Copilot、Claude...

推荐理由:我会先打个折:正文没披露这套流程在实际项目里能省多少返工时间,也没给出和直接让 Copilot 写代码的对比数据。但故事本身够硬——GitHub 把“先写规范再写代码”这个老规矩做成 AI 编码的入口,规范不再是看完就扔的文档,而是驱动 agent 执行的合约。支持 Copilot、Claude 等多模型,109K+ 星说明开发者对这套思路的认可度不低。这点先别太激动,但方向对,值得跟。

新智元 · 公众号

Anthropic 花 280 美元一单,请 1000 名工程师给 Claude 的代码打分

Anthropic 通过 Snorkel 的 Marlin 项目招募了约 1000 名软件工程师,专门审查 Claude 写的代码。每完成一单任务给 280 美元,工作流包括在 GitHub 仓库里提 Pull Request、对 AI 生成的两版代码做 A/B 对比,然后从正确性、安全性、可靠性和可维护性四个维度打分。正文没披露这些工程师的资历门槛、...

推荐理由:HKR 三项都成立:价格和人数有传播力,流程和评估维度够细,对做代码 Agent 的团队有参考价值。放在 featured 合适,但不到 p1,因为这不是新模型或新能力发布,更像一次数据标注合作的具体披露。正文没披露工程师资历门槛和任务一致性控制,这点先别太激动。

AI HOT 精选

Google 发布 Colab 命令行工具,本地终端能直接调用云端 GPU 跑脚本了

Google 把 Colab 搬进了终端。装一个命令行工具,就能在本地敲指令直接租用 A100 或 T4 这类高性能 GPU,把本地的 Python 脚本扔到云端跑,跑完再把模型、数据集和可回放的 notebook 日志拉回本地。它还给 AI 编程助手(比如 Antigravity、Claude Code)准备了现成的技能文件,让这些助手也能自己调 G...

推荐理由:Google 给 Colab 出了个命令行工具,不用开浏览器就能在终端里租 GPU 跑代码,跑完自动把模型和 notebook 日志拉回本地。还顺手给 Claude Code 这类 AI 编程助手配了技能文件,让助手也能自己调 GPU。对经常用 Colab 白嫖算力或者想给 agent 接远程执行环境的人来说,这比网页版灵活不少。不过正文没提价格变化和并发限制,实际租用体验还得看后续。

AI HOT 精选

Gemini Live 现在能边聊边改图,摄像头对着什么就实时生成新画面

Gemini 应用里的 Live 模式加了实时生图和编辑功能。你打开摄像头,告诉它你想看到什么,它就能当场改画面,比如换墙色、加家具、把眼前场景变成梗图。正文没提生成一张图要多久、支持哪些画风,也没说免费额度怎么算。

推荐理由:Gemini Live 现在能边看边改图了,你开着摄像头说“把墙刷成蓝色”或者“加个沙发”,它当场给你变出来。这功能听着挺唬人,但正文没交代生成延迟、画风支持范围,也没提免费额度,所以实际用起来卡不卡、花不花钱,都得打个问号。HKR 全过:标题有实时交互的噱头,操作门槛低到只剩张嘴,而且直接冲着修图软件和创意工具去的,竞争味很浓。

Hacker News 首页

General Instinct 开源 InstinctRazor:把 245GB 的大模型压到 48GB,能在本地设备上跑

General Instinct 开源了 InstinctRazor,一个专门给边缘设备用的模型压缩方案。他们拿 Qwen3.5-122B-A10B 开刀,这个模型原本是 BF16 格式的混合专家模型(MoE),体积大约 245GB。压缩后变成一个 48GiB 的 GGUF 文件,比 Gemma-4-26B-A4B 还小,但在 MMLU-Pro 和 G...

推荐理由:我会先打个折:这是 YC 的 Launch HN,不是独立评测,性能数据得等第三方复现。但亮点很实在——把一个 245GB 的 MoE 模型压到 48GiB,还能在消费级显存上跑 8k 上下文。正文没披露压缩后推理速度有多快,也没说 MMLU-Pro 具体掉了多少分,这点先别太激动。不过思路本身对想在本地跑大模型的团队挺省钱,所以放在 featured 合适。

Hacker News 首页

Google 发布 Gemma 4 的 QAT 版模型,让手机和笔记本跑起来更省内存

Google 放出了 Gemma 4 的量化感知训练(QAT)检查点。简单说,就是在训练时就考虑压缩,而不是训完再硬压,这样模型在手机、笔记本上跑的时候占内存更小、速度更快。不过这篇公告只给了个标题和链接,正文没披露具体压到几比特、有哪些尺寸、跑分对比和发布时间。我会先打个折,等实际模型放出来再看效果。

推荐理由:Google 放出了 Gemma 4 的量化感知训练检查点,目标是在手机和笔记本上跑得更省内存、更快。但公告正文太薄,没给出具体压到几比特、有哪些尺寸、实测提升多少,也没说什么时候能拿到模型。信息缺口明显,只能先给 featured 底分,等实际模型和跑分出来再重新判断。

6月5日星期五

AI HOT 精选

苹果内部把新版 Siri 标成“Beta”,不会当成品来宣传

彭博社记者古尔曼爆料,苹果内部将新版 Siri 标记为“Beta 版”,意味着它不会被宣传成完全成熟的产品。苹果可能还会像当初推 Apple Intelligence 那样,给想尝鲜的用户设一个等待名单。另外,iOS 27 的部分 Siri 请求会转到 Google Cloud,调用授权版 Gemini 模型,并跑在谷歌的英伟达 Blackwell B...

推荐理由:HKR 三项都成立:Siri 标 Beta 是苹果自己的态度信号,Gemini 和 B200 的细节让爆料有料,苹果 AI 依赖外部算力和模型这件事本身就容易引发讨论。分数定在 82 合理,因为毕竟还是未发布产品的二手报道,不是官方发布或重大产品事件。