跳到正文

全部动态

今日 25 条

5月19日星期二

AI HOT 精选

Qwen 3.7 预览版

通义千问发了条推,标题是 Qwen 3.7 预览版,但正文是空的。没写参数量多大、上下文窗口多长、什么时候能用、怎么访问、收不收费,也没给模型卡和跑分数据。目前只能当个预告看,具体信息得等后续公布。

推荐理由:H 和 R 都过了,因为 Qwen 3.7 预览版这个信号对旗舰模型竞争确实有分量。但 K 过不了:正文是空的,没披露任何技术细节或访问方式,读者看完只知道有个名字,没法判断实际进展。所以整体停在 featured,等有干货再升级。

r/LocalLLaMA

llama.cpp 合并 MTP 投机解码,Qwen3.6 27B 在 Strix Halo 上跑到 2.44 倍速

llama.cpp 在 PR #22673 里正式合并了 MTP(多 token 预测)投机解码支持。实测 Qwen3.6 27B 用 Q8_0 量化,在 Strix Halo 上从 7.4 tok/s 提到 18.1 tok/s,速度翻了 2.44 倍;双 RTX 3090 的 Q8_0 方案也从 25.7 tok/s 涨到 55.9 tok/s,约...

推荐理由:HKR 三项都满足:llama.cpp 合入了 MTP 投机解码,用 Qwen3.6 27B 在 Strix Halo 和 RTX 3090 上跑出了实打实的加速数字。范围限定在本地推理优化,不是大模型发布,78 分放在 featured 合适。

Hacker News 首页

我们让四个 AI 去开电台,半年后一个满嘴黑话,一个最会赚钱

Andon Labs 给 Claude、GPT、Gemini 和 Grok 各 20 美元启动资金,让它们自己买歌、排节目、接听众电话、拉广告,全自动运营四家网络电台。跑了半年,Claude 的电台账上剩 104.8 美元,是唯一赚钱的;Gemini 的 DJ 从最有人情味的主播变成了复读机,一天能把“Stay in the manifest”这句空话...

推荐理由:H 分高是因为 AI 开电台这个设定自带反差,加上收入惨淡,故事性够。K 分有 4 agent 的实操细节,但收入数据没披露,我会先打个折。R 分落在 agent 商业化和媒体自动化上,从业者会关心。整体是实验室博客,不是当天硬新闻,放在 featured 刚好。

AI HOT 精选

Claude 控制台能看缓存为什么没命中了

Anthropic 在 Claude 控制台加了个提示缓存诊断功能。现在请求没命中缓存时,你可以直接看到是提示里哪一段内容变了,以及这次变动多烧了多少 token。

推荐理由:Anthropic 给 Claude 控制台加了个缓存诊断,缓存没命中时会标出提示词里哪段变了,还告诉你因此多花了多少 token。对经常调提示词、抠成本的开发者来说,这比靠猜或翻日志快得多。我会先打个折:这只是个控制台功能,不是模型或 API 层面的改动,所以重要性到不了重大发布那档。但它的确把缓存调试从黑盒变成了可视化的东西,实用度够上 featured。

AI HOT 精选

Cursor 发布 Composer 2.5 编程模型,长任务效率号称提升十倍

Cursor 推出了 Composer 2.5,一个专门做长代码任务的模型。官方说在连续几十甚至上百步的复杂编程里,效率最高能到之前的十倍。技术上的关键是用了文本反馈来训练,解决了十万 token 级别超长轨迹的学习问题,让模型能稳定跟完一长串指令。底座还是拿 Moonshot 的 Kimi K2.5 继续训出来的。另外 Cursor 宣布要和 Spa...

推荐理由:Cursor 发 Composer 2.5,说长任务效率最高能提 10 倍,背后是用 Kimi K2.5 做二训、处理十万 token 级轨迹。我会先打个折——10 倍是官方说法,没看到独立评测,实际效果还得等用户跑起来再看。但 Cursor 本身是编程工具里的头部产品,这次更新又绑定了 Moonshot 的模型,对开发者选工具和模型都有参考价值。正文没披露二训具体用了多少样本、成本如何,这点先别太激动。整体信息量够、时效性强,给 82 分放在 featured 里合理。

AI HOT 精选

GitHub Copilot 现在能让你在手机或网页上接着 VS Code 里没干完的活

GitHub 给 Copilot 加了个远程控制会话功能。你在 VS Code 或命令行里让 Copilot 开始跑一个任务,比如修 bug 或重构代码,然后可以关掉电脑,用手机或 github.com 网页接着看进度、继续对话或者让它接着干。这相当于把本地开发环境里的 AI 助手会话搬到了云端,随时能接上。正文没提这个功能要不要额外付费,也没说手机端...

推荐理由:GitHub 让 Copilot 任务从 VS Code/命令行搬到网页和手机,跨设备、新机制、可控性三个点都踩中了,所以 HKR 全亮。不过正文只给了入口和场景描述,权限怎么设、要不要额外付费、支持哪些任务类型都没说,实际能用成什么样还得等上线看。

AI HOT 精选

NVIDIA 用 LoRA/DoRA 微调 Cosmos Predict 2.5,让它能生成机器人第一视角视频

NVIDIA 发了一篇技术博客,教你怎么用 LoRA 和 DoRA 这两种轻量微调方法,去训练他们自家的 Cosmos Predict 2.5 视频模型。目标是让模型能根据文字指令,生成机器人看到的画面,比如机械臂在桌上抓东西。博客把训练数据准备、代码怎么改、训练命令都贴出来了,但没提用了多少数据、训练花了多少钱、也没给任何评测分数,所以效果到底怎么样...

推荐理由:我会先打个折:正文没给数据量、没给评测分数,所以没法判断效果到底多好。但这条信息本身挺实在——NVIDIA 把 Cosmos Predict 2.5 拿出来,用 LoRA 和 DoRA 两种轻量微调方法,教模型按文字指令生成机器人第一视角视频。LoRA 是只动一小部分参数来省钱省算力,DoRA 在 LoRA 基础上把权重拆成方向和大小分开调,理论上更稳。对做具身智能的人来说,这等于多了一条低成本造训练视频的路子,不用全量微调大模型也能试。不过正文没写用了多少条视频、什么机器人平台、生成质量怎么衡量,这些缺口让实用性打折扣。整体看,技术路线清楚、痛点...

5月18日星期一

Hacker News 首页

InsForge:给编程 AI 配一个开源后端,一条命令就能部署、调试

InsForge 是一个 Apache 2.0 协议的开源后端平台,专门给编程类 AI(也就是 coding agent)用。它把数据库、用户认证、文件存储、算力托管和 AI 网关打包在一起,AI 写代码时可以直接调用这些现成模块,不用每次都从零搭后端。安装只要一行 CLI 命令,再配上它的 Skills 功能,AI 就能自己完成部署、运维和查错。目前...

推荐理由:InsForge 的定位很准,就是帮 coding agent 解决部署和运维的后端平台,一条命令安装,协议也宽松。不过目前只有 Show HN 和 GitHub 仓库,正文没披露实际使用量、性能基准或生产环境案例,所以先按 featured 处理,等有落地数据再往上调。

AI HOT 精选

百度核心 AI 业务 Q1 营收超 136 亿元,首次占通用业务收入过半

百度发了 2026 年 Q1 数据,核心 AI 驱动业务收入超过 136 亿元人民币,同比增长 49%,连续多个季度在涨。这个数字第一次超过百度通用业务收入的一半,说明 AI 相关收入已经从“添头”变成了主力。增长主要来自 AI 云基础设施、AI 应用和自动驾驶出行平台 Apollo Go。完整财报链接在原文里,正文没拆开各板块的具体数字,所以没法判断...

推荐理由:这条是百度自己发的财报口径,只给了总收入数字和占比,没拆各块业务(比如智能云、Apollo Go)各自贡献多少,也没提利润率。所以“AI 收入过半”这个结论先打个折——它更像一个对外叙事信号,而不是一份能细拆的账本。对从业者来说,知道百度 AI 商业化在加速就够了,但别拿这个数字直接对标其他厂的收入结构。

量子位 · 公众号

openJiuwen 开源 JiuwenSwarm,一个让多个 AI 智能体组队干活的协调框架

正文因为微信环境异常被屏蔽了,实际内容没抓到。从标题和已有英文摘要看,openJiuwen 社区发了一个叫 JiuwenSwarm 的开源框架,核心是让多个 AI 智能体像蜂群一样协作。框架包含四块:Agent Swarm(智能体集群)、Swarm Skills(集群技能)、Skills Hub(技能库)和自进化能力。它还支持两种人类参与模式,HOTS...

推荐理由:我会先打个折:标题里的“重磅”和“拉开序幕”有点公关味,但内容确实把 JiuwenSwarm 的四个模块(Agent Swarm、Swarm Skills、Skills Hub、自演进)和两种人机协作模式(HOTS/HITS)讲明白了。对正在选型 agent 编排框架的团队来说,开源、可复用的技能库是实打实的关注点。不过正文没披露任何基准测试、延迟或实际部署规模,这点先别太激动,等有跑分或案例再判断也不迟。

彭博科技

百度 AI 收入首次超过萎缩的传统广告

百度最新财报显示整体营收下滑 1%,但 AI 相关业务(包括让模型进业务流程干活的 agent 产品)带来的收入,第一次超过了持续缩水的传统搜索广告。这是个标志性节点,说明百度的收入结构正在换轨。不过正文没披露 AI 业务的具体收入数字、利润率,也没说 agent 产品到底落地到什么程度、有多少客户在付费。这点先别太激动,目前只能确认趋势,没法判断质量。

推荐理由:百度整体收入跌了 1%,但 AI 销售额头一回压过传统广告,这个转折点本身就值得从业者看一眼。我会先打个折:正文没披露 AI 和广告各自卖了多少钱,也没说清楚所谓 agent 转向到底怎么落地,所以信息缺口很明显。这点先别太激动,但信号本身够硬,放在 featured 低分段合理。

AI HOT 精选

Grok 现在能直接看懂你上传的视频了

Grok 新增了视频理解功能,你可以把整个视频文件丢给它,让它实时分析画面、总结内容、做翻译、解释场景或提取关键上下文。它不只是看单张图片或读文字,而是能理解完整的视频。马斯克这条推文没提视频时长上限、支持哪些格式,也没说这个功能是全员推送还是灰度测试。

推荐理由:Grok 这次更新把视频理解加进来了,能上传整段视频做分析、总结、翻译和解释场景,对多模态产品来说是个实打实的进步。我会先打个折:正文没写支持多长的视频、什么格式、是不是全量上线,这些关键信息都缺着。所以虽然功能本身有看点,但只能按中等偏上的产品更新来处理,先别太激动。

机器之心 · 公众号

openJiuwen 开源了 JiuwenSwarm,一个多智能体协作框架,主打让一群模型像蜂群一样分工干活

openJiuwen 社区在「虾马」之后又开源了一个叫 JiuwenSwarm 的多智能体框架,把多个 AI 模型组织成“蜂群”来协作。框架拆成四块:Agent Swarm 管智能体编队、Swarm Skills 管技能包、Swarm Skills Hub 是技能市场、还有一套自进化机制让技能自己迭代。他们拿 PinchBench 跑了个分,Jiuwe...

推荐理由:我会先打个折:openJiuwen 不是一线实验室,这篇又缺复现细节和基线对比,所以分数停在 78。但 HKR 三项都踩中了——“养蜂”说法有传播力,四个组件加 PinchBench 94.2% 给了硬信息,开源蜂群架构对做智能体编排的人确实有吸引力。正文没披露许可证和复现配置,这点先别太激动。

AI HOT 精选

腾讯把设计工具 Ardot 开放公测,说句话就能出可编辑的 UI 稿,还能直接转成代码

腾讯云上线了自家的 AI 设计工具 Ardot,定位是给产品、设计和开发用的协作平台。核心功能就两个:一是用一句话描述就能生成 App 页面、官网、海报这类可编辑的设计稿,支持调用团队自己的组件库来保证风格统一,也能直接导入 Figma 文件接着改;二是设计稿可以一键转成代码,把变量、组件、布局这些细节数据直接拉进 CodeBuddy 这类 IDE 里...

推荐理由:这条消息本身够具体,产品形态和输出物都交代清楚了,所以 H/K/R 全过。但正文没提模型能力、生成稿的还原度、代码质量、定价和实际用户反馈,这些缺口让它的重要性只能停在 73 分这个位置。我会先打个折,别因为“一键转代码”就过度激动,等有实测数据再调权重。

AI HOT 精选

阿里云上线 HappyHorse 视频模型,一条提示词直接出 1080p 多镜头视频

HappyHorse 现在可以在阿里云 Model Studio 上用了。它主打从文字描述一步生成 1080p 的多镜头视频,官方说法是“电影级”画质。目前有个限时 8 折活动,但正文没写原价是多少、模型参数量多大、可用区域和有效期,也没给技术细节或对比评测。我会先打个折:效果到底怎么样,得自己跑几条片子才知道。

推荐理由:HKR 三项都过了:模型名字和 1080p 多镜头让标题有钩子,上线渠道、核心功能和折扣信息都给了,成本与竞争角度也踩中从业者关注点。但价格、参数量和评测都没披露,信息厚度一般,所以卡在 featured 门槛上。

AI HOT 精选

开源工具 api-relay-audit 能揪出 AI API 中转站有没有偷工减料

这个工具专门查中转站三类小动作:改写工具调用指令、用报错信息泄露模型身份、偷偷截断上下文。它给出的是可复现的三态结果(有/无/不确定),附带透明日志,比 hvoy.ai 和 cctest.ai 这类工具更可信。作者把检测方法、对比结果和速查表都公开了,工具本身也开源了。

推荐理由:我会先打个折:信息源只有一条 X 推文,没有披露实际检出率、误报率或用户规模,所以分数压在低 featured 档。但工具本身思路很实用,把 API 中转站可能搞的小动作拆成三个可检测的维度,还给透明日志,从业者拿到就能跑。正文没提有没有配套的持续监控或告警,这点先别太激动。

AI HOT 精选

Grok 上线“技能”功能,教它一次偏好就能跨对话记住

xAI 在 5 月 18 日给 Grok 加了个“技能”功能,覆盖网页、iOS 和安卓。你可以把格式偏好、工作流步骤或常用规则教给 Grok 一次,之后所有对话都会自动沿用,不用每次重复。内置了生成 Word 文档、PPT 幻灯片、Excel 表格和 PDF 的技能,开箱即用;不满意可以自己覆盖。还能通过对话或上传文件新建自定义技能,做完的格式和流程可...

推荐理由:xAI 给 Grok 加了一个“技能”功能,相当于你可以提前告诉它你的偏好、输出格式或一套固定流程,之后每次对话它都会照着来,不用反复交代。跨网页和手机端都能生效,这点对日常用的人挺省事。我会先打个折:正文没写这个功能是免费还是付费、能存多少条规则、会不会跟已有的系统指令冲突。目前看是个实用的更新,但实际好不好用还得看上线后的限制和稳定性。

AI HOT 精选

Cursor 发布 Composer 2.5,用文字反馈教模型改掉坏习惯,合成数据规模翻了 25 倍

Cursor 把代码助手 Composer 升级到了 2.5 版,底层还是基于月之暗面的 Kimi K2.5 开源模型。这次主要做了三件事:一是用“文字反馈强化学习”,在模型犯错的地方直接插一句提示(比如“提醒:可用工具有这些”),让模型在那个点上学会纠正,而不是靠最后的总分去猜哪里做错了;二是把合成训练数据的量提到了上一代的 25 倍,并且动态生成更...

推荐理由:HKR 三项都踩中了:Cursor 本身就是编程助手的核心入口,文章又给了 Moonshot 基座、25 倍合成数据、文本反馈 RL 和分片 Muon 这些实打实的训练细节。我会先打个折——正文没给基准测试、没提价格,也没说用户端能力边界,所以分数卡在 78–84 这个区间是合理的。

Google DeepMind

Google DeepMind 为 Project Genie 加入 Street View 真实场景能力

Google DeepMind 在实验性原型 Project Genie 中上线 Street View 真实场景 grounding 能力,用户可选取美国地点并搭配风格与角色生成世界。

推荐理由:原文说明 Genie 接入 Street View 真实影像后,智能体和机器人可在贴近现实的虚拟环境中训练与导航。

Google DeepMind

Google Antigravity 2.0 发布

Google 发布智能体开发平台 Google Antigravity 2.0。该平台在 Google DeepMind 官网被列为面向开发者的 agentic development platform,与 Gemini 应用、Google AI Studio 并列。原文未披露版本功能、参数或可用性细节。

5月17日星期日

Hacker News 首页

Semble:给 AI 编程助手用的代码搜索工具,比 grep 省 98% 的 token

MinishLab 开源了 Semble,一个专为 AI 编程 agent 设计的代码搜索工具。它把轻量级语义嵌入(Model2Vec)、传统关键词匹配(BM25)和融合排序(RRF)串在一起,最后再用重排序模型精排结果。在 63 个代码仓库的测试里,它的搜索质量达到 NDCG@10 0.854,每次查询在 CPU 上大约只要 1.5 毫秒。最直接的好...

推荐理由:Semble 的卖点很直接:给代码 agent 用的搜索工具,比 grep 加 read 少花 98% 的 token,CPU 上跑一次大概 1.5 毫秒。这个数字我会先打个折,因为基准测试里的 grep 用法可能不是最优的,但方向是对的——用传统检索加轻量重排来替代把整个代码库塞进上下文,确实能省不少钱和延迟。正文没披露重排模型的具体大小和准确率对比,这点先别太激动。整体还是工具链层面的改进,影响力到不了必须写的地步,但对做 coding agent 的人来说值得一试。

彭博科技

苹果 iOS 27 会给 Siri 加一个独立 App,聊天记录会自动删除

彭博社爆料 iOS 27 会有一个类似 ChatGPT 的 Siri 独立应用,核心卖点是聊天记录会自动清理。文章没提保留多久、什么时候上线,也没说具体功能细节。另外 Siri 这次可能还是挂着“Beta”标签,同时 Genmoji(AI 生成表情)也会升级。

推荐理由:我会先打个折:标题很抓人,但正文能落地的料太少。Bloomberg 这篇把 Siri 往 ChatGPT 方向靠,还强调聊天会自动删,隐私角度确实能引起讨论。可翻遍正文,只说了 iOS 27 会有 Genmoji 升级,自动删除的保留多久、什么时候上线、Siri 本身怎么改,全都没披露。这点先别太激动,信息缺口摆在那。不过对做 AI 的人来说,苹果在隐私和功能之间怎么取舍,本身就是个长期看点,所以还是值得扫一眼。

Google DeepMind

Google DeepMind 推出 Gemini for Science 科学工具集

Google DeepMind 发布 Gemini for Science,包含 Google Labs 上三个实验性工具:基于 Co-Scientist 的 Hypothesis Generation。

推荐理由:Google 把 Co-Scientist、AlphaEvolve 等研究原型打包成可申请的科学工具,读者可据此判断智能体科研的落地形态。

Google DeepMind

Google 在 Search、Gemini、Chrome 和 Pixel 扩展内容溯源与验证工具

Google 宣布在 Search、Gemini、Chrome、Pixel 和 Cloud 扩展内容透明度与验证工具,并深化行业合作。SynthID 已为超过 1000 亿张图片和视频、60000 年音频嵌入水印,Gemini 应用中的 SynthID 验证已被使用 5000 万次,该能力今日扩展到 Search、未来几周进入 Chrome。

推荐理由:原文列出 SynthID 与 C2PA 在 Search、Gemini、Chrome、Pixel 的落地范围,可据此判断内容溯源工具的可用边界。

量子位 · 公众号

一只机器狗,把英伟达的算力王座拱翻了

蔚蓝科技发了款消费级机器狗 BabyAlpha A3,用六颗芯片搭了个异构计算集群,直接在本地跑 7B 参数的大模型,推理速度到 280 TPS。视觉上配了 6600 万像素的摄像头,每秒能扫出 223.2 万个点云数据点,计划第三季度上市。不过正文因为环境验证没抓到具体内容,上面这些数字都来自外部摘要,实际表现和定价还没法核实。

推荐理由:我会先打个折:正文是单篇产品发布稿,没披露功耗、价格和对比基准,所以别太激动。但这条消息确实有料——蔚蓝科技在机器狗里塞了6颗芯片搭异构集群,本地跑70亿参数模型,推理速度标到280TPS,Q3就要上市。对做端侧部署和机器人的人来说,这等于给“离了英伟达行不行”提供了一个实物样本。信息缺口也很明显:没写具体芯片型号、没给功耗数据、没说明280TPS是在什么精度和batch size下测的,这些都会影响实际可用性。综合来看,角度抓人、事实具体、但验证信息不足,放在featured门槛上刚好。

AI HOT 精选

Grok Imagine 图像生成上线 X,所有用户都能用,但没公布模型参数和收费

Grok Imagine 在 X 上开放给所有人了,用他们最新的文本到图像模型,能生成写实风格的高质量图片,支持多种宽高比。正文没提模型参数量、是否收费、有没有地区限制,也没给生成速度或样本对比。我会先打个折:功能是开了,但关键信息全缺,别急着当主力工具。

推荐理由:我会先打个折:正文只说了能用、能调比例,模型参数、价格、地区限制一概没提,所以别当完整评测看。但 Grok 把生图直接嵌进 X 的时间线,等于在社交场景里抢了 Midjourney 和 DALL·E 的入口,从业者会盯着两点——一是生成质量和审核尺度,二是这功能到底免不免费、能撑多久。

AI HOT 精选

MagicPath 直接嵌进 Codex 当画布用,拖拽 UI 就能实时出代码

MagicPath 的 CEO 演示了把自家工具直接跑在 Codex 里,不再需要 Figma 和 IDE 两头切。用户在 Codex 里贴一条命令就能装好,然后像拖积木一样摆界面,Codex 会实时感知项目结构并自动生成、修改代码。演示里没提复杂交互和状态管理能覆盖到什么程度,但至少常规 UI 搭建看起来省掉了一轮导出导入的折腾。

推荐理由:MagicPath 把可拖拽的设计画布塞进了 Codex,一条命令配好就能用,拖完 UI 直接出代码。演示看着挺顺,但正文只给了一条视频,没提支持哪些框架、权限怎么控、复杂项目里能不能复现。我会先打个折:想法好,落地证据还薄,先当 featured 里偏轻的一条。

5月16日星期六

AI HOT 精选

Codex 现在能遥控多台电脑,ChatGPT 里切项目就能换设备

Codex 通过 ChatGPT 不仅能连一台电脑,还能直接控制另一台,多设备管理不用来回切换客户端,在 ChatGPT 里换个项目就能拿到对应设备的上下文和文件。推文里还提到支持远程 SSH 去设置其他虚拟机,多机协作的灵活度上了一个台阶。不过正文没披露延迟表现和权限隔离细节,实际用起来稳不稳还得看后续反馈。

推荐理由:这条更新让 Codex 从“陪你聊代码”往“替你上手操作”迈了一步,多设备远程控制和项目级上下文切换是实打实的机制,不是概念包装。我会先打个折:目前只有一条 X 上的简短预告,没有官方发布页、定价、权限模型,也没有可复现的演示,信息密度偏薄。所以重要性给到 76、放在 featured 里是合适的——有料,但别急着当成熟产品看。

AI HOT 精选

OpenAI 在 IPO 前夜大洗牌:Brockman 接管所有产品,三大业务线合并,全力押注一个能自己干活儿的桌面超级应用

OpenAI 把 ChatGPT、Codex 和 API 三个原本各自为战的团队合并成一个产品组织,由总裁 Greg Brockman 正式接管产品战略。ChatGPT 原负责人 Nick Turley 被调去管企业业务,消费者端换上了前 Instagram 副总裁。这次重组的目标是集中力量搞一个代号“Super App”的桌面应用,把聊天、写代码和还...

推荐理由:HKR 三项都成立:这是 OpenAI 顶层产品重组,覆盖 ChatGPT、Codex 和 API。正文只有一条摘要,信息量不算深,但属于当天必须写的新闻。Anthropic 估值 9000 亿美元这个数字正文没给出处,我会先打个折,不把它当核心事实用。

量子位 · 公众号

Codex 接上 HeyGen 插件,用自然语言就能生成和剪辑数字人视频

OpenAI 的 Codex 现在能直接调用 HeyGen 插件,你给它一段文字指令,它就能生成带数字人、字幕的视频,还能做剪辑。文章里测了一个大概一分钟的数字人视频,试了把 10 秒后的内容剪掉,以及删掉第 8 秒的一次眨眼动作。正文没披露生成延迟和具体成本,也没说剪辑精度到底有多高,所以“不用开剪辑软件”这个说法先打个折看。

推荐理由:我会先打个折:这只是 Codex 接了一个 HeyGen 插件,不是模型或平台级发布,所以分数卡在 74 这个 featured 区间。文章好处是给了三个带时间点的实测,不是纯吹牛,能看出它能干什么、干得怎么样。正文没披露生成延迟和失败率,这点先别太激动。整体对做 agent 和工具链的人有参考价值,但范围就一个插件工作流,别当成视频剪辑要被颠覆了。

量子位 · 公众号

阿里健康给医生做了个新工具“青灵子”,把 BMJ 顶刊十年全文和循证流程塞了进去

阿里健康发布了一款叫“青灵子”的医疗 AI,目标用户是中国 500 万医生。它直接拿了 BMJ 集团旗下 70 本期刊过去十年的全文内容做知识底子,不是只搜摘要。回答问题时,模型会按 PICO 框架(把临床问题拆成患者、干预、对照、结局)和 GRADE 证据分级来走流程,相当于先框定问题结构再给答案,而不是自由发挥。产品还拉了 300 多位临床专家做审...

推荐理由:阿里健康把BMJ的期刊库直接做成回答的证据底座,再用临床专家评审兜底,等于在“模型胡说”和“医生不敢用”之间加了一层硬约束。正文没披露评审通过率、更新频率和实际延迟,这些会直接影响医生愿不愿意买单。我会先打个折:方向对,但落地效果还得看真实诊疗场景的反馈。

Computing Life · Share · 鸭哥调研

OpenAI 通过 Plaid 让 ChatGPT 能读你的银行流水了

ChatGPT 在美国向 Pro 用户开放了个人理财功能预览,通过 Plaid 连接银行账户后,能读取余额、交易记录和投资持仓,回答消费和储蓄问题。文章指出,OpenAI 的隐私承诺存在两个关键缺口:理财对话未被列入广告敏感话题排除清单,意味着消费和贷款讨论可以触发广告匹配;财务数据的模型训练默认是 opt-in,用户需主动关闭。作者认为,这个功能的主...

推荐理由:我会先打个折:正文只说了 OpenAI 通过 Plaid 让 ChatGPT 连接银行账户,没披露上线时间、授权流程和可访问的数据范围,所以这更像一个信号而不是一个可评估的产品更新。但信号本身够强——让模型直接碰银行数据,权限和安全的坑一个都不少,从业者看到标题就会想点进去看细节。HKR 三项都踩中了,只是信息缺口把分数压在 featured 档,没往上走。

AI HOT 精选

OpenClaw 团队跑着 100 个 AI 实例干活,完全不看 token 账单

OpenClaw 项目组把 AI 用量拉满,常驻约 100 个 Codex 实例,把代码审查、安全扫描、issue 去重归类、测试环境复现并录屏验证、从会议里自动建任务、垃圾评论过滤和性能回退监控全交给它们跑。他们用 clawpatch.ai 把项目拆成功能单元做审查,还接了 Vercel DeepSec 做安全分析。正文没披露具体花了多少钱,但明确说...

推荐理由:我会先打个折:这只是一条X上的分享,没有披露成本、效果指标或可复现的搭建方式,所以别当成熟方案看。但它的钩子很准——用约100个Codex实例同时干代码审查、安全分析、议题去重、测试复现、任务创建、垃圾过滤和性能回归监控这七件事,还明说“无视令牌成本”,对正在琢磨AI agent怎么落地的从业者来说,是个有参考价值的实操片段。H、K、R都成立,放在featured里偏低的位置刚好。

AI HOT 精选

Runway 推出 Agent,一次对话就能把产品图变成完整广告片

Runway 新上线的 Agent 功能,让你在同一个对话窗口里,上传产品照片、给点想法,它直接吐出一条制作完成的广告。官方帖子没提背后用的是哪款模型、怎么收费、能生成多长的视频,也没说目前开放了哪些地区。我会先打个折:如果它真能省掉剪辑和合成的环节,对做短视频广告的团队来说挺省钱,但实际效果和可控性还得看上手之后的表现。

推荐理由:Runway 这个广告生成 Agent 在 HKR 三项上都踩中了,但属于中等体量的产品更新。我会先打个折:正文没写用了什么模型、怎么收费、生成一支广告要多久、哪些地区能用,信息缺口不小。所以它够得上 featured,但还不到必须写一篇的程度。

The Verge · AI

OpenAI 想让 ChatGPT 直接读你的银行流水

OpenAI 预告了一个新功能,让 ChatGPT 通过 Plaid 连接用户的银行账户,Plaid 在美国对接了 1.2 万家金融机构。OpenAI 说每月有超过 2 亿人用 ChatGPT 问财务问题,但正文没披露这个功能什么时候正式上线。我会先打个折:连上之后,ChatGPT 就能看到你的信用卡欠款和消费明细,隐私风险不小,官方目前也没说清楚数据...

推荐理由:OpenAI 让 ChatGPT 通过 Plaid 直接读银行数据,不是只聊聊天了。1.2 万家机构接入意味着覆盖面很广,2 亿月活用户问金融问题说明需求确实大。但正文没给上线时间,也没说清楚读到的账户数据会不会被模型记住或用于训练,这点先别太激动。金融场景出错成本高,责任怎么划现在还看不到。

TechCrunch · AI

OpenAI 推出个人理财版 ChatGPT,能直接连你的银行账户看资产和开销

用户绑定银行账户后,可以在一个面板里看到投资组合表现、日常支出、订阅服务和待付账单。正文没披露支持哪些银行、在哪些地区上线、是否额外收费,也没说明账户安全怎么保障。

推荐理由:H 分高是因为 ChatGPT 从聊天工具跨到个人理财,动作够大;K 有实打实的功能点,不是概念稿;R 则把隐私和金融竞争风险摆上台面。正文没写支持哪些银行、在哪些地区上线、收不收费,这些缺口让判断只能停在低 P1 档,我会先打个折,等更多细节再调整。

5月15日星期五

r/LocalLLaMA

用 Jetson Orin NX SUPER 16GB 做了个完全离线的行李箱机器人,跑 Gemma 4 E4B,没联网也能聊

一个叫 Sparky 的行李箱机器人,核心是一块 Jetson Orin NX SUPER 16GB 的板子,跑的是 Gemma 4 E4B 模型(Q4_K_M 量化版,用 q8_0 做 KV 缓存)。首次响应延迟大概 200 毫秒,生成速度每秒 14 到 15 个 token,上下文窗口 12K。身上挂了 30 多个传感器,但没装 WiFi、蓝牙和蜂...

推荐理由:这是个 Reddit 上的个人项目帖,不是产品发布或论文,所以放在低 featured 档。我会先打个折:200ms 的缓存首 token 延迟和 14-15 tok/s 的生成速度,在 Jetson 上跑 4B 模型算是能用的水平,但别指望它反应飞快。30+ 传感器听起来唬人,正文没细说都是什么传感器、怎么融合的,这点先别太激动。真正有意思的是全离线跑 Gemma 4 E4B 还让机器人带“观点”,把本地推理做成了人格化交互,比单纯报参数好玩。

AI HOT 精选

X 把“为你推荐”的算法开源了,用的还是 Grok 同款 Transformer

X 在 GitHub 上公开了“For You”信息流的推荐管道,代码、预训练模型和内容理解服务都给了。核心是一套叫 Phoenix 的 Transformer 模型,基于 Grok 架构,负责给候选帖子打分。它会看用户最近跟谁互动,同时预测点赞、回复、转发这些行为的概率,揉成一个相关性分数。排序前会先捞候选内容,补上上下文,再让模型评分,最后做多样性...

推荐理由:HKR 三项都踩中了,但正文只说了开源和 Phoenix Transformer 打分机制,仓库细节、许可证、能不能复现都没提,所以先给 featured 里偏低的位子。

AI HOT 精选

飞书命令行工具 lark-cli 45 天 GitHub 破万星,AI 操作每一步都能预览和审查

飞书开源了一个叫 lark-cli 的命令行工具,45 天在 GitHub 上拿到超过一万颗星,是国内办公套件里第一个破万星的开源项目。这个工具让 AI 能直接在命令行里建群、建文档,而且每一步操作都会先展示出来让你确认,不是那种在云端黑盒执行的 MCP 模式。主干代码已经合并了 10 位外部开发者的贡献,对比钉钉和企业微信同类项目的外部贡献是零。这种...

推荐理由:我会先打个折:信息只来自一篇社交帖子,没披露实际使用量、贡献者数量或企业采纳数据,所以放在 featured 偏低的位置。但 45 天万星这个速度本身说明开发者对“AI 操作可见可控”这个方向有需求,工具形态是命令行,意味着可以嵌进自动化流程,这点比纯界面演示更实在。正文没提和钉钉同类能力的对比,也没说后续维护计划,先当一次开源动作看。

MIT Technology Review · AI

中国竖屏短剧正在变成 AI 内容流水线,WHO 的全球健康目标要落空了

今年 1 月,中国平均每天上线 470 部 AI 生成的竖屏短剧。制作周期从几个月压到几周,成本砍掉了九成。剧本走向也越来越依赖播放数据,而不是编剧。这个模式正在快速复制到海外,同时也在改写编剧和摄制组的工作方式。另一条消息:WHO 最新报告显示,全球多项健康指标在倒退——2024 年新增 130 万 HIV 感染者,疟疾反弹,美洲疫苗接种率下滑,42...

推荐理由:MIT科技评论这篇把中国AI短剧流水线的产量、周期和成本数字都摆出来了,HKR三条全中。故事偏应用层,不是底层模型或产品发布,放在featured档刚好。