Marissa Mayer 推出照片驱动 AI 助手 Dazzle,从相机胶卷读懂你
前 Yahoo CEO Marissa Mayer 推出个人 AI 助手 Dazzle,去年 12 月完成 800 万美元种子轮融资,其上下文来源只有手机相机胶卷,而非邮件和日历。Dazzle 可通过 App 或短信交互,能扫描近期照片填充日历、根据照片库推荐旅行和礼物,并声称会丢弃被标记为敏感的个人信息。
前 Yahoo CEO Marissa Mayer 推出个人 AI 助手 Dazzle,去年 12 月完成 800 万美元种子轮融资,其上下文来源只有手机相机胶卷,而非邮件和日历。Dazzle 可通过 App 或短信交互,能扫描近期照片填充日历、根据照片库推荐旅行和礼物,并声称会丢弃被标记为敏感的个人信息。
Anthropic 把 Sonnet 5.5 设成了 claude.ai 免费层的默认模型,Simon Willison 实测让它用 WebGL 画了个骑自行车的 3D 鹈鹕,效果不错。这个模型在所有基准测试上都压过了 Sonnet 5,而且跑得更快、更便宜——大部分任务成本能降 30%。不过“max”思考模式还是和 Opus 5.5 一样有 bug:...
推荐理由:把最新 Sonnet 放到免费层不是常规模型更新,是产品策略转向。Simon 的实测给了具体数字(烧了 1.28 美元、渲染成本 5.74 美分、延迟 41 秒),max 模式 bug 跟 Opus 5.5 一致也是个有用的信号——说明底层推理架构可能没变。
Anthropic 推出了 Claude Sonnet 5.5,官方说运行速度比 Sonnet 5 快了超过 30%,写东西也更清楚,主要瞄准修 bug、写文档、做幻灯片和表格这类需要快速来回改的活儿。同时发布的 Opus 5.5 则定位在需要谨慎判断的复杂任务上,Haiku 5.5 还要再等几周。正文没提具体定价和延迟数据,所以这 30% 到底在什么...
推荐理由:Anthropic 这次模型线更新,Sonnet 5.5 的 30% 速度提升是个具体数字,产品线分工也说得明白。没给到 85 分是因为正文没披露定价、延迟基准测试,也没说这 30% 是在什么条件下测出来的,我会先打个折。
404 Media 拿到一批内部文件,发现微软雇了至少几百名外包人员,专门看用户发给 Copilot 的提示词和上传的图片。他们的任务不是过滤不安全内容,而是评判生成质量——比如 AI 把胸部放大了,够不够大。审阅员每天被各种性请求刷屏:要求把裙子改短、生成儿童卡通角色的足控图、制作厌食症相关内容。用户上传的人脸从不打码,很多提示词看起来根本没经过当事...
推荐理由:404 Media 拿到的内部文件证据扎实,不是传闻。这篇报道把 Copilot 内容审阅的真实运作方式扒了出来,隐私、伦理、合规三个维度全中。分数没给到 85 以上,是因为它是一篇调查报道,不是产品发布或模型更新,对行业的直接冲击有限,但足以让用户和从业者重新审视自己用的工具。
作者受 Jev 启发写了个 Python 封装,核心思路是让 LLM 只输出一个 token(比如 A/B/C),然后读它的 logprobs 来快速做选择题。这样避免了模型长篇大论,速度很快。作者还加了图片支持,用 Gemma 4 12B 在 RTX 3090 上跑摄像头画面,每秒能处理 1 帧,每帧同时问三个问题(有没有人、室内还是室外、亮度如何)...
Ben Tossell 用 Codex 和 Factory 花一上午搭了个网站,展示 1976 到 2026 年间 87 款经典设备,所有图片由 Astra 生成,只用了 40 条指令和 7 个子代理。网站已收到 1455 票。项目灵感来自一个“被遗忘的设备”想法,又参考了 Cole 的时间线拖拽演示,代理们自己找参考图、生成新图,还补上了 2009 ...
PrismML 在高通骁龙峰会上展示了一个叫 Bonsai 的 1-bit 语言模型,能直接在智能眼镜上跑,不用联网。这个模型有 20 亿参数,同时处理图像和文字,戴着眼镜看到什么可以直接问。他们的核心本事是把大模型体积压到原来的四分之一,跑分还几乎不掉。这家公司的长远目标是做开放权重的端侧 AI,不把隐私押在云厂商的承诺上。不过目前还没有哪款智能眼镜...
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在原生实时对话模型上加入近实时视频生成,实现带唇形同步、自然表情和流畅轮次切换的动态视觉形象。
推荐理由:原文给出 Live Avatar 的实时视频对话能力、异步工具调用与 97 语言支持,可据此判断企业级多模态交互的落地形态。
Meta 在 Connect 大会结尾快速展示了一款叫 Muse Charm 的独立 AI 硬件,专门跑自家的 Muse 智能体。它长得像一块摘掉表带的厚智能手表,配了根挂绳。右上角有指纹传感器,按下去就能直接说话下指令,不用掏手机解锁。正面至少开了三个麦克风孔,还塞了一颗小摄像头。正文没公布价格、续航和上市时间,目前只是露个脸。
推荐理由:Meta 在 Connect 大会结尾快速亮了一款叫 Muse Charm 的独立 AI 硬件,长得像摘掉表带的厚智能手表,挂绳一穿就能戴。右上角指纹传感器按下去直接说话下指令,正面开了至少三个麦克风孔,还藏了一颗小摄像头。我会先打个折:正文没公布价格、续航和上市时间,目前只是露个脸,所以信息量偏薄。但 Meta 在 Ray-Ban 智能眼镜之后又试了一种新形态,把自家 Muse 智能体塞进一个独立设备里,这个动作本身对做 AI 硬件的人有参考价值,分数就定在 72。
Qwen在9月20日开源了7B参数的图像模型Qwen-Image-2.1,它把文生图、局部编辑和原生输出透明PNG这三件事收进了同一个管线里。最显眼的是版本号从7月的3.0反向跳回2.1,这背后是团队在2026年把产品分成了两条线:3.0是只提供API的闭源商业版,2.1则是继续走开源研究路线的分支。模型内置了一个能处理透明通道的自编码器,生成图片时直...
推荐理由:Qwen把一个模型同时干三件事——生成、编辑、出透明图——这比换个壳实在,版本号反跳也不是噱头,而是2026年双线策略的明确信号。对做图的人来说,少切一次工具就是省时间,点击欲和共鸣都够,分数不往上拉是因为正文没给透明通道在实际场景里的量化效果,先保守一点。
Muse 上线才两周,Meta 就说正在把它往智能眼镜里搬,包括 Connect 大会上新发布的款式。用法很简单:喊一声 Muse,就能让它带着你做运动、记吃了什么,或者帮你看看眼前的东西值不值得买。眼镜还会加一个听力增强功能,Meta 说已经过了 FDA 认证,给轻度到中度听损的成年人用。不过正文没提什么时候上线,也没说哪些型号能用上 Muse。
推荐理由:把 Muse 搬上眼镜是 Meta 把 AI 助手从手机推向穿戴设备的关键一步,三个用例也够实在。但正文没给上线时间和支持型号,我会先打个折,分数刚好卡在 featured 门槛上。
Meta 给 Muse AI 塞了两项新能力:每个 Muse 智能体都会有一个自己的邮箱,能收发邮件、处理任务,你也可以直接往这个邮箱发指令。Mac 版应用还会获得操控电脑的权限,让 Muse 直接操作你的桌面。另外,Muse 很快会支持视频通话,不再只是打字聊天。正文没披露上线时间和收费方式。
小米把 MiMo-V2.6 Pro 和 Flash 两个全模态模型开源了。Pro 在 Artificial Analysis Intelligence Index 上拿了 46 分,是目前开源模型里最高的,在多数 Agent 基准测试里表现跟 Claude Opus 5 和 GPT-5.6 Sol 差不多。训练用的是规模化强化学习,但正文没披露参数量、...
推荐理由:小米把 MiMo-V2.6 Pro 和 Flash 开源了,Pro 在 Agent 基准上表现跟 Claude Opus 5、GPT-5.6 Sol 差不多,Intelligence Index 拿了 46 分,是目前开源最高。我会先打个折:正文没写参数量、训练数据和成本,没法判断实际落地性价比。但国产旗舰模型开源本身信号够强,对开发者和开源生态都有直接价值,按政策给满权重。
RxFilm Studio 是一个 macOS 原生应用,把产品视频制作的全流程塞进一个窗口。AI 代理充当“导演”,负责生成配乐(用的 Lyria,但正文没说是哪个模型)、多角色配音、自动字幕(支持翻译,可导出 VTT/SRT)、静态图片,最后通过 Remotion 输出 4K 60fps 视频。每次编辑都会先提方案让你审核。1.9.0 版免费,仅支...
蚂蚁开源了 Ming-Image-0.1-Design 系列,包含两个 6B 参数模型,分别负责设计图生成和图层编辑。6B 参数属于中等规模,比动辄几十B的大模型更轻量,部署成本低。但原文页面被拦截,正文没披露模型架构、训练数据、评测指标,也没说跟现有方案比效果如何。目前能确认的是:开源、两个模型、覆盖从生成到编辑的流程。具体能不能打,得等代码和权重放...
通义千问的 Qwen-Image-2.1 在 Arena 的图像编辑和文生图榜单上都是开源模型第一。图像编辑得分 1367,总榜排第 16,只比第 15 名的 GPT-Image-1.5-high-fidelity 低 3 分。正文没提参数量、模型架构和具体开放时间,这点先别太激动。
推荐理由:Qwen-Image-2.1 在 Arena 图像编辑榜拿到开源第一、总榜第 16,只落后 GPT-Image-1.5 三分,这是实打实的跨模型对比信号。分数定在 78 而不是更高,是因为正文完全没提参数量、模型架构和发布时间——信息缺口不小,我会先打个折。
OpenRouter 从自家目录的 37 个嵌入模型里筛出了一份短名单,按场景给了推荐。默认选 openai/text-embedding-3-small,因为它便宜,单次能处理 8192 个 token,输出维度还能调。如果你的文本更长,voyageai/voyage-4-large 支持 32000 token 的上下文窗口,而且跟 Voyage ...
通义千问把 Qwen-Image-2.1 的权重放出来了。在 Arena 的图像编辑榜上拿了 1367 分,开源模型里排第一,总榜第 16。这个分数离第 15 名的 GPT-Image-1.5-high-fidelity 只差 3 分,差距很小。文生图榜也拿了开源第一。正文没提参数量、具体架构和用的什么开源协议,这些关键信息得等后续披露。
推荐理由:Qwen-Image-2.1 权重放出来了,Arena 图像编辑榜开源第一、总榜第 16,离 GPT-Image-1.5 高保真版就差 3 分,文生图榜也是开源第一。分数没给更高是因为正文没提参数量、架构和开源协议,我们只能按榜单成绩打分——光看这个分差,确实值得关注。
小米发了 MiMo-V2.6 系列,Pro 版在 Artificial Analysis 的智能指数上拿了 46 分,排开源模型第一。训练成本 300 万美元,按每次任务 0.13 美元算,性价比踩在了前沿线上。Flash 版主打效率,UltraSpeed 版输出速度拉到了 20 倍。技术报告讲了他们怎么在三个方向上堆强化学习的算力:一是用全异步架构把...
推荐理由:小米的 MiMo-V2.6-Pro 在 Artificial Analysis 开源模型榜上拿了第一,训练只花了 300 万美元,单次任务成本 0.13 美元,性价比踩在了前沿线上。Flash 版和 UltraSpeed 版分别补了效率和速度的位,技术报告还讲了全异步强化学习架构怎么堆算力。正文没提具体评测细节和实际业务场景验证,分数先按现有信息给。
小米发了两个全模态模型 MiMo-V2.6-Pro 和 Flash。Pro 版在 Code Arena 的网页开发榜上拿了 1628 分,比上一代 MiMo-V2.5-Pro 的 1475 分涨了 153 分,整体排第10名上下,在 MIT 许可的开源权重模型里大概排第3。Flash 版的跑分和参数量正文都没提。
推荐理由:小米 MiMo-V2.6-Pro 在 Code Arena WebDev 榜上排第10名上下,开源权重模型里约第3,分数比上代涨了 153 分,有具体数字支撑。Flash 版参数量和跑分正文都没提,信息有缺口,所以重要性给到 78 比较合适,先别往更高拔。
腾讯混元发了 Hy Image3.5 preview,一个图像生成模型。但正文只有标题和导航栏,没提能力、参数或发布时间。等官方披露吧。
Qwen-Image-2.1 是个 7B 参数的原生图像模型,一个检查点就能做图像生成和编辑,不用来回切模型。它最多能塞 10 张参考图进去,还内置了一个专门帮你优化提示词的 LLM,省得自己反复调 prompt。模型已经接入了 diffusers 和 ComfyUI,Hugging Face 上也有免安装的网页 demo 可以直接试。不过正文没提训练...
推荐理由:通义千问扔了个 7B 的原生图像模型,一个检查点就能生成和编辑,还塞了个帮你优化提示词的 LLM,组合挺新鲜。分数没给到 85 以上,是因为正文没提训练数据、推理速度,也没给实际的画质对比,这些关键信息都缺着,所以我会先打个折。
阿里 Qwen 放出了 Qwen-Image-2.1 的开源权重,原生支持 ComfyUI 节点。一个 7B 参数的模型同时干生图和编辑两件事,最高能出 2K 分辨率的图,单次指令最多可以参考 10 张图来改图,还支持带透明通道的 RGBA 输出。正文没提硬件要求和具体授权协议,想本地跑的话得自己试水。
推荐理由:阿里 Qwen 放出一个 7B 的统一生图/编辑模型,原生支持 ComfyUI,能出 2K 图、带透明通道,对本地生图社区是直接利好。分数没给更高,是因为正文没提硬件门槛和授权协议,实际跑起来的门槛还不清楚,这点先别太激动。
阶跃星辰推出了 Step 5 Preview,一个总参数量 6000 亿、每次推理激活 270 亿参数的混合专家模型。它支持 100 万 token 的上下文窗口和图像输入,主要瞄准让模型进业务流程干活的场景。在 DeepSWE v1.1 编程测试里拿了 67.7 分,超过了 Kimi K3 和 GLM-5.3,但落后于 GPT-6 Astra 和 C...
推荐理由:Step 5 Preview 是阶跃星辰的 6000 亿参数混合专家模型,在 DeepSWE v1.1 编程测试上拿了 67.7 分,小胜 Kimi K3 和 GLM-5.3,但还落后 GPT-6 Astra 和 Claude Opus 5 约 6-7 分。给了 78 分,因为这是国内模型在 agent 编程方向一次有具体数字的推进,但还没到改写行业格局的程度。我会先打个折:正文没提推理延迟和实际部署成本,100 万 token 上下文在实际业务流程里表现如何也未知,所以分数没给更高。
OpenRouter 用同一句提示词跑了 20 个图像生成模型,直接看实际扣了多少钱。最便宜的是 GPT Image 2,一张 1024 方形图只要 0.006 美元;最贵的是 Gemini 3 Pro Image,要 0.134 美元。各家计费单位不一样,有的按 token、有的按像素、有的按张数,光看标价根本没法比,得实际跑一张看账单。测试里 6 ...
推荐理由:OpenRouter 用同一句提示词跑了 20 个图像模型,直接看实际扣了多少钱。最便宜的一张 1024 方形图只要 0.006 美元,最贵的要 0.134 美元,价差超过 20 倍。各家计费单位还不一样,有的按 token、有的按像素、有的按张数,光看标价根本没法比,得实际跑一张看账单。这种一手数据对选模型的人来说比任何 benchmark 都管用,我会先打个折——测试只跑了一组提示词,不同复杂度下排名可能会变,但至少给了个真实的比价起点。
PrismML 开源了 Bonsai 2 27B,这是基于 Qwen3.8 27B 做的三值量化版。它把模型权重压缩到只有 -1、0、+1 三种值,再配合 FP16 的分组缩放,每个权重只占 1.76 比特,整个模型文件只有 5.9GB,比原版小了 9 倍多。跑分方面,综合基准测试得分 83.9,保留了原版 85.4 分 98.2% 的水平,在编程、智...
Pinterest 正在内测一个叫 Restyle 的 AI 功能,用户上传自己房间的照片,AI 就能把里面的家具、装饰和灯光全换掉,效果图里出现的商品可以直接跳转购买。说白了就是把“收藏灵感”这一步直接连到“下单”,缩短从看到买的路径。正文没披露上线时间和支持地区,所以离真正能用还有多远不好说。
DeepSeek 发了 V4.1-Flash,一个 552B 参数的 MoE 多模态模型,核心卖点是 KV cache 压缩——就是减少长文本推理时显存占用,让大模型跑长上下文更省显存。论文刚挂 arXiv,压缩比和跑分都没给,标题说“Pushing the Limits”,方向是推理效率。正文没披露具体压缩效果和评测结果,这点先别太激动。
OpenRouter 发了一篇指南,把 DeepSeek V4 家族里哪个型号能读图、哪个只能读文字列清楚了。V4 不是单个模型,而是一个系列,包括 V4.1 Flash、V4 Pro 0813、V4 Flash 0731、V4 Flash Vision Exp 等。能接受图片输入的只有两个:V4.1 Flash(原生支持,输入 $0.15/百万 to...
Meta 把自家 Muse 模型里的 AI 生图、修图、视频生成,还有 Instagram 的 Restyle 工具,都塞进了一个叫 Meta One 的付费订阅里,覆盖 Facebook、Instagram 和 WhatsApp。这是继 2025 年砸了 143 亿美元投资 Scale AI 之后,Meta 想把 AI 能力直接变现的又一步。今年三月...
前TikTok高管推出了一款叫Superpose的相机App,你拍张自拍或照片,AI会分析后生成4种可能的姿势,解决“手不知道放哪”的尴尬。去年Google在Pixel手机上也有类似功能叫Camera Coach,但Superpose只专注教人摆姿势。正文没披露它用的是什么模型、是否免费、以及具体上线日期。
一个开源项目,用树莓派加麦克风本地识别鸟鸣(不用联网),听到鸟叫就在墨水屏上显示一张19世纪风格的鸟类版画。识别靠BirdNET,画图靠Stable Diffusion,代码和模型全开源。全文没提支持多少种鸟,也没说识别延迟多长。
mukel90 发了个新项目 jinfer,是个完全用 Java 写的推理引擎,支持聊天、视觉、语音转文字、文本嵌入、重排序和语音合成。它不依赖 Python、ONNX 或任何外部进程,能直接读写 gguf 和 safetensors 格式的模型。作者说 CPU 上的性能已经能和 llama.cpp 掰手腕,GPU 支持还在开发中。项目已经接入了 Sp...
Runway 放出了 Solaris 的研究预览,这个系统不写前端代码,靠模型逐帧把界面画出来,用户的点击拖拽直接驱动下一帧画面。目前只有官方精剪的演示视频和一个候补名单,没有公测、定价和 API,第三方实测也还没出现。官方自报用户偏好度比传统代码界面高,但成本对比的参照系是更贵的视频扩散模型,不代表比普通网页渲染省钱。Google Research ...
推荐理由:三条打包,Solaris 是主钩子。Runway 逐帧画界面的思路确实新鲜,但目前只有官方精剪演示和候补名单,没公测、没定价、没 API,第三方实测也还没影,成本对比还绕开了普通网页渲染。所以我会先打个折,重要性给 78。Google 的 WikiSkill 让 agent 从失败里自己总结技能文档,机制具体,但正文没披露规模验证。GitHub 的 Copilot 企业版编码模式把数据留在本地,对合规敏感的公司是刚需,不过细节还不多。整体有话题性,但都缺实测,tier 放 featured 合适。
Tom Gally 用 Claude Fable 5.1 搭了个站,把 Simon Willison 那个经典的“鹈鹕骑自行车”测试扩展成了 30 道 SVG 画图题,比如“章鱼弹管风琴”、“长颈鹿组装落地钟”。2026 年跑了 6 个模型,2025 年跑了 10 个。页面直接贴模型返回的原始 SVG,没做主观打分,你自己看图画得怎么样。每张图下面标了...
推荐理由:Simon Willison 那个经典的鹈鹕骑自行车测试,社区里玩了好几年了。Tom Gally 这次把它扩成 30 道题,还跑了 2025 和 2026 两批模型,信息量挺大。页面没做主观打分,就让你自己看图判断,这点反而实在——省得被一个分数带偏。缺点是你得一张张翻,没法一眼扫出排名,但当成一个原始素材库来用,价值很高。
DeepSeek 在 9 月 10 号发了 V4.1-Flash,虽然叫 4.1,Sebastian Raschka 直接说这该叫 V5。模型总参数 763B,用了混合专家(MoE)和因果编码器-解码器架构,把处理输入和生成输出拆成了两个阶段:预填充时激活 8B 参数,解码时激活 16B 参数,稀疏度只有 1% 到 2%。这么一拆,KV 缓存占用最多能...
推荐理由:DeepSeek 发了 V4.1-Flash,763B 的因果编码器-解码器 MoE,预填充 8B 激活、解码 16B 激活,稀疏度 1%-2%,还带了视觉。Sebastian Raschka 说这该叫 V5,说明架构改动不小。国内旗舰模型架构更新,加上外部技术圈同步讨论,HKR 三条都踩中。没给 90 以上是因为刚发,还没看到实际跑分和落地反馈,先打个折。
DeepSeek 放出了 V4.1-Flash 的开放权重,一个 552B 参数的 MoE 模型,用了 Causal Encoder-Decoder 架构,专门为编程 Agent 调过。它把算力拆成两块:prefill 阶段激活 8B 参数,decode 阶段激活 16B,外加 KV 缓存效率也做了优化。跑分上,Terminal Bench 2.1 拿...
推荐理由:DeepSeek 开源了 V4.1-Flash,一个 552B 的 MoE,用 CED 架构把 prefill 和 decode 拆开,专门降编程 agent 的延迟。Terminal Bench 2.1 的分数是实打实的,Baseten 的分析也补了部署视角。没给到 85 分以上是因为这是第三方解读,不是官方技术报告,部分细节还得等一手资料验证。
文章标题说 DeepSeek V4.1 Flash 大幅降价、原生支持视觉能力,作者用游戏和城市生成任务测了表现。但正文被微信屏蔽,看不到具体降了多少、视觉能力什么规格、生成质量如何。如果真降价且视觉好用,对做多模态或生成类应用的团队是个好消息,但这点先别太激动——没披露细节前只能当传闻看。
WorkBuddy 把 DeepSeek V4.1-Flash 接进了自家平台,新用户能免费试用两周。这个版本通过 DeepSeek API 调用,支持原生多模态(能直接处理图片、文字等混合输入)。但公告没提相比之前版本快了多少、便宜了多少,也没说试用期后怎么收费。
Google 发了新图像工具 Pics,域名 pics.new,底层模型叫 Nano Banana。它能局部改图、直接编辑图片里的文字甚至翻译,还支持多人协作和一次出多张方案。正文没提收费方式和模型参数量,这点先别太激动。