# Flash 模型集体冲顶：Gemini 3.8 Flash 和 Muse Spark 1.3 同天发布，便宜模型已能搞定九成任务

> 原标题：2026-09-02 群聊日报

- 来源：AI 群聊日报
- 发布时间：2026-09-04T04:52:50.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/54868
- 原文：https://louyu2015.github.io/AI-chatgroup-daily/daily/2026/09/02/daily/

## 摘要

Google 发布 Gemini 3.8 Flash，输入价格每百万 token 0.75 美元，在 DeepSWE 编程基准上拿到 71% 的分数，多项智能体跑分超过 Sol 和 Opus 5。同一天 Meta 放出 Muse Spark 1.3，智力分跟 Grok 4.6 持平，Contributor 档位输入价只要 0.1 美元，但默认会用你的数...

## 推荐理由

Gemini 3.8 Flash 以 Flash 档位定价在智能体跑分上超过 Sol 和 Opus 5，这个信号很炸。来源是群聊日报而非官方公告，所以我会先打个折，但里面给的数字和实测笔记密度很高，对做模型选型的人有直接参考价值。

## 锐评

今天两条模型发布放在一起看，信号很明确：模型正在变成大宗商品。Gemini 3.8 Flash 输入价每百万 token 0.75 美元，在 DeepSWE 编程基准上拿到 71%，多项智能体跑分超过 Sol 和 Opus 5。Meta 的 Muse Spark 1.3 更狠，Contributor 档位输入只要 0.1 美元，智力分跟 Grok 4.6 持平，但默认会用你的数据训练——想退出得切到 Standard tier。群友晒出的两周消耗数据很说明问题：12.82 亿 token 花在 GLM 5.3 上，GPT-5.6-Sol 只用了 8.04 亿，Claude 已经退订。九成以上任务交给便宜模型，体感反而更好——大模型太慢，反馈周期长，小模型虽然要多干预几次，但反馈快节奏好。

不过信息缺口也明显。Muse Spark 1.3 的 Contributor 档位虽然便宜，但数据训练条款到底多激进，正文没展开。Gemini 3.8 Flash 的 71% DeepSWE 分数看着漂亮，但群友实测 one-shot 做网站幻觉率依然很高，说明 benchmark 和实际体验还有距离。Uncle Bob 提出的多 Agent 流水线——specifier 写需求、coder 写代码、cleaner 清理、hardener 跑变异测试——理论上单任务一小时完成，但群友也说了，模型不够聪明，理想丰满。另外 NYC 禁止 K-8 学生用生成式 AI 工具这条，正文只提了一句，没给具体执行细节和处罚措施。
