跳到正文

#DeepSeek

今日 0 条

9月10日星期四

r/LocalLLaMA

DeepSeek 发了个 V4.1 Flash:跑分超自家 Pro,API 降价,模型还开源了

DeepSeek 今天放出了 V4.1 Flash,一个总参数 552B 的 MoE 模型,但实际干活时输入只激活 8B、输出激活 16B 参数,所以推理成本压得很低。它用了新的非对称编码器-解码器架构,跑分直接超过了自家的 V4 Pro。KV 缓存也大幅瘦身,相比上代 HBM 需求降到 1/4、SSD 需求降到 1/8,这对经常要缓存命中的 agen...

推荐理由:DeepSeek 旗舰模型发布,架构有变化,跑分和成本数字都给了硬信息,按惯例对标美国大厂发布处理。HKR 三项全中:超 V4 Pro 的跑分和缓存瘦身都是硬货。没给 P1 是因为目前只有标题和摘要,正文细节还没看到。

8月4日星期二

AI 群聊日报

Qwen 3.8 Max 跑分追平 Fable 5,权重下周开源;群里 agent 自己会下本地模型了

Qwen 3.8 Max 正式发布,2.4 万亿参数,Terminal Bench 2.1 得分 86.6,PaperBench 93.0 超过 Fable 5 的 88.8。群里有人充了 500 块的 token 额度一天就用完了,实际体感大概在 Luna 和 Terra 之间,主要优势还是便宜。下周 Qwen 3.8 Max 和 27B 模型都会开...

推荐理由:Qwen 3.8 Max 正式发布,2.4 万亿参数,PaperBench 93.0 超过 Fable 5 的 88.8,Terminal Bench 86.6,下周权重开源。群聊日报给了具体跑分和真实体感——有人充 500 块一天用完,实际能力大概在 Luna 和 Terra 之间,主要卖点是便宜。信息量足,但来源是群聊,权威性要打个折,所以没给更高分。

8月1日星期六

Latent Space

DeepSeek V4-Flash 0731 发布:不改模型结构,纯靠训练后优化,把智能体能力拉到接近 GPT-5.6,成本还低了六成

DeepSeek 放出了 V4-Flash 0731 版本,模型大小和结构没变,还是 284B 总参数、13B 活跃参数、100 万上下文窗口。这次更新全靠训练后优化,没有动预训练。最直观的变化是 Terminal-Bench 分数从 56.9 跳到 82.7,其他智能体相关的跑分也全面上涨。API 定价是输入每百万 token 0.14 美元、输出 ...

推荐理由:这条消息的核心看点很集中:DeepSeek V4-Flash 0731 没动预训练、没改结构,纯靠后训练把 Terminal-Bench 拉高 25.8 分,其他智能体跑分也全面上涨。对从业者来说,这说明后训练在提升模型实际干活能力上的空间比很多人想的大。定价和开源权重让它在 GPT-5.6 降价后依然有竞争力。不过原文是付费 newsletter 的汇总,不是一手发布公告,标题自己也说'今天没啥大事',所以分数没给到 85 以上。

AI HOT 精选

DeepSeek V4 Flash 0731 开源,MIT 协议,284B 总参数量,开源模型里排进前三

DeepSeek 把 V4 Flash 0731 开源了,MIT 协议,可以随便用。模型总参数 2840 亿,但每次推理只激活 130 亿,跑起来大概需要 167GB 显存(FP4/FP8 混合精度)。在 Artificial Analysis 的智能指数上拿了 50 分,开源模型里排前三。架构和定价跟之前的 V4 Flash 一样,官方 API 已经...

推荐理由:DeepSeek 把一个旗舰级模型用 MIT 协议开源,直接挂到开源榜前三。2840 亿/130 亿的稀疏架构给出了一个具体的效率数字,不是宣传稿。国内模型发布按政策给同等权重,开源带来的生态扩散也值得关注。

7月24日星期五

纽约时报中文网

中国把开源、低成本 AI 当成新软实力,跟美国闭源模型抢全球市场

习近平上周公开站台开源 AI,说这是把技术红利扩散到全球的“历史机遇”,并承诺五年内给发展中国家 5000 个培训名额。中国公司(深度求索、月之暗面、智谱 AI、阿里等)主推开源模型,部分任务成本比美国方案低 50% 到 90%。美国那边反击很猛:Anthropic 指控阿里用 2.4 万个假账号爬取其技术,财长贝森特威胁制裁。安全争议两边都有——开源...

推荐理由:NYT 把中国开源 AI 当成地缘软实力故事来讲,习近平的背书、具体的成本数据和 Anthropic 的爬取指控让文章有了实感。但这是宏观叙事,不是一手产品发布,缺乏可复现的评测细节,所以分数没给到 85 以上。

7月8日星期三

AI HOT 精选

Liquid AI 开源 Antidoom:用“最终 Token 偏好优化”修掉推理模型的死循环毛病

推理模型有时会卡在“死循环”里,反复输出无意义的 token 直到把上下文窗口塞满。Liquid AI 开源了 Antidoom,用最终 Token 偏好优化(FTPO,一种教模型在推理结束时学会停下来的训练方法)来解决这个问题。他们在 DeepSeek V4 Pro 上试了,用 1,040 组偏好样本训练后,死循环率从 3.2% 降到了 0.3%,而...

推荐理由:Liquid AI 开源了一个修推理模型死循环的实用方法,在 DeepSeek V4 Pro 上把死循环率从 3.2% 压到 0.3%,数字扎实。没给更高分是因为目前只有一篇博客,没有论文或第三方验证,单源信息到这个分数已经不错了。

6月30日星期二

Hacker News 首页

美团开源 LongCat-2.0:1.6 万亿参数 MoE 模型,48B 激活,全程用自研 AI ASIC 训练

美团放出了 LongCat-2.0,一个总参数 1.6 万亿、每次推理激活约 480 亿参数的混合专家模型。它全程跑在美团自研的 AI ASIC 超算集群上,用超过 5 万张卡、没出过需要回滚的重大训练事故,预训练吞下了超过 35 万亿个 token。模型专门为长上下文和智能体任务做了优化:引入 LongCat 稀疏注意力来加速百万 token 级长文...

推荐理由:美团开源了一个总参数 1.6 万亿、每次激活约 480 亿参数的 MoE 模型,全程用自研 AI ASIC 训练,5 万多张卡零回滚跑完,预训练数据量超过 35 万亿 token。模型专门为长上下文和智能体场景做了优化,引入了 LongCat 稀疏注意力来加速百万 token 级处理。我会先打个折:目前只有官方博客,没有第三方评测或真实业务反馈,所以分数停在 82 而不是更高。如果是真的,这套非 GPU 训练方案挺省钱,但稳定性和性能还需要更多证据。

6月20日星期六

Hacker News 首页

GPT-5.5 的幻觉率是开源模型 GLM-5.2 的三倍,大模型迷信该破了

作者拿 GPT-5.5、DeepSeek V4 Pro 和智谱的 GLM-5.2 做了个对比测试。在 AA-Omniscience 幻觉基准上,GPT-5.5 的幻觉率高达 86%,DeepSeek V4 Pro 更是飙到 94%,而 GLM-5.2 只有 28%。这意味着前两者遇到不会的问题时,十次里有八九次会瞎编一个答案,而不是老实说“我不知道”。...

推荐理由:这篇是个人博客做的第一手对比测试,数字很具体、结论也反直觉,所以 H、K、R 三个维度都踩中了。分数定在 78 而不是更高,是因为样本量和测试方法没完全展开,权威性有限,我会先打个折。

6月19日星期五

AI HOT 精选

DeepSeek研究员开源AutoResearch:AI自己跑完285B模型强化学习全流程

DeepSeek研究员Deli Chen放出了一个叫AutoResearch的实验协议,让AI智能体在285B参数的模型上独立跑完了一整套强化学习研究闭环——自己设计实验、写代码、提交GPU任务、修bug、写总结,全程没人插手。系统用了GRPO这个工具。不过正文没披露具体做了什么任务、训练了多久、成功率多少,这些关键信息都缺着,所以先别太激动,等有人复...

推荐理由:DeepSeek 研究员放出了一个实验协议,让智能体在 285B 模型上独立跑完强化学习研究闭环,设定很强。但正文没披露具体任务、训练时长、成功率这些关键指标,信息缺口太大,所以分数先打个折,等有人复现再说。

6月1日星期一

r/LocalLLaMA

网友在双 DGX Spark 上跑 DeepSeek V4 Flash:预填充 1680 token/s,解码 39.8 token/s

一位 Reddit 用户用两台华硕 GX10(DGX Spark)组了个小集群,通过 vLLM 加载 DeepSeek-V4-Flash 模型。在 256K 上下文窗口、开启多 token 预测(MTP=2)的设置下,测得预填充速度 1680 token/s,解码速度 39.8 token/s。部署用了张量并行(TP=2),两台机器通过 RoCE 网络...

推荐理由:这不是行业大新闻,但胜在是第一手实测,配置细节都给了:TP=2、RoCE 网络、fp8 KV 缓存、256K 上下文,还估出了约 1M tokens 的安全 KV 上限。对想对比自己机器性能的人来说,这些数字比官方宣传实在。HKR 三项都踩中,放在低 featured 位置刚好。

5月29日星期五

新智元 · 公众号

DeepSeek 三款模型冲进 OpenRouter 月榜前十,总消耗超 17 万亿 Token

OpenRouter 的月度统计显示,DeepSeek 有三款模型进了前十,加起来的 Token 消耗量超过 17 万亿。其中 V4 Flash 一个模型就占了 9.13 万亿 Token,用量很猛。文章还提到华为昇腾的 MegaMoE 算子,在 DeepSeek V3.1 和 Qwen3-235B 的测试里,把预填充(Prefill)吞吐量提升了 2...

推荐理由:HKR三项都成立:17万亿tokens的钩子加上OpenRouter排名和昇腾Prefill提升的具体数字,信息量够。分数定在82,因为算力自主的叙事很强,但正文没披露测试的可复现条件,这点先别太激动。

5月17日星期日

r/LocalLLaMA

有人实测 DeepSeek V4 的百万上下文窗口,发现写代码的最佳区间是 15 万到 25 万 token

一位 Reddit 用户拿 DeepSeek V4 去啃 4.5 万、18 万和 52 万 token 的代码库,结论是 15 万到 25 万 token 时写代码最顺手。超过 30 万 token 后,模型对具体行号的定位开始不准;到 52 万 token 时,输出明显偏向架构总结,具体实现细节会跳过。帖子正文没披露测试用的具体任务和评估指标,所以这...

推荐理由:单篇 Reddit 帖子权威性有限,但 HKR 三项都站得住:有数字、有对比、有明确的失效模式。归入 featured 而不是更高,是因为复现细节和模型版本信息偏薄,先别太激动。

AI HOT 精选

开源模型井喷:Gemma 4、DeepSeek V4、Kimi K2.6 等集体发布,CAISI 评估称开源落后闭源

这个月开源模型扎堆更新,DeepSeek V4、Gemma 4、Kimi K2.6、MiMo 2.5、GLM-5.1 全来了。CAISI(美国 AI 标准与创新中心)用 9 个基准测了 DeepSeek V4,给出的结论是开源模型跟美国闭源前沿差距在拉大,尤其在 CTF 安全挑战、ARC-AGI-2 和他们的私密基准 PortBench 上 V4 得分...

推荐理由:这条消息把五款开源模型的新版本打包在一起,还挂了个 CAISI V4 评估的钩子,对关注模型选型的人挺有吸引力。我会先打个折:正文只说用了这套框架测试,分数一个没给,所以目前只能当个发布清单看,没法横向比较。这点先别太激动。不过模型名字和版本号都明确,开源阵营的密集更新本身就能影响团队的部署和成本判断,所以整体还是值得推。

5月12日星期二

r/LocalLLaMA

Reddit 网友实测 288 次模型调用,把本地模型输出 JSON 时的各种翻车方式全整理了一遍,还写了个修复库

Reddit 用户 kexxty 用 OpenRouter 跑了 288 次结构化输出测试,覆盖 Llama 3、Mistral、Command R、DeepSeek、Qwen 等模型,发现本地模型和纯 API 模型在 JSON 上出的错其实差不多。他把这些失败归类后,写了一个叫 outputguard 的 Python 修复库,用 MIT 协议开源。...

推荐理由:HKR 三项都成立:288 次调用不是随便跑跑,outputguard 库和 15 步修复链给了可复用的实操细节。信息源是单篇 Reddit 帖子,没有第三方验证或论文背书,所以放在 72-77 的 featured 档位,不往上走。

5月11日星期一

AI HOT 精选

OpenRouter 用真实市场需求给模型排座次,DeepSeek V4 Pro 排第一

OpenRouter 搞了个叫 Pareto Code 的排名方法,不看跑分,直接看用户在实际调用中怎么选模型,找出性价比最优的那条线。目前排第一的是 DeepSeek V4 Pro,后面跟着 GPT 5.4 Mini 和 Gemini 3.1 Pro。不过正文没披露具体怎么算分、样本量多大,所以这个排名到底多稳,我会先打个折。

推荐理由:我会先打个折:OpenRouter 只发了一篇帖子,没公布样本量、统计时间窗口和具体定价依据,所以这个排名不能当严谨评测用。但它的价值在于思路——用市场实际调用数据来反映模型性价比,比跑分更贴近真实使用场景。DeepSeek V4 Pro 排第一这点先别太激动,得看后续有没有更透明的数据支撑。整体上,这条信息对正在选模型的开发者有参考意义,但信息缺口明显,够 featured 但上不了更高分。

5月9日星期六

AI HOT 精选

Redis 作者用几千行 C 代码把 DeepSeek V4 Flash 塞进 MacBook,跑出 27 tok/s

Antirez 开源了一个叫 ds4 的推理引擎,专门给 DeepSeek V4 Flash 用。代码只有几千行 C,能在 128GB 内存的 MacBook Pro 上跑 100 万 token 上下文的模型。他用了三招:对 MoE 专家做不对称 2-bit 量化来压缩模型体积;把 KV Cache 搬到高速 SSD 上,绕开内存不够的问题;再给苹果...

推荐理由:Antirez 开源了一个叫 ds4 的原生推理引擎,几千行 C 代码,在 128GB 内存的 MacBook Pro 上跑 DeepSeek V4 Flash,1M 上下文实测跑到 27 tok/s。我会先打个折,这个速度是在特定硬件和模型上跑出来的,换台机器不一定能复现,但至少证明了不用显卡也能把大模型跑起来。正文没披露量化精度和功耗,这点先别太激动。整体看,这是一个很强的开源推理信号,对关注本地部署和隐私的团队有参考价值。

AI HOT 精选

百度发了 ERNIE 5.1,参数量砍到原来的三分之一,训练费压到同规模模型的 6%

ERNIE 5.1 把总参数量压到原规模的大约三分之一,激活参数压到大约一半,预训练成本只花到同规模模型的 6% 左右。百度说性能没崩,Agent 能力超过 DeepSeek-V4-Pro,世界知识和创意写作接近头部闭源模型和 Gemini 3.1 Pro,推理仅次于 Gemini 3.1 Pro,深度搜索排全球第四。技术手段提了两个:弹性预训练用来提...

推荐理由:百度把 ERNIE 5.1 的参数和成本压到这个程度,我会先打个折——正文没披露具体参数量和基准测试细节,6% 的成本对比对象也没说清楚,这点先别太激动。但即便有水分,三分之一参数、一半激活、6% 预训练成本这三个数字摆出来,对正在头疼推理成本的团队来说就是强信号。加上已经上线 ERNIE 平台和 AI Studio,不是画饼,值得写。

5月7日星期四

r/LocalLLaMA

Reddit 网友扒了 922 条 agent 任务记录,发现 DeepSeek v4 省钱的关键不在标价,在缓存命中率

一位 Reddit 用户分析了 922 条 agent 任务的实际调用记录,对比了 DeepSeek v4 Flash 和 Opus 4.7 的花费。两个模型每个任务都要吃掉大约 96 万 token,但 DeepSeek 单任务成本只要 0.01 美元,Opus 4.7 却要 1.52 美元。差距不在输入输出的标价,而在缓存:DeepSeek 的缓存...

推荐理由:这篇不是比谁模型强,是比谁缓存用得聪明。Reddit用户跑了922条智能体任务轨迹,发现DeepSeek v4 Flash单任务成本0.01美元,Opus 4.7要1.52美元,差了152倍。两边平均token消耗都接近96万,但DeepSeek缓存命中率97%,Opus只有87%;更关键的是缓存读写价格比,DeepSeek是0.02,对方是0.08。也就是说,标价看着便宜不算真便宜,能把重复计算省下来才是省钱的地方。正文没披露任务类型和采样方式,这点先别太激动,但缓存机制这个观察本身值得盯。

5月5日星期二

r/LocalLLaMA

DeepSeek V4 Pro 在 FoodTruck Bench 上追平 GPT-5.2,晚了十周但成本只要十七分之一

Reddit 上有人发帖说,DeepSeek V4 Pro 在一个叫 FoodTruck Bench 的智能体评测里排到第四,中位数得分跟 GPT-5.2 只差 3%,但跑一轮任务的成本大概是后者的十七分之一。这个评测跑了 30 天,模型要用 34 种工具、带持久记忆、每天还得做反思,比较贴近真实业务流程。帖子还提到小米的 MiMo v2.5 Pro ...

推荐理由:这篇是一个 Reddit 用户自己搭的 benchmark 结果,不是官方发布,所以我会先打个折。但内容本身挺有意思:DeepSeek V4 Pro 在一个叫 FoodTruck Bench 的 30 天 agent 测试里排第 4,跟 GPT-5.2 的中位数只差 3%,API 成本却低了大约 17 倍。测试用了 34 个工具、持久记忆和每日反思,不是简单的一问一答。小米 MiMo v2.5 Pro 也进了前 6,5 次全存活,中位 ROI 1019%,单次跑完只要 $2.41。正文没披露样本量和方差,所以“匹配 GPT-5.2”这个结论先别太激...

5月3日星期日

r/LocalLLaMA

本地模型后端生成基准测试:GLM、Qwen、DeepSeek 函数调用能力对比

AutoBe 发了一个后端代码生成基准,用函数调用来测模型设计数据库和 API 的能力。qwen3.5-35b-a3b 在测试里跟 gpt-5.4 打平,但样本量只有 4 个项目,而且评分工具是自己写的,可能有偏向。一个商场项目跑下来要消耗 2 到 3 亿 token,按 GPT 5.5 的定价算,单模型成本在 1000 到 1500 美元。正文没披露...

推荐理由:我会先打个折:数据来自 Reddit 帖子,只测了 n=4 个项目,评测 harness 还是自己写的,偏差肯定有。但 35B 模型追平 gpt-5.4 这个结论够抓眼球,加上单任务 1000 多美元的成本和笔记本可跑的硬限制,对做本地部署的人有参考价值。正文没披露具体任务类型和评分标准细节,这点先别太激动。

4月25日星期六

MIT Technology Review · AI

DeepSeek V4 发布预览版:两个型号、百万 token 上下文,开源模型里跑分最强

DeepSeek 放出了 V4 的预览版,分 V4-Pro 和 V4-Flash 两个型号。Pro 版输入每百万 token 1.74 美元、输出 3.48 美元,Flash 版只要 0.14 和 0.28 美元,两个都支持一次性处理 100 万 token 的上下文,相当于能把《魔戒》三部曲加《霍比特人》全塞进去。跑分上,V4-Pro 在编程、数学、...

推荐理由:我会先打个折:这只是预览版,不是完整发布,所以冲击力比 GPT 或 Claude 大版本换代要弱一档。但它是当天消息,而且信息量够——两个型号的定价、100 万 token 上下文、开源权重对代理编码栈的成本压力,这些对从业者来说都是能直接算账的东西。标题里说的三个理由,正文其实主要落在长上下文注意力的效率提升和开源带来的成本下压上,具体技术细节没展开,但方向是明确的。

彭博科技

DeepSeek 发新模型了,但正文被 Bloomberg 的反爬墙挡住了,具体叫啥、多大、跑分多少全没看到

Bloomberg 这条视频标题说 DeepSeek 在去年震动硅谷的开源发布一周年之际,又推了一款新旗舰模型。但点进去页面直接弹 403 机器人验证,正文一个字都没加载出来。所以模型名字、参数量、定价、基准测试成绩、开源还是闭源,这些关键信息目前全是空白。唯一能确定的是发布时间点卡在周年附近,至于模型本身强不强、省不省钱,得等官方自己放料或者别人扒出...

推荐理由:这条消息的钩子在于“一周年”这个时间点,去年 DeepSeek 把硅谷震了一下,现在再发新模型,大家自然会盯着看。但我会先打个折:正文啥硬信息都没给,模型叫啥、多大、多贵、跑分多少、开不开源全是空白,所以知识缺口很大,不能当实锤来推。关联性上,DeepSeek 的定价和开源策略一直是行业敏感点,新旗舰出来肯定会重新拉高中美对比的热度,这点值得标记。整体判断就挂在时间钩子和信息缺口上,不补设定。

4月24日星期五

彭博科技

DeepSeek 发布新一代旗舰模型预览版,距上次出圈正好一年

DeepSeek 放出了新旗舰模型的预览版本,官方说法是“迄今最强的开源平台”。目前只确认了开源定位和预览状态,正文没披露参数量、上下文长度、跑分成绩和正式发布时间。我会先打个折——能看到的硬信息还太少,先别太激动。

推荐理由:DeepSeek 在去年炸场之后又推新旗舰预览,开源这张牌继续打,话题度够高,所以给到 featured。但文章实质信息很少——没参数、没上下文窗口、没基准成绩、没时间表,只能确认“预览版”和“开源”两点,知识增量弱,重要性就压在 75 这个低位。我会先打个折:标题唬人,内容还撑不起更高的分数。

X · @dotey(宝玉)

DeepSeek 发了 V4 预览版并开源,百万上下文直接标配,不再分版本加价

DeepSeek 放出了 V4 系列模型的预览版,代码也同步开源。这次最实在的变化是,百万 token 的上下文窗口成了所有官方服务的默认配置,Pro 和 Flash 两个型号都一样,没有高价门槛。V4-Pro 是旗舰,推理能力追平了顶尖闭源模型,世界知识得分仅次于 Gemini-Pro-3.1;V4-Flash 是轻量经济版,推理接近 Pro,但知识...

推荐理由:DeepSeek 是国内头部的模型厂商,这次 V4 预览版把百万上下文做成全服务标配并开源,属于实质性发布。HKR 三项都满足:正文有机制解释和迁移截止日期,而且这种定价策略的调整让它值得当天就作为 P1 处理。