跳到正文

#DeepSeek

今日 0 条

5月9日星期六

r/LocalLLaMA

DeepSeek 拒绝了阿里的投资,选择保持公司独立

Reddit 上一条帖子说,DeepSeek 和阿里的融资谈判谈崩了,双方没能在条款上达成一致。帖子提到 DeepSeek 当时的估值是 3000 亿人民币,想融 500 亿。不过原文链接点进去显示 403 错误,正文内容被屏蔽了,所以具体的谈判细节和拒绝原因都没法核实。

推荐理由:这条消息的冲突点很明确:DeepSeek 和阿里没谈成,估值和融资额都有具体数字,不是空穴来风。我会先打个折,因为目前只有 Reddit 单一信源,正文也没披露谈判破裂的具体原因和条款分歧在哪,所以不能当实锤看。但“拒绝”这个动作本身,加上 3000 亿估值和 500 亿融资计划,已经足够让行业讨论模型实验室的独立性和大厂生态的博弈了。

AI HOT 精选

百度发了 ERNIE 5.1,参数量砍到原来的三分之一,训练费压到同规模模型的 6%

ERNIE 5.1 把总参数量压到原规模的大约三分之一,激活参数压到大约一半,预训练成本只花到同规模模型的 6% 左右。百度说性能没崩,Agent 能力超过 DeepSeek-V4-Pro,世界知识和创意写作接近头部闭源模型和 Gemini 3.1 Pro,推理仅次于 Gemini 3.1 Pro,深度搜索排全球第四。技术手段提了两个:弹性预训练用来提...

推荐理由:百度把 ERNIE 5.1 的参数和成本压到这个程度,我会先打个折——正文没披露具体参数量和基准测试细节,6% 的成本对比对象也没说清楚,这点先别太激动。但即便有水分,三分之一参数、一半激活、6% 预训练成本这三个数字摆出来,对正在头疼推理成本的团队来说就是强信号。加上已经上线 ERNIE 平台和 AI Studio,不是画饼,值得写。

机器之心 · 公众号

DeepSeek 被曝正在谈一笔 500 亿人民币的融资,梁文锋自己掏四成,估值可能到 3500 亿

这条消息来自机器之心,但原文页面被微信判定环境异常,需要验证才能看,所以正文内容没拿到。标题和摘要里提到的关键数字是:融资额约 500 亿人民币(折合约 73 亿美元),估值约 3500 亿人民币(折合约 515 亿美元)。梁文锋个人计划出资 40%,腾讯和 600 亿规模的国家 AI 基金也在谈。这些数字如果属实,说明 DeepSeek 这轮融资规模...

推荐理由:这条DeepSeek融资传闻数字大、出资比例明确、资方有名有姓,HKR三项都站得住。但正文也说了还在谈,没有官方确认,所以分数和级别不动,保持84分和featured,不升p1。

AI HOT 精选

DeepSeek 正以 500 亿美元估值融资 70 亿,创始人自己掏了 30 亿

DeepSeek 这轮最多要融 70 亿美元,估值 500 亿,是中国 AI 公司里单轮金额最高的一次。创始人梁文锋个人出了 30 亿,占这轮融资的 40%,融完后他手里还有公司 90% 的股份。DeepSeek 最早是从他自己的对冲基金里孵化出来的。这笔钱主要用来买算力、推 V4.1 新模型,以及做企业级产品,目标是让公司开始有正向收入,路线跟 Op...

推荐理由:这条消息的钩子是梁文锋个人砸 30 亿美元,不是常规融资通稿。数字够具体,能让人算出估值和出资比例。不过正文没披露领投方、具体条款和官方确认,只有单一信源,所以我会先打个折,不把它当定论。对从业者来说,这轮融资如果属实,说明 DeepSeek 在走一条靠创始人重注维持独立性的路,跟 OpenAI 那种外部巨头主导的模式不一样,这点值得留意。

r/LocalLLaMA

单张 RTX 4090 跑 Qwen3.6-27B,262K 上下文冲到 80+ t/s

indrasmirror 用一张 RTX 4090 跑 Qwen3.6-27B-Heretic-v2,上下文拉到 262K token,搭配 TBQ4_0 格式的 KV 缓存和 MTP 推测解码(draft 3),生成速度从约 43 t/s 提到 80-87 t/s。MTP 草稿接受率大概 73%,说明模型对草稿的采纳比例不低,这是提速的关键。帖子正文...

推荐理由:这是一次有实测数据的单卡推理优化记录,不是产品发布,但 H/K/R 三项都站得住。262K 上下文、80+ t/s 的 27B 模型跑在消费级显卡上,对本地部署圈子的吸引力很强。正文给了具体配置和前后对比数字,可复现性不错。扣分点在于来源只有 Reddit 帖子,且场景偏小众本地推理,所以放在 featured 档、77 分是合适的,不用再往上拔。

5月8日星期五

r/LocalLLaMA

DeepSeek 传出首轮融资约 73.5 亿美元,V4.1 更新计划下月发布

Reddit 上有人转述报道,说 DeepSeek 正在寻求高达 500 亿元人民币(约 73.5 亿美元)的首轮融资。帖子还提到 V4.1 版本计划在六月推出,但正文没披露模型参数量、定价和具体性能指标。原链接被 Reddit 安全策略拦截,无法看到更多细节,所以这些数字和发布时间先打个折看。

推荐理由:HKR 三项都成立:报道给出了 73.5 亿美元的融资目标和 V4.1 的 6 月窗口。正文没披露 V4.1 的参数规模、价格,也没确认融资是否已到位,所以这条只能放在 P1 的低位。

量子位 · 公众号

美国研究员 36 小时跑遍中国 AI 圈:字节让所有实验室紧张,DeepSeek 被所有人夸

Ai2 研究员 Nathan Lambert 在 36 小时内密集拜访了智谱、月之暗面、清华、美团、小米和零一万物。他观察到中国 AI 实验室普遍紧盯字节跳动的动向,同时对 DeepSeek 的技术实力和开源做法表示尊重。学生深度参与核心工作、开源习惯以及技术栈的自主掌控,是中美 AI 生态的几个明显差异。

推荐理由:这篇不是模型发布或大厂合作,属于一手见闻加行业判断,信息密度高但偏观察性质。我会先打个折,放在featured而不是p1。正文没给出具体数据验证,但研究员身份和走访名单让可信度不低,值得从业者花几分钟读。

AI HOT 精选

ChatGPT 中文回复老说“我会稳稳地接住你”,WIRED 拆解了原因

ChatGPT 在中文对话里反复蹦出“我会稳稳地接住你”这类怪话,已经成了梗。WIRED 把这归因于模式坍缩——模型在后训练中被奖励机制带偏,逮住几个讨好人的短语使劲用。一个直接原因是翻译错位:英文口语“I've got you”被生硬直译成煽情长句,再被 RLHF 强化成“用户爱听”的固定套路。类似问题还有无故冒出“砍一刀”这种营销话术。这事不是 O...

推荐理由:我会先打个折——正文没给样本量,所以“频现”到底多频繁说不清。但这条信息对做对齐和中文产品的团队有提醒价值:模式坍缩和翻译错位会让模型输出变得油腻,RLHF 讨好奖励又容易把这种表达固化下来。Claude 和 DeepSeek 新版本也出现类似表达,说明这不只是 OpenAI 一家的问题。不过,缺少数据支撑让判断只能停在“值得留意”这个级别。

AI HOT 精选

antirez 开源了 DeepSeek 4 Flash 的本地推理引擎,专跑在苹果芯片的 Metal 上

Redis 作者 antirez 在 GitHub 上放出了一个叫 ds4 的项目,是一个让 DeepSeek 4 Flash 模型在 Mac 上本地跑的推理引擎。它直接调用苹果的 Metal Performance Shaders 来降低延迟和内存占用,相当于给模型配了个更底层的加速驱动,而不是简单套个壳。不过项目页面没给出具体的跑分数据,实际快多少...

推荐理由:我会先打个折:正文没给任何延迟或内存占用的实测数字,所以性能到底多好现在说不准。但值得盯的不是又一个模型壳,而是这套 Metal 本地推理栈——它把推理引擎直接做进苹果的图形加速框架里,思路比多数套壳方案更底层。对想在 Mac 上离线跑模型的人来说,这是个能省钱的路线,只是验证还得等社区跑出数据。

5月7日星期四

r/LocalLLaMA

DeepSeek 首轮融资估值冲到近 450 亿美元,传中国“大基金”在牵头谈

Reddit 帖子转发了多家外媒消息,说 DeepSeek 正在谈第一轮外部融资,估值接近 450 亿美元。帖子标题提到中国“大基金”在主导谈判,但正文只给了 TechCrunch、FT、彭博的链接,没有披露具体融资金额、出让股份比例、参投方名单或交割时间。帖子本身因为网络限制没抓到 Reddit 原文,所以这轮钱怎么进、什么时候关,目前都还是未知数。

推荐理由:标题说DeepSeek首轮融资估值接近450亿美元,中国“大基金”牵头谈,听着挺炸。但正文只给了几个外媒链接,没披露具体金额、占股、还有谁参投、什么时候交割,信息缺口不小。我会先打个折,估值数字本身有传播力,可关键交易细节全空着,所以重要性停在84,不往上拉。

r/LocalLLaMA

Reddit 网友扒了 922 条 agent 任务记录,发现 DeepSeek v4 省钱的关键不在标价,在缓存命中率

一位 Reddit 用户分析了 922 条 agent 任务的实际调用记录,对比了 DeepSeek v4 Flash 和 Opus 4.7 的花费。两个模型每个任务都要吃掉大约 96 万 token,但 DeepSeek 单任务成本只要 0.01 美元,Opus 4.7 却要 1.52 美元。差距不在输入输出的标价,而在缓存:DeepSeek 的缓存...

推荐理由:这篇不是比谁模型强,是比谁缓存用得聪明。Reddit用户跑了922条智能体任务轨迹,发现DeepSeek v4 Flash单任务成本0.01美元,Opus 4.7要1.52美元,差了152倍。两边平均token消耗都接近96万,但DeepSeek缓存命中率97%,Opus只有87%;更关键的是缓存读写价格比,DeepSeek是0.02,对方是0.08。也就是说,标价看着便宜不算真便宜,能把重复计算省下来才是省钱的地方。正文没披露任务类型和采样方式,这点先别太激动,但缓存机制这个观察本身值得盯。

TechCrunch · AI

DeepSeek 首次对外融资,估值可能冲到 450 亿美元

DeepSeek 正在谈第一笔外部投资,几周内估值就从 200 亿涨到了 450 亿美元。这家中国 AI 实验室 2025 年初靠一个训练成本远低于 OpenAI、Anthropic 等美国模型的大语言模型出圈,之后在推理和编程能力上一直咬住第一梯队,模型权重也开放下载。创始人梁文锋原本没打算融资,但对手开始挖人,他才决定引入资金好给员工发股份。领投方...

推荐理由:DeepSeek 第一次对外融资,目标估值 450 亿美元,我会先打个折——正文没给金额、没列投资方、也没提条款,所以这个数目前更像一个信号而不是定论。真正值得盯的是:如果首轮真按这个价成交,中国 AI 实验室的估值天花板就被重新画了一条线。这点先别太激动,等更多细节出来再说。

5月6日星期三

FT · 科技

DeepSeek 新一轮融资估值冲到 450 亿美元,腾讯也想入局

FT 报道,DeepSeek 正在谈一轮新融资,估值接近 450 亿美元,腾讯是意向投资方之一。正文被付费墙挡住,没披露具体融资金额、条款和时间表。这个估值目前还只是谈判桌上的数字,关键要看它跟模型实际收入能不能对上——正文没给营收数据,这点先别太激动。

推荐理由:我会先打个折:450 亿美元是讨论中的估值,不是落地的钱,正文没披露融资规模、条款和时间表,所以别急着当成交价看。真正值得盯的是这个估值和 DeepSeek 模型收入能不能对上——目前没看到收入数据,信息缺口不小。腾讯想入股是个强信号,但没写具体怎么投、投多少,先当风向标看。

机器之心 · 公众号

DeepSeek版Claude Code登顶GitHub热榜,8700星,一个叫鲸鱼哥的开发者用Rust做了个终端工具

这个叫DeepSeek TUI的工具在GitHub上拿了8700多颗星,是开发者Hunter Bown(鲸鱼哥)用Rust写的,让你在本地终端里直接调用DeepSeek V4干活。它能聊天、改文件、跑shell命令、管任务。比较特别的是RLM模式:一次可以派发最多16个V4 Flash子任务,上下文窗口有100万token,操作前还有审批关卡,等于让模...

推荐理由:我会先打个折:这是个人项目,不是 DeepSeek 官方出品,稳定性和后续维护都还是未知数。但 8700 星的热度是实打实的,RLM 的并发和审批设计也给了具体的技术细节,不是空炒概念。对想省钱又想在终端里用 DeepSeek 干活的开发者来说,这东西值得盯一下,但暂时别把它当生产工具。

r/LocalLLaMA

DeepSeek V4 便宜 17 倍,我实测了 10 天写代码哪些活能丢给本地模型

Reddit 用户 spencer_kw 把自己 10 天的编程工作流拆成 150 个任务,拿本地 Qwen 3.6 27B 和云端模型重新跑了一遍。结果 65% 的任务本地模型干得一样好,20% 勉强能用,只有 15% 必须上云端。他的 API 账单从每月 85 美元掉到 22 美元左右。这个测试说明省钱的关键不是盯着模型单价,而是按任务类型做分流—...

推荐理由:这篇不是模型发布,而是一个开发者拿自己的编码工作流做的成本实测,有日志、有复测、有分桶比例,信息量够。单一个 Reddit 帖子的样本量有限,普适性要打个折,所以放在 featured 而不是 P1。我会先看他的任务分类和路由逻辑,这点比“便宜 17 倍”本身更有参考价值。

5月5日星期二

r/LocalLLaMA

DeepSeek V4 Pro 在 FoodTruck Bench 上追平 GPT-5.2,晚了十周但成本只要十七分之一

Reddit 上有人发帖说,DeepSeek V4 Pro 在一个叫 FoodTruck Bench 的智能体评测里排到第四,中位数得分跟 GPT-5.2 只差 3%,但跑一轮任务的成本大概是后者的十七分之一。这个评测跑了 30 天,模型要用 34 种工具、带持久记忆、每天还得做反思,比较贴近真实业务流程。帖子还提到小米的 MiMo v2.5 Pro ...

推荐理由:这篇是一个 Reddit 用户自己搭的 benchmark 结果,不是官方发布,所以我会先打个折。但内容本身挺有意思:DeepSeek V4 Pro 在一个叫 FoodTruck Bench 的 30 天 agent 测试里排第 4,跟 GPT-5.2 的中位数只差 3%,API 成本却低了大约 17 倍。测试用了 34 个工具、持久记忆和每日反思,不是简单的一问一答。小米 MiMo v2.5 Pro 也进了前 6,5 次全存活,中位 ROI 1019%,单次跑完只要 $2.41。正文没披露样本量和方差,所以“匹配 GPT-5.2”这个结论先别太激...

5月4日星期一

量子位 · 公众号

DeepSeek-TUI 开源:一个用 Rust 写的终端版 DeepSeek 编程助手,GitHub 上拿了 2.3k 星

这是一个叫 DeepSeek-TUI 的终端工具,你可以把它理解成“DeepSeek 版的 Claude Code”,专门在命令行里帮你写代码、跑命令。项目用 Rust 开发,MIT 协议开源,目前主要对接 DeepSeek V4 模型,支持 100 万 token 的上下文窗口。它有个叫 RLM 的功能,能把大任务拆成最多 16 个 V4 Flash...

推荐理由:我会先打个折:2.3k 星在 GitHub 不算爆款,但标题蹭 Claude Code 的热度很精准,加上 Rust 实现和 MIT 协议,对在意可控性和成本的开发者有吸引力。正文没披露实际延迟和任务完成率,所以性能先别太激动。真正值得盯的是缓存成本——未命中 token 价格是命中的 10 倍,如果是真的,对高频编码场景挺省钱。影响面集中在开发者群体,所以重要性给到 75 是合理的。

5月3日星期日

r/LocalLLaMA

本地模型后端生成基准测试:GLM、Qwen、DeepSeek 函数调用能力对比

AutoBe 发了一个后端代码生成基准,用函数调用来测模型设计数据库和 API 的能力。qwen3.5-35b-a3b 在测试里跟 gpt-5.4 打平,但样本量只有 4 个项目,而且评分工具是自己写的,可能有偏向。一个商场项目跑下来要消耗 2 到 3 亿 token,按 GPT 5.5 的定价算,单模型成本在 1000 到 1500 美元。正文没披露...

推荐理由:我会先打个折:数据来自 Reddit 帖子,只测了 n=4 个项目,评测 harness 还是自己写的,偏差肯定有。但 35B 模型追平 gpt-5.4 这个结论够抓眼球,加上单任务 1000 多美元的成本和笔记本可跑的硬限制,对做本地部署的人有参考价值。正文没披露具体任务类型和评分标准细节,这点先别太激动。

量子位 · 公众号

DeepSeek V4 技术报告里漏掉了 Engram,一个能明显拉高长文本记忆分数的查表模块

DeepSeek V4 的技术报告列了一堆新组件,但没提 Engram。这个模块是 DeepSeek 和北大在 1 月开源的,做法是在 Transformer 的第 2 到第 15 层之间插入查表模块。在 27B 规模的测试里,它把 MMLU 拉高了 3.4 分,多查询大海捞针准确率干到了 97.0%。工程上还有个信号:8 台服务器通过 CXL 共享 ...

推荐理由:文章不是 V4 发布本身,而是技术报告缺了 Engram 这件事的分析。有层数范围、基准涨点和内存池损耗数据,信息密度够,但属于评论向,不是一手发布,所以重要性在 78-84 区间合理。

5月2日星期六

Hacker News 首页

SimplePDF 推出 AI 填表助手,PDF 解析和填写全在浏览器里完成

SimplePDF 发布了一个叫 Copilot 的演示,能让你用聊天的方式填写 PDF 表单。它把 PDF 的解析、渲染和字段识别都放在浏览器本地跑,文件不会上传到服务器。默认接的是 DeepSeek V4 Flash 的代理,也支持你自己带 API 密钥、用云端模型或者接 LM Studio 本地模型。正文说 SimplePDF 现在月活用户超过 ...

推荐理由:HKR 三项都成立:审判式冲突来自“AI 填表但不上传文件”的设定;事实层面给出了 20 万月活、本地解析和蒸馏机制,不是空泛宣传;治理和竞争伦理的神经被触动,因为客户端工具调用绕开了传统 SaaS 的隐私风险。不过目前只是产品演示,没有裁决或平台级发布,所以重要性停在 74 分、featured 档位是合理的。

5月1日星期五

r/LocalLLaMA

Reddit 网友用 16 台 DGX Spark 攒了个集群,跑通 434GB 大模型

Reddit 用户 Kurcide 晒出了他搭的 16 节点 DGX Spark 集群。每台机器用一根 QSFP56 线连到 FS N8510 交换机,单链路跑到 100–111 Gbps,总带宽约 200 Gbps,所有节点都跑满了线速。这次测试的重点是统一内存:8 个节点合起来成功加载了 434GB 的 GLM-5.1-NVFP4 模型,接下来他还...

推荐理由:H、K、R 三项都成立:帖子是第一手集群实测数据,网络条件和模型运行情况都交代清楚了,434GB 模型跑在 8 节点上是个实打实的验证。范围限定在本地推理硬件,所以重要性落在 72–77 这个区间,没到产品发布级别。

机器之心 · 公众号

强化学习在 LLM 推理训练里的算法演变:从 PPO 到 MaxRL

这篇文章梳理了 2024 到 2026 年,让大模型学会推理的强化学习算法是怎么一步步改的。起点是 PPO,它需要同时跑一个策略模型和一个价值模型,训练成本高。后来的 GRPO、RLOO 这些变体,核心思路是砍掉价值模型,靠同一道题生成多个答案互相比较来算优势,省了显存和算力。再往后,DAPO、CISPO、MaxRL 等新方法在 GRPO 的基础上修修...

推荐理由:这篇不是新模型发布,而是一篇技术梳理,把2024到2026年推理RL算法的关键机制差异讲得很透。我会先打个折:它没有新实验数据,纯靠已有论文做对比,但胜在把PPO到MaxRL的取舍逻辑串起来了,对正在选RL路线的团队有实际参考价值。

4月30日星期四

r/LocalLLaMA

DeepSeek 放出了“用视觉原语思考”框架,让模型在推理时直接画坐标和框

DeepSeek 和北大、清华一起发了篇论文,还公开了代码库。这个框架的思路是在思维链里插入坐标点和边界框,相当于让模型边想边在图上做标记。帖子本身没贴跑分数据,正文也没披露具体指标,所以效果到底提升多少还不清楚。

推荐理由:我会先打个折,因为正文没披露任何 benchmark 分数,效果到底怎么样还不清楚。但亮点很实在:它让模型在推理时能指着图像说“看这里”,把坐标点和边界框当成思考的最小单元,这比纯文字描述直观得多。代码已经开源,对做多模态推理和可解释性的从业者来说,是个值得上手试的方向。没给分数就先别太激动,但思路本身够新,所以给到 80 分。

4月29日星期三

X · @op7418(歸藏)

DeepSeek 多模态模型全量上线,网页版识图模式能用了

DeepSeek 把多模态模型全量推上线了,现在打开网页版就能用识图模式。从体验看,这应该是一个独立的多模态模型,不是把图片转文字再丢给纯文本模型那种拼接方案。正文没披露模型名字、参数量、定价和 API 开放时间,这些关键信息都还缺着,想接进自己流程的朋友得再等等。

推荐理由:我会先打个折:这条消息本身够重磅,DeepSeek 的多模态终于从传闻变成可试用的东西了。但正文只确认了网页版识图入口,模型叫什么、多大、多少钱、什么时候上 API 全都没说,信息密度其实挺薄的。HKR 三条都踩中了,不过来源只有一条 X 帖,验证不够硬,所以分数压在 78–84 这个区间是合理的。这点先别太激动,等 API 和 benchmark 出来再重新评估。

量子位 · 公众号

DeepSeek 多模态模型开始灰度测试,能识别图片里的饮料和杯子

DeepSeek 研究员确认 V4 视觉版已经在灰度测试,官网首页上线了图片识别入口。一张截图显示,模型花了 4 秒识别出一张文字不多的图片里的饮料种类和杯子类型。正文没披露灰度覆盖范围、API 是否开放以及定价,所以能不能用上、花多少钱还不清楚。

推荐理由:HKR 三项都站得住:DeepSeek V4 视觉灰度测试是实打实的国内旗舰更新,有截图和 4 秒思考样本。分数维持 80,因为正文没披露开放范围、API 怎么接、价格和跑分,信息缺口不小,先别太激动。

r/LocalLLaMA

DeepSeek V4 定价低到离谱,有人算完账开始怀疑自己的技术栈

Reddit 上有人算了笔账:DeepSeek V4-Pro 输入价格是每百万 token 0.145 美元,比 Claude Opus 4.7 便宜约 34 倍。五月有个促销直接砍到 0.036 美元,缓存命中更是只要 0.0036 美元,比 Opus 的缓存价低了约 173 倍。发帖人最在意的是 agent 循环跑起来的成本,但帖子没验证 100 ...

推荐理由:HKR 三项都踩中了:价格冲击力强、数字具体可算、对 agent 场景的成本压力点抓得准。但这是 Reddit 用户自己算的账,不是官方发布或生产环境实测,所以分数压在 77,不往上给。

Computing Life · Share · 鸭哥调研

DeepSeek V4 技术解读:为 Agent 长任务做的工程取舍

这篇文章把 DeepSeek V4 的技术报告翻译成了人话,核心就讲一件事:为了让模型能稳定地跑完一个长链条的 Agent 任务(比如改代码、调工具、看日志反复几十轮),V4 在架构上做了哪些又贵又复杂的工程决策。文章拆解了三个主要矛盾。第一,百万级上下文不是光能装下就行,Agent 得随时回看历史里的报错和工具结果,V4 的做法是把注意力机制分成三层...

推荐理由:我会先打个折:正文没给参数量、训练数据、价格和发布时间,所以没法判断它到底多能打,只能当技术方向看。但 DeepSeek V4 把 100 万 token 上下文和 agent 负载绑在一起讲,还给了混合注意力、OPD 这些具体手段,对做 agent 落地的人有参考价值。信息缺口明显,所以重要性停在 78,不往上拔。

4月27日星期一

量子位 · 公众号

DeepSeek V4 永久降价,缓存命中再打一折,实测编程成本降了 83%

DeepSeek V4 两天内连续降价,输入和输出价格直接砍掉 75%,缓存命中的输入还能再打一折。量子位的编程实测里,处理 3500 万 token 的成本从 31.73 元掉到 5.34 元,降了 83%。这个价格对缓存命中率高的场景最划算,V4-Pro 的缓存命中率大概在 95% 到 96%。

推荐理由:HKR三项都站得住:降价幅度和两次调价节奏有话题性,实测数据让便宜可验证,成本敏感型从业者会立刻对标自己的用量。不过它本质还是定价更新,不是新模型发布,所以分数没往上拉。

4月26日星期日

Hacker News 首页

DeepSeek-V4 发布当天,SGLang 和 Miles 就接好了推理和 RL 训练

SGLang 和 Miles 团队在 DeepSeek-V4 发布当天就完成了推理和强化学习训练的适配,覆盖了 1.6T 参数的 Pro 版和 284B 参数的 Flash 版。V4 模型用了混合稀疏注意力,把滑动窗口和两种 KV 压缩(4:1 或 128:1)混在一起,撑住了 100 万 token 的上下文窗口,专家权重还用了 FP4 精度。系统上...

推荐理由:我会先打个折:这篇不是给所有人看的,系统细节多,普通读者容易走神。但它的钩子够硬——V4 发布当天就有推理加验证 RL 的工程栈,而且把上下文长度、压缩比、注意力窗口这些直接影响成本和稳定性的数字都摊开了。ShadowRadix 那部分虽然正文没展开实现细节,但点出了多池一致性这个真正难啃的骨头,对做部署和调优的人比单纯跑分更有参考价值。

4月25日星期六

Latent Space

DeepSeek 发布 V4 Pro 和 Flash 模型,能在华为昇腾芯片上跑

DeepSeek 终于发了 V4 系列,一共两个型号:V4 Pro 总参数 1.6 万亿,每次激活 490 亿;V4 Flash 总参数 2840 亿,激活 130 亿。两个模型都支持 100 万 token 的上下文,用了新的压缩注意力技术,相比 V3.2,处理长文本时计算量只要 27%,显存占用只要 10%。这次比较特别的是同时发了基础版和指令版,...

推荐理由:这条必须写。DeepSeek 这次放出的不只是模型,而是把华为昇腾兼容性摆上台面,等于在 CUDA 依赖上划了一刀。技术报告说 1M token 下只用 V3.2 27% 的算力、10% 的 KV 缓存,省得挺实在。两档参数和 MIT 许可也让落地门槛更低。我会先打个折:正文没提实际推理延迟和昇腾上的吞吐数据,这点先别太激动,但硬件独立性本身已经够重。

MIT Technology Review · AI

DeepSeek V4 发布预览版:两个型号、百万 token 上下文,开源模型里跑分最强

DeepSeek 放出了 V4 的预览版,分 V4-Pro 和 V4-Flash 两个型号。Pro 版输入每百万 token 1.74 美元、输出 3.48 美元,Flash 版只要 0.14 和 0.28 美元,两个都支持一次性处理 100 万 token 的上下文,相当于能把《魔戒》三部曲加《霍比特人》全塞进去。跑分上,V4-Pro 在编程、数学、...

推荐理由:我会先打个折:这只是预览版,不是完整发布,所以冲击力比 GPT 或 Claude 大版本换代要弱一档。但它是当天消息,而且信息量够——两个型号的定价、100 万 token 上下文、开源权重对代理编码栈的成本压力,这些对从业者来说都是能直接算账的东西。标题里说的三个理由,正文其实主要落在长上下文注意力的效率提升和开源带来的成本下压上,具体技术细节没展开,但方向是明确的。

彭博科技

DeepSeek 发新模型了,但正文被 Bloomberg 的反爬墙挡住了,具体叫啥、多大、跑分多少全没看到

Bloomberg 这条视频标题说 DeepSeek 在去年震动硅谷的开源发布一周年之际,又推了一款新旗舰模型。但点进去页面直接弹 403 机器人验证,正文一个字都没加载出来。所以模型名字、参数量、定价、基准测试成绩、开源还是闭源,这些关键信息目前全是空白。唯一能确定的是发布时间点卡在周年附近,至于模型本身强不强、省不省钱,得等官方自己放料或者别人扒出...

推荐理由:这条消息的钩子在于“一周年”这个时间点,去年 DeepSeek 把硅谷震了一下,现在再发新模型,大家自然会盯着看。但我会先打个折:正文啥硬信息都没给,模型叫啥、多大、多贵、跑分多少、开不开源全是空白,所以知识缺口很大,不能当实锤来推。关联性上,DeepSeek 的定价和开源策略一直是行业敏感点,新旗舰出来肯定会重新拉高中美对比的热度,这点值得标记。整体判断就挂在时间钩子和信息缺口上,不补设定。

4月24日星期五

TechCrunch · AI

DeepSeek 放出 V4 预览版,自称推理能力快追上头部模型

DeepSeek 在 Hugging Face 上发了两个 V4 预览模型,说架构改动让它们比 V3.2 更省资源、跑分更高,在推理基准上“几乎追平”当前领先的开源和闭源模型。但正文没给出具体模型名、参数量、跑分数字和测试集,也没提什么时候正式发布。所以“追平”这个说法先别太激动——没有可复现的评测数据,没法验证。

推荐理由:这条消息的传播价值在于 DeepSeek 放话“缩小差距”,但正文没给任何可核对的数字,所以我会先打个折。H 和 R 靠竞争信号就能过,K 弱是因为关键信息全缺,没法验证它到底多强。真正该盯的是后续有没有可复现的实测,现在这点先别太激动。

The Verge · AI

DeepSeek 放出 V4 模型预览,说能跟 Google、OpenAI、Anthropic 的闭源模型正面打

DeepSeek 在 4 月 24 号发布了开源 V4 模型的预览版,声称性能可以对标美国几家头部公司的闭源系统。这次重点提了编程能力提升,并且强调跟华为的硬件兼容——这基本就是在说,模型能跑在中国自己的芯片上。不过正文没披露参数量、具体跑分和正式发布时间。我会先打个折:编程强了多少、在什么任务上强,都没给数据,这点先别太激动。

推荐理由:DeepSeek 这次放出的 V4 预览版,我会先打个折——参数、基准分数、商用时间全都没披露,所以别急着激动。但信息量还是够的:代码能力提升直接指向让模型进业务流程干活的 agent 场景,而华为兼容性把模型进展和国产芯片栈绑得更紧,这两点比单纯刷榜更有看头。正文没给具体数字,所以重要性停在 83,等有实测数据再往上调。

r/LocalLLaMA

DeepSeek V4 发布:1.6T 参数的 Pro 版和 284B 的 Flash 版,MIT 开源,支持 100 万 token 上下文

DeepSeek 放出了两个 V4 模型,都走 MIT 开源协议,上下文窗口拉到 100 万 token。Pro 版总参数 1.6T,每次推理只激活 49B;Flash 版总参数 284B,激活 13B。激活参数占比很低,意味着如果跑分靠谱,自己部署长上下文模型的硬件门槛和成本会降一截。不过原帖没给具体跑分、定价、训练数据量,也没提实际推理吞吐,这些都...

推荐理由:这是 DeepSeek 旗舰级开源发布,两个 MIT 权重加 1M 上下文,当天覆盖没问题。分数停在 86,因为正文没披露基准分数、吞吐、训练数据规模或定价,这些缺口让实际效果还得等实测。我会先打个折,别看到 1.6T 就上头。

彭博科技

DeepSeek 发布新一代旗舰模型预览版,距上次出圈正好一年

DeepSeek 放出了新旗舰模型的预览版本,官方说法是“迄今最强的开源平台”。目前只确认了开源定位和预览状态,正文没披露参数量、上下文长度、跑分成绩和正式发布时间。我会先打个折——能看到的硬信息还太少,先别太激动。

推荐理由:DeepSeek 在去年炸场之后又推新旗舰预览,开源这张牌继续打,话题度够高,所以给到 featured。但文章实质信息很少——没参数、没上下文窗口、没基准成绩、没时间表,只能确认“预览版”和“开源”两点,知识增量弱,重要性就压在 75 这个低位。我会先打个折:标题唬人,内容还撑不起更高的分数。

X · @Yuchenj_UW

DeepSeek V4 来了,Pro 版用 MIT 协议开源,参数 1.6T 但只激活 49B

DeepSeek 放出了 V4 的消息。Pro 版本走 MIT 开源协议,总参数量 1.6 万亿,但每次推理只激活 490 亿参数,属于大模型小用,推理成本会比较友好。官方还提了一嘴 Pro Max 版,说跑分接近 Opus-4.6 Max 和 GPT-5.4 xHigh,但正文没披露具体跑分榜单、分数、发布时间和模型权重,这点先别太激动。

推荐理由:这条消息值得上 featured,我会先打个折,不往 p1 推。钩子很清晰:DeepSeek 发 V4,MIT 许可加 49B 激活参数,部署门槛明显降低。硬信息也有,1.6T 总参数量、MIT 许可都是新事实。但正文只喊口号式对标 Opus-4.6 Max 和 GPT-5.4 xHigh,没给出任何具体基准名称或分数,权重链接和发布时间也都没提,这点先别太激动。相关性上,这是旗舰开源模型发布,直接关系到推理成本和开源生态竞争,从业者肯定要盯。综合看,信息有缺口但信号够强,保持 84 分、featured 合理。

X · @dotey(宝玉)

DeepSeek 发了 V4 预览版并开源,百万上下文直接标配,不再分版本加价

DeepSeek 放出了 V4 系列模型的预览版,代码也同步开源。这次最实在的变化是,百万 token 的上下文窗口成了所有官方服务的默认配置,Pro 和 Flash 两个型号都一样,没有高价门槛。V4-Pro 是旗舰,推理能力追平了顶尖闭源模型,世界知识得分仅次于 Gemini-Pro-3.1;V4-Flash 是轻量经济版,推理接近 Pro,但知识...

推荐理由:DeepSeek 是国内头部的模型厂商,这次 V4 预览版把百万上下文做成全服务标配并开源,属于实质性发布。HKR 三项都满足:正文有机制解释和迁移截止日期,而且这种定价策略的调整让它值得当天就作为 P1 处理。

X · @op7418(歸藏)

DeepSeek V4 发了公告:Pro 版 1.6T 总参数量但只激活 49B,Flash 版更轻量,预训练都喂了 32T 数据

DeepSeek 放出了 V4 的官方说明。这次分两个版本:Pro 版总参数量 1.6 万亿,实际干活时只激活 490 亿参数;Flash 版总参数量 2840 亿,激活 130 亿参数,两个版本预训练都用了 32 万亿 token。网页和 App 里的“专家模式”对应 Pro,“快速模式”对应 Flash。官方说多项跑分跟 Opus 4.6 打平,A...

推荐理由:这是 DeepSeek 的旗舰发布,分量跟美国头部实验室发新模型看齐。HKR 三项都站得住:公告里参数规模、训练数据量、新注意力机制这些硬信息都有,也直接拿 Opus 4.6 做对比,对从业者选模型和算成本都有参考价值。不过摘要没提评测具体怎么跑的、定价和 API 开放时间,这些缺口让我对 benchmark 那部分先打个折。

X · @op7418(歸藏)

DeepSeek V4 发布,Flash 和 Pro 两个版本,Flash 输入每百万 token 只要两毛钱

DeepSeek 放出了 V4 模型,分 Flash 和 Pro 两档。Flash 主打便宜,每百万 token 输入 ¥0.2、输出 ¥1;Pro 贵不少,输入 ¥1、输出 ¥12。功能上支持 JSON 输出、工具调用、对话前缀续写和 FIM 补全。注意,如果上下文开到 100 万 token,输出价格会翻倍。正文没提模型规模、训练数据、基准跑分和具...

推荐理由:这是国内一线实验室的新旗舰模型发布,重要性和美国大厂发新模型看齐。摘要把 Flash/Pro 型号、JSON 输出、工具调用、FIM 和定价都列出来了,HKR 三项都站得住。不过正文没给评测基准、上下文窗口具体长度和开放范围,我会先打个折——信息缺口摆在那,别急着把话说满。