跳到正文

DeepSeek

DeepSeek(深度求索)的模型发布、开源权重与技术报告——开源大模型价格与性能双卷的风向标。

194 条精选相关主题千问 Qwen开源生态模型发布

最新精选

第 161–180 条 · 共 194 条

5月4日星期一

量子位 · 公众号

DeepSeek-TUI 开源:一个用 Rust 写的终端版 DeepSeek 编程助手,GitHub 上拿了 2.3k 星

这是一个叫 DeepSeek-TUI 的终端工具,你可以把它理解成“DeepSeek 版的 Claude Code”,专门在命令行里帮你写代码、跑命令。项目用 Rust 开发,MIT 协议开源,目前主要对接 DeepSeek V4 模型,支持 100 万 token 的上下文窗口。它有个叫 RLM 的功能,能把大任务拆成最多 16 个 V4 Flash...

推荐理由:我会先打个折:2.3k 星在 GitHub 不算爆款,但标题蹭 Claude Code 的热度很精准,加上 Rust 实现和 MIT 协议,对在意可控性和成本的开发者有吸引力。正文没披露实际延迟和任务完成率,所以性能先别太激动。真正值得盯的是缓存成本——未命中 token 价格是命中的 10 倍,如果是真的,对高频编码场景挺省钱。影响面集中在开发者群体,所以重要性给到 75 是合理的。

5月3日星期日

r/LocalLLaMA

本地模型后端生成基准测试:GLM、Qwen、DeepSeek 函数调用能力对比

AutoBe 发了一个后端代码生成基准,用函数调用来测模型设计数据库和 API 的能力。qwen3.5-35b-a3b 在测试里跟 gpt-5.4 打平,但样本量只有 4 个项目,而且评分工具是自己写的,可能有偏向。一个商场项目跑下来要消耗 2 到 3 亿 token,按 GPT 5.5 的定价算,单模型成本在 1000 到 1500 美元。正文没披露...

推荐理由:我会先打个折:数据来自 Reddit 帖子,只测了 n=4 个项目,评测 harness 还是自己写的,偏差肯定有。但 35B 模型追平 gpt-5.4 这个结论够抓眼球,加上单任务 1000 多美元的成本和笔记本可跑的硬限制,对做本地部署的人有参考价值。正文没披露具体任务类型和评分标准细节,这点先别太激动。

量子位 · 公众号

DeepSeek V4 技术报告里漏掉了 Engram,一个能明显拉高长文本记忆分数的查表模块

DeepSeek V4 的技术报告列了一堆新组件,但没提 Engram。这个模块是 DeepSeek 和北大在 1 月开源的,做法是在 Transformer 的第 2 到第 15 层之间插入查表模块。在 27B 规模的测试里,它把 MMLU 拉高了 3.4 分,多查询大海捞针准确率干到了 97.0%。工程上还有个信号:8 台服务器通过 CXL 共享 ...

推荐理由:文章不是 V4 发布本身,而是技术报告缺了 Engram 这件事的分析。有层数范围、基准涨点和内存池损耗数据,信息密度够,但属于评论向,不是一手发布,所以重要性在 78-84 区间合理。

5月2日星期六

Hacker News 首页

SimplePDF 推出 AI 填表助手,PDF 解析和填写全在浏览器里完成

SimplePDF 发布了一个叫 Copilot 的演示,能让你用聊天的方式填写 PDF 表单。它把 PDF 的解析、渲染和字段识别都放在浏览器本地跑,文件不会上传到服务器。默认接的是 DeepSeek V4 Flash 的代理,也支持你自己带 API 密钥、用云端模型或者接 LM Studio 本地模型。正文说 SimplePDF 现在月活用户超过 ...

推荐理由:HKR 三项都成立:审判式冲突来自“AI 填表但不上传文件”的设定;事实层面给出了 20 万月活、本地解析和蒸馏机制,不是空泛宣传;治理和竞争伦理的神经被触动,因为客户端工具调用绕开了传统 SaaS 的隐私风险。不过目前只是产品演示,没有裁决或平台级发布,所以重要性停在 74 分、featured 档位是合理的。

5月1日星期五

r/LocalLLaMA

Reddit 网友用 16 台 DGX Spark 攒了个集群,跑通 434GB 大模型

Reddit 用户 Kurcide 晒出了他搭的 16 节点 DGX Spark 集群。每台机器用一根 QSFP56 线连到 FS N8510 交换机,单链路跑到 100–111 Gbps,总带宽约 200 Gbps,所有节点都跑满了线速。这次测试的重点是统一内存:8 个节点合起来成功加载了 434GB 的 GLM-5.1-NVFP4 模型,接下来他还...

推荐理由:H、K、R 三项都成立:帖子是第一手集群实测数据,网络条件和模型运行情况都交代清楚了,434GB 模型跑在 8 节点上是个实打实的验证。范围限定在本地推理硬件,所以重要性落在 72–77 这个区间,没到产品发布级别。

机器之心 · 公众号

强化学习在 LLM 推理训练里的算法演变:从 PPO 到 MaxRL

这篇文章梳理了 2024 到 2026 年,让大模型学会推理的强化学习算法是怎么一步步改的。起点是 PPO,它需要同时跑一个策略模型和一个价值模型,训练成本高。后来的 GRPO、RLOO 这些变体,核心思路是砍掉价值模型,靠同一道题生成多个答案互相比较来算优势,省了显存和算力。再往后,DAPO、CISPO、MaxRL 等新方法在 GRPO 的基础上修修...

推荐理由:这篇不是新模型发布,而是一篇技术梳理,把2024到2026年推理RL算法的关键机制差异讲得很透。我会先打个折:它没有新实验数据,纯靠已有论文做对比,但胜在把PPO到MaxRL的取舍逻辑串起来了,对正在选RL路线的团队有实际参考价值。

4月30日星期四

r/LocalLLaMA

DeepSeek 放出了“用视觉原语思考”框架,让模型在推理时直接画坐标和框

DeepSeek 和北大、清华一起发了篇论文,还公开了代码库。这个框架的思路是在思维链里插入坐标点和边界框,相当于让模型边想边在图上做标记。帖子本身没贴跑分数据,正文也没披露具体指标,所以效果到底提升多少还不清楚。

推荐理由:我会先打个折,因为正文没披露任何 benchmark 分数,效果到底怎么样还不清楚。但亮点很实在:它让模型在推理时能指着图像说“看这里”,把坐标点和边界框当成思考的最小单元,这比纯文字描述直观得多。代码已经开源,对做多模态推理和可解释性的从业者来说,是个值得上手试的方向。没给分数就先别太激动,但思路本身够新,所以给到 80 分。

4月29日星期三

X · @op7418(歸藏)

DeepSeek 多模态模型全量上线,网页版识图模式能用了

DeepSeek 把多模态模型全量推上线了,现在打开网页版就能用识图模式。从体验看,这应该是一个独立的多模态模型,不是把图片转文字再丢给纯文本模型那种拼接方案。正文没披露模型名字、参数量、定价和 API 开放时间,这些关键信息都还缺着,想接进自己流程的朋友得再等等。

推荐理由:我会先打个折:这条消息本身够重磅,DeepSeek 的多模态终于从传闻变成可试用的东西了。但正文只确认了网页版识图入口,模型叫什么、多大、多少钱、什么时候上 API 全都没说,信息密度其实挺薄的。HKR 三条都踩中了,不过来源只有一条 X 帖,验证不够硬,所以分数压在 78–84 这个区间是合理的。这点先别太激动,等 API 和 benchmark 出来再重新评估。

量子位 · 公众号

DeepSeek 多模态模型开始灰度测试,能识别图片里的饮料和杯子

DeepSeek 研究员确认 V4 视觉版已经在灰度测试,官网首页上线了图片识别入口。一张截图显示,模型花了 4 秒识别出一张文字不多的图片里的饮料种类和杯子类型。正文没披露灰度覆盖范围、API 是否开放以及定价,所以能不能用上、花多少钱还不清楚。

推荐理由:HKR 三项都站得住:DeepSeek V4 视觉灰度测试是实打实的国内旗舰更新,有截图和 4 秒思考样本。分数维持 80,因为正文没披露开放范围、API 怎么接、价格和跑分,信息缺口不小,先别太激动。

r/LocalLLaMA

DeepSeek V4 定价低到离谱,有人算完账开始怀疑自己的技术栈

Reddit 上有人算了笔账:DeepSeek V4-Pro 输入价格是每百万 token 0.145 美元,比 Claude Opus 4.7 便宜约 34 倍。五月有个促销直接砍到 0.036 美元,缓存命中更是只要 0.0036 美元,比 Opus 的缓存价低了约 173 倍。发帖人最在意的是 agent 循环跑起来的成本,但帖子没验证 100 ...

推荐理由:HKR 三项都踩中了:价格冲击力强、数字具体可算、对 agent 场景的成本压力点抓得准。但这是 Reddit 用户自己算的账,不是官方发布或生产环境实测,所以分数压在 77,不往上给。

Computing Life · Share · 鸭哥调研

DeepSeek V4 技术解读:为 Agent 长任务做的工程取舍

这篇文章把 DeepSeek V4 的技术报告翻译成了人话,核心就讲一件事:为了让模型能稳定地跑完一个长链条的 Agent 任务(比如改代码、调工具、看日志反复几十轮),V4 在架构上做了哪些又贵又复杂的工程决策。文章拆解了三个主要矛盾。第一,百万级上下文不是光能装下就行,Agent 得随时回看历史里的报错和工具结果,V4 的做法是把注意力机制分成三层...

推荐理由:我会先打个折:正文没给参数量、训练数据、价格和发布时间,所以没法判断它到底多能打,只能当技术方向看。但 DeepSeek V4 把 100 万 token 上下文和 agent 负载绑在一起讲,还给了混合注意力、OPD 这些具体手段,对做 agent 落地的人有参考价值。信息缺口明显,所以重要性停在 78,不往上拔。

4月27日星期一

量子位 · 公众号

DeepSeek V4 永久降价,缓存命中再打一折,实测编程成本降了 83%

DeepSeek V4 两天内连续降价,输入和输出价格直接砍掉 75%,缓存命中的输入还能再打一折。量子位的编程实测里,处理 3500 万 token 的成本从 31.73 元掉到 5.34 元,降了 83%。这个价格对缓存命中率高的场景最划算,V4-Pro 的缓存命中率大概在 95% 到 96%。

推荐理由:HKR三项都站得住:降价幅度和两次调价节奏有话题性,实测数据让便宜可验证,成本敏感型从业者会立刻对标自己的用量。不过它本质还是定价更新,不是新模型发布,所以分数没往上拉。

4月26日星期日

Hacker News 首页

DeepSeek-V4 发布当天,SGLang 和 Miles 就接好了推理和 RL 训练

SGLang 和 Miles 团队在 DeepSeek-V4 发布当天就完成了推理和强化学习训练的适配,覆盖了 1.6T 参数的 Pro 版和 284B 参数的 Flash 版。V4 模型用了混合稀疏注意力,把滑动窗口和两种 KV 压缩(4:1 或 128:1)混在一起,撑住了 100 万 token 的上下文窗口,专家权重还用了 FP4 精度。系统上...

推荐理由:我会先打个折:这篇不是给所有人看的,系统细节多,普通读者容易走神。但它的钩子够硬——V4 发布当天就有推理加验证 RL 的工程栈,而且把上下文长度、压缩比、注意力窗口这些直接影响成本和稳定性的数字都摊开了。ShadowRadix 那部分虽然正文没展开实现细节,但点出了多池一致性这个真正难啃的骨头,对做部署和调优的人比单纯跑分更有参考价值。

4月25日星期六

Latent Space

DeepSeek 发布 V4 Pro 和 Flash 模型,能在华为昇腾芯片上跑

DeepSeek 终于发了 V4 系列,一共两个型号:V4 Pro 总参数 1.6 万亿,每次激活 490 亿;V4 Flash 总参数 2840 亿,激活 130 亿。两个模型都支持 100 万 token 的上下文,用了新的压缩注意力技术,相比 V3.2,处理长文本时计算量只要 27%,显存占用只要 10%。这次比较特别的是同时发了基础版和指令版,...

推荐理由:这条必须写。DeepSeek 这次放出的不只是模型,而是把华为昇腾兼容性摆上台面,等于在 CUDA 依赖上划了一刀。技术报告说 1M token 下只用 V3.2 27% 的算力、10% 的 KV 缓存,省得挺实在。两档参数和 MIT 许可也让落地门槛更低。我会先打个折:正文没提实际推理延迟和昇腾上的吞吐数据,这点先别太激动,但硬件独立性本身已经够重。

MIT Technology Review · AI

DeepSeek V4 发布预览版:两个型号、百万 token 上下文,开源模型里跑分最强

DeepSeek 放出了 V4 的预览版,分 V4-Pro 和 V4-Flash 两个型号。Pro 版输入每百万 token 1.74 美元、输出 3.48 美元,Flash 版只要 0.14 和 0.28 美元,两个都支持一次性处理 100 万 token 的上下文,相当于能把《魔戒》三部曲加《霍比特人》全塞进去。跑分上,V4-Pro 在编程、数学、...

推荐理由:我会先打个折:这只是预览版,不是完整发布,所以冲击力比 GPT 或 Claude 大版本换代要弱一档。但它是当天消息,而且信息量够——两个型号的定价、100 万 token 上下文、开源权重对代理编码栈的成本压力,这些对从业者来说都是能直接算账的东西。标题里说的三个理由,正文其实主要落在长上下文注意力的效率提升和开源带来的成本下压上,具体技术细节没展开,但方向是明确的。

彭博科技

DeepSeek 发新模型了,但正文被 Bloomberg 的反爬墙挡住了,具体叫啥、多大、跑分多少全没看到

Bloomberg 这条视频标题说 DeepSeek 在去年震动硅谷的开源发布一周年之际,又推了一款新旗舰模型。但点进去页面直接弹 403 机器人验证,正文一个字都没加载出来。所以模型名字、参数量、定价、基准测试成绩、开源还是闭源,这些关键信息目前全是空白。唯一能确定的是发布时间点卡在周年附近,至于模型本身强不强、省不省钱,得等官方自己放料或者别人扒出...

推荐理由:这条消息的钩子在于“一周年”这个时间点,去年 DeepSeek 把硅谷震了一下,现在再发新模型,大家自然会盯着看。但我会先打个折:正文啥硬信息都没给,模型叫啥、多大、多贵、跑分多少、开不开源全是空白,所以知识缺口很大,不能当实锤来推。关联性上,DeepSeek 的定价和开源策略一直是行业敏感点,新旗舰出来肯定会重新拉高中美对比的热度,这点值得标记。整体判断就挂在时间钩子和信息缺口上,不补设定。

4月24日星期五

TechCrunch · AI

DeepSeek 放出 V4 预览版,自称推理能力快追上头部模型

DeepSeek 在 Hugging Face 上发了两个 V4 预览模型,说架构改动让它们比 V3.2 更省资源、跑分更高,在推理基准上“几乎追平”当前领先的开源和闭源模型。但正文没给出具体模型名、参数量、跑分数字和测试集,也没提什么时候正式发布。所以“追平”这个说法先别太激动——没有可复现的评测数据,没法验证。

推荐理由:这条消息的传播价值在于 DeepSeek 放话“缩小差距”,但正文没给任何可核对的数字,所以我会先打个折。H 和 R 靠竞争信号就能过,K 弱是因为关键信息全缺,没法验证它到底多强。真正该盯的是后续有没有可复现的实测,现在这点先别太激动。

The Verge · AI

DeepSeek 放出 V4 模型预览,说能跟 Google、OpenAI、Anthropic 的闭源模型正面打

DeepSeek 在 4 月 24 号发布了开源 V4 模型的预览版,声称性能可以对标美国几家头部公司的闭源系统。这次重点提了编程能力提升,并且强调跟华为的硬件兼容——这基本就是在说,模型能跑在中国自己的芯片上。不过正文没披露参数量、具体跑分和正式发布时间。我会先打个折:编程强了多少、在什么任务上强,都没给数据,这点先别太激动。

推荐理由:DeepSeek 这次放出的 V4 预览版,我会先打个折——参数、基准分数、商用时间全都没披露,所以别急着激动。但信息量还是够的:代码能力提升直接指向让模型进业务流程干活的 agent 场景,而华为兼容性把模型进展和国产芯片栈绑得更紧,这两点比单纯刷榜更有看头。正文没给具体数字,所以重要性停在 83,等有实测数据再往上调。

r/LocalLLaMA

DeepSeek V4 发布:1.6T 参数的 Pro 版和 284B 的 Flash 版,MIT 开源,支持 100 万 token 上下文

DeepSeek 放出了两个 V4 模型,都走 MIT 开源协议,上下文窗口拉到 100 万 token。Pro 版总参数 1.6T,每次推理只激活 49B;Flash 版总参数 284B,激活 13B。激活参数占比很低,意味着如果跑分靠谱,自己部署长上下文模型的硬件门槛和成本会降一截。不过原帖没给具体跑分、定价、训练数据量,也没提实际推理吞吐,这些都...

推荐理由:这是 DeepSeek 旗舰级开源发布,两个 MIT 权重加 1M 上下文,当天覆盖没问题。分数停在 86,因为正文没披露基准分数、吞吐、训练数据规模或定价,这些缺口让实际效果还得等实测。我会先打个折,别看到 1.6T 就上头。

彭博科技

DeepSeek 发布新一代旗舰模型预览版,距上次出圈正好一年

DeepSeek 放出了新旗舰模型的预览版本,官方说法是“迄今最强的开源平台”。目前只确认了开源定位和预览状态,正文没披露参数量、上下文长度、跑分成绩和正式发布时间。我会先打个折——能看到的硬信息还太少,先别太激动。

推荐理由:DeepSeek 在去年炸场之后又推新旗舰预览,开源这张牌继续打,话题度够高,所以给到 featured。但文章实质信息很少——没参数、没上下文窗口、没基准成绩、没时间表,只能确认“预览版”和“开源”两点,知识增量弱,重要性就压在 75 这个低位。我会先打个折:标题唬人,内容还撑不起更高的分数。