跳到正文

DeepSeek

DeepSeek(深度求索)的模型发布、开源权重与技术报告——开源大模型价格与性能双卷的风向标。

194 条精选相关主题千问 Qwen开源生态模型发布

最新精选

第 21–40 条 · 共 194 条

9月10日星期四

AI HOT 精选

DeepSeek 出了个 V4.1-Flash,用新架构把视觉理解直接做进模型里,KV 缓存砍到原来的 1/4

V4.1-Flash 是 DeepSeek 新架构里最小的一个模型,总参数 552B,但干活时输入只激活 8B、输出激活 16B,属于 MoE 的省电模式。它换了一套叫 Causal Encoder-Decoder 的架构,视觉理解不再外挂,而是原生支持。最实在的变化是 KV 缓存:跟上一代比,HBM 占用降到 1/4,SSD 存储降到 1/8,意味着...

推荐理由:我会先打个折:正文没给具体 benchmark 和推理延迟数据,所以性能到底怎么样还得等实测。但架构切换这件事本身就够硬——Causal Encoder-Decoder 加原生视觉,KV 缓存直接砍到原来的零头,对实际部署的人比单纯跑分更有吸引力。加上 DeepSeek 的发布自带流量,选它上头条没毛病。

AI HOT 精选

DeepSeek 放出 V4.1-Flash:一口气能读百万 token,靠压缩缓存和复用注意力省资源

DeepSeek 发了个新模型 V4.1-Flash,主打长文本处理。它支持一次性读入 100 万 token 的上下文,相当于能直接啃完《三体》三部曲。为了不让显存爆炸,它用了 FP4 精度存 KV 缓存,把临时记忆压得很小;同时让不同层之间复用注意力计算结果,省掉不少重复运算。不过正文没披露参数量、跑分成绩、开源协议和 API 定价,所以实际效果和...

推荐理由:DeepSeek 扔了个 V4.1-Flash,一口气能读 100 万 token,相当于整本《三体》塞进去。为了省显存,KV 缓存用 FP4 精度压得很小,还让不同层之间复用注意力结果,省掉重复计算。这几个工程点组合在一起确实有点意思,但正文没披露参数量、跑分、开源协议和定价,实际效果和性价比都得打个问号,所以先放在 featured 级别观望。

r/LocalLLaMA

DeepSeek 发了个 V4.1 Flash:跑分超自家 Pro,API 降价,模型还开源了

DeepSeek 今天放出了 V4.1 Flash,一个总参数 552B 的 MoE 模型,但实际干活时输入只激活 8B、输出激活 16B 参数,所以推理成本压得很低。它用了新的非对称编码器-解码器架构,跑分直接超过了自家的 V4 Pro。KV 缓存也大幅瘦身,相比上代 HBM 需求降到 1/4、SSD 需求降到 1/8,这对经常要缓存命中的 agen...

推荐理由:DeepSeek 旗舰模型发布,架构有变化,跑分和成本数字都给了硬信息,按惯例对标美国大厂发布处理。HKR 三项全中:超 V4 Pro 的跑分和缓存瘦身都是硬货。没给 P1 是因为目前只有标题和摘要,正文细节还没看到。

Hacker News 首页

DeepSeek 在 HuggingFace 上发布了 V4.1 Flash 模型

DeepSeek 放出了一个叫 V4.1 Flash 的新模型,代码和权重挂在 HuggingFace 上。正文没披露参数量、跑分成绩和具体架构,所以现在还不知道它到底多大、多强。从命名习惯看,带“Flash”通常意味着这是个更快、更轻量的版本,可能适合需要低延迟或者本地跑的场景。Hacker News 上讨论热度很高,853 分、481 条评论,但大...

推荐理由:DeepSeek 发新模型本身就是当天必须追的事,HN 热度也印证了这点。但正文信息缺口太大,没有参数、没有 benchmark、没有架构说明,所以 K 轴打不上去。Flash 这个命名暗示它是轻量低延迟版本,跟推理部署场景直接相关,R 轴能站住。整体分数被信息不足拖住了,等官方补数据再重新评估。

AI HOT 精选

DeepSeek 发布 V4.1-Flash,新架构小模型,API 降价并直接替代 V4 Pro

DeepSeek 今天上线了 V4.1-Flash,这是他们全新模型架构里最小的一个,自带看图能力。新架构的设计目标是拉高能力天花板、跑得更快、吞吐量更大,后续会放大到更大参数的模型上。跑分方面,GPQA Diamond 90.9,Codeforces 3471,HLE 36.8,在编程和 Agent 任务上看着挺能打。API 这边,模型名改成 dee...

推荐理由:DeepSeek 发了新架构里最小的模型 V4.1-Flash,自带视觉能力,跑分不错,价格还降了。这是新架构的第一次亮相,后续会放大到更大模型上,所以值得关注。没给更高分是因为正文没展开讲新架构具体改了啥,而且这只是最小号的版本,能力天花板还得看后续的大模型。

9月9日星期三

AI HOT 精选

DeepSeek 找了中信证券准备在科创板上市,计划年内交表

路透社消息,DeepSeek 已经聘请中信证券筹备科创板 IPO,目标是今年递交申请、明年挂牌。募资额和估值还没定,钱主要想用在三块:扩建算力、加大模型和自研芯片投入、留住核心人才。公司 2026 年前七个月营收约 4.75 亿元,是 2025 年全年的 10 倍,增速很快。同时,DeepSeek 还在做新一轮融资,目标估值约 5000 亿元。今年 6...

推荐理由:消息本身分量够重,营收数字和自研芯片计划让故事有实感。没给更高分是因为募资额和估值都还没定,正文也缺具体时间表,现在只是筹备阶段,变数还大。

AI 群聊日报

OpenAI 用一万个 Agent 解出千禧年数学难题,但 Codex 数据隐私争议抢了头条

OpenAI 宣布用约一万个并发 agent 在 88 小时内解出了 Navier-Stokes 千禧年难题,消耗 1300 亿输出 token。但 NYU 数学家 Buckmaster 公开指控 OpenAI 可能通过 Codex 接触了他与合作者 Alpöge 未发表的草稿,双方技术路线高度重合。OpenAI 没直接否认,只说“不能排除去标识化数据...

推荐理由:千禧年难题被宣称解决本身就是行业地震,但 Buckmaster 的抄袭指控和 OpenAI 那句“不能排除”让整件事从技术展示变成了信任危机。我会先打个折:正文没披露 agent 之间怎么分工、验证是否独立复现,这些缺口让“解出”的含金量还不好判断。但不管真假,这件事已经同时踩中了 agent 工程上限、数据合规和科研伦理三条线,从业者绕不开。

FT · 科技

DeepSeek 融资太抢手,催生了一个收高额中介费的影子市场

DeepSeek 正在融新一轮资,想投进去很难。FT 报道说,一些基金和家族办公室正通过中间人买份额,条件是 2% 的管理费加 20% 的业绩提成,比行业标准贵一大截。有个投资人为了拿到 500 万到 1000 万美元的额度,还得承诺未来给中间人更多好处。DeepSeek 说没授权任何人卖老股,但报道没披露这轮融资的总规模和估值。这些场外报价水分可能不...

推荐理由:FT 独家挖出了 DeepSeek 融资的场外灰色市场,有具体的费率数字和投资人案例,信号很强。但报道没披露这轮融资的总规模和估值,DeepSeek 也只是否认了授权卖老股,没给更多细节,所以分数没再往上调。H、K、R 三项都打中了,信息缺口主要在交易本身的完整轮廓上。

9月4日星期五

r/LocalLLaMA

Qwen3.8-27b 被用户称为首个能“闭眼信任”的本地模型

Reddit 上有用户说,Qwen3.8-27b 在连续 8 个多小时的 agent 任务里一次都没出错,是他用过的第一个能像顶尖闭源模型那样放心把活丢给它的本地模型。另一位用户也证实,自己跑过 20 小时的会话,让模型用子代理和提交检查点干活,INT8 量化版甚至解决了一个 DeepSeek V4 Flash 没搞定的代码问题。帖子没说明具体任务类型...

推荐理由:两个独立用户都说Qwen3.8-27b在几小时到二十小时的agent任务里表现稳定,其中一个还直接跟DeepSeek V4 Flash做了对比,量化版反而解决了问题。我会先打个折:帖子没说明具体任务类型、失败标准,也没给出可复现的测试方法,这本质上是社区口碑,不是严谨评测。但考虑到本地模型长时间跑agent不出错这件事本身就稀缺,这条信息对从业者选型有参考价值,所以给72分,放在featured位置。

9月3日星期四

Hacker News 首页

陈大年带着 27B 本地模型杀回来了,在信通院 MCP 评测里只比 DeepSeek-V4-Pro 低 1.3 分

陈大年复出创办了 StartLux,第一款模型 StartLux-V1.0-27B-Preview 只有 270 亿参数,能直接在消费级电脑上跑,不用联网。在信通院 MCP 专项评测里,它综合得分 39.25%,排第二,比 1.6 万亿参数的 DeepSeek-V4-Pro 只差 1.3 个百分点,还在位置导航、金融分析和浏览器自动化三个单项拿了第一。...

推荐理由:陈大年带着 StartLux 重回牌桌,第一个模型就在信通院 MCP 评测里拿了第二,27B 参数跑在消费级硬件上,三个单项第一,跟 DeepSeek 的 1.6T 旗舰只差 1.3 分——这个性价比信号对 agent 方向的人很有参考价值。不过目前只有 benchmark 成绩,模型没公开,实际可用性还看不清,所以分数先打 82,等有更多落地信息再往上调。

9月2日星期三

AI 群聊日报

DeepSeek V4 Flash 实战体感碾压 Sol,Anthropic 发布 Fable 5.1 但被指挤牙膏

群友用 DSH 加 DeepSeek V4 Flash 跑了两个月对比和一周 51 亿 token 的活,结论是实际干活比 GPT-5.6 Sol 舒服。Sol 想太多、输出假大空,V4 Flash 首 token 平均 2.3 秒,总花费才 ¥362.84。有人提出“订阅制健身房悖论”,认为卖月费的 harness 会悄悄限制使用强度,按量付费的才不...

推荐理由:群聊实测数据够扎实——51 亿 token 跑下来才花三百多块,首 token 2.3 秒,成功率接近百分百,对比 Sol 的啰嗦和假大空,结论很明确。但来源是匿名群聊记录,不是官方发布或可复现的基准测试,权威性要打个折。H、K、R 全中,放 featured 没问题。

8月31日星期一

AI HOT 精选

DeepSeek 开源首个视觉模型 V4-Flash-Vision-Exp,多模态 Agent 能力接近 Opus-4.8

DeepSeek 在 Hugging Face 上放出了 V4 系列第一个能看图的模型,用 MIT 协议开源。它支持 JPEG、PNG、GIF、WebP 图片输入,能做图片描述、截图识字、读图表这些事。仓库里给了模型文件、分词器和一个极简的 PyTorch 推理代码,覆盖了视觉编码器、MoE(混合专家)、DFlash 注意力等核心模块。官方说这是个实验...

推荐理由:DeepSeek 放出了 V4 系列第一个多模态实验模型,MIT 协议,能看图、识字、读图表。官方说 Agent 能力接近 Opus-4.8,但正文没给出具体 benchmark 数字和对比细节,所以分数先打个折。即使这样,一个中国大模型直接对标 Claude 旗舰款,还给了可跑的推理代码,重要性依然很高。

8月27日星期四

AI 群聊日报

GLM-5.3-Flash 和 Qwen 3.8-Flash-Next 同日发布,都砍掉了全局注意力

今天两个新 Flash 模型撞车发布。GLM-5.3-Flash 在六项基准上追平 Claude Opus 4.8,每任务成本折后 0.045 美元,但实测速度慢、幻觉多。Qwen 3.8-Flash-Next 开源权重,在 DGX Spark 上单流解码跑到 64.7 tok/s,全面超过 DeepSeek V4 Flash。两者都用了 MoE 加稀...

推荐理由:两条 Flash 模型撞车发布,信息密度高。GLM-5.3-Flash 基准分好看但实测翻车,Qwen 3.8-Flash-Next 开源权重且推理速度有实测数据压过 DeepSeek V4 Flash。有具体数字、有社区真实反馈、有架构对比,对从业者选型参考价值大,但正文没展开幻觉具体表现和更多实测细节,所以重要性给 78 分。

8月26日星期三

Hacker News 首页

Z.ai 认领匿名模型 Ox Alpha,确认是 GLM 系列新作并将开源权重

之前以匿名身份在评测榜上冒出来的 Ox Alpha,现在被 Z.ai 认领了。公司确认它属于 GLM 系列,并计划把模型权重放出来给大家用。跑分成绩和 DeepSeek 很接近,但参数量、训练数据、具体开源时间这些关键信息都没说。我会先打个折——没看到技术细节和许可证之前,这更像一次预热,离真正能用还有距离。

推荐理由:Z.ai 认领了之前匿名刷榜的 Ox Alpha,确认是 GLM 系列并承诺开放权重,Bloomberg 独家报道增加了可信度。但参数量、训练数据、具体发布时间都没说,目前更像一次预热,离真正能用还有距离。

8月25日星期二

Computing Life · Share · 鸭哥调研

近处保真、远处有损:三种长上下文方法背后的同一个直觉

YaRN、DeepSeek V4 和 DeepSeek-OCR 这三套方案来自不同团队,分别在位置编码、注意力通路和输入表示三个层面解决了长上下文的瓶颈,但底层逻辑完全一致:把最高精度留给近处或焦点,对远处信息做有损压缩。YaRN 对 RoPE 做分频处理,高频不动、低频压缩,让 Llama 2 7B 用约 384 个 A100 GPU 小时就扩展到 ...

推荐理由:文章把三个不同层面的长上下文方案统一到一个直觉下——近处保真、远处有损,而且给了训练成本和显存占用的硬数字,对做推理优化的工程师来说很实用。不是一手研究发布,正文在论证中途截断,信息完整度打了折扣,所以分数没给更高。

8月19日星期三

Hacker News 首页

粘贴一个 HuggingFace 模型 ID,就能看到它的交互式结构图,不用下载权重

modelmap.cc 这个工具把任何 HuggingFace 模型变成一张可交互的架构图。它先在 meta 设备上实例化模型拿到结构,再跑一次假的 traced 前向传播来推断张量形状,全程不下载实际权重。首页展示了 Qwen3.8-27B、DeepSeek-V4-Pro-0813、Kimi-K3 等热门模型,也放了 GPT-2、BERT、DeepS...

推荐理由:一个实用的 Show HN 工具,不下载权重就能画出模型架构图,首页还挂了 DeepSeek-V4-Pro 和 Kimi-K3。H 和 K 都踩中了,但 R 缺了点传播性——更像工具书签而不是话题引子。分数 72,刚好卡在 featured 线上。

8月18日星期二

彭博科技

DeepSeek、Qwen 和 Moonshot 让美国同行紧张,不是因为技术领先,而是便宜太多

Bloomberg 这篇趋势分析认为,中国 AI 公司真正的杀伤力不是模型能力反超,而是成本。DeepSeek、阿里 Qwen 和 Moonshot 用更高效的训练方法和硬件利用率,做到了性能差不多、价格却只要对手一个零头,逼得美国公司开始重新算经济账。文章没给出具体定价对比和最新跑分,所以“便宜多少”这点先别太激动,把它当行业风向看就好。

推荐理由:Bloomberg 这篇趋势分析把中国 AI 的威胁从“能不能追上”换成了“能不能用得起”,角度挺刁。DeepSeek、Qwen 和 Moonshot 用更高效的训练和硬件利用率,把成本压到对手一个零头,逼得美国公司开始重新算账。但文章没给具体数字,所以“便宜多少”先打个折,当行业风向看就好。

8月17日星期一

AI HOT 精选

宇树科技 8 月 19 日科创板上市,A 股迎来第一只人形机器人股票

宇树科技确定发行价 150.80 元/股,对应市值约 610 亿元,市盈率 219 倍,是行业平均的 5 倍多,估值不便宜。这次上市募资约 61 亿,近一半(20.22 亿)砸在机器人模型研发上。公司 2025 年营收 16.99 亿,净利润 2.78 亿,是全球少数能靠通用机器人赚钱的公司。不过今年一季度虽然收入同比涨了 68% 到 4.23 亿,但...

推荐理由:宇树科创板上市是个节点性事件,全球能靠通用人形机器人赚钱的公司没几家,它算一个。219倍市盈率比行业平均高出5倍多,说明市场给的情绪溢价很高,但正文没披露一季度利润变化和全年盈利指引,估值到底撑不撑得住还得看后续交付和成本控制。我会先打个折,保持82分,因为目前只有发行信息,缺上市后的实际表现验证。

纽约时报中文网

中国正用“符合主流价值观”的数据集,争夺全球AI训练语料的话语权

中国国家数据局发了份蓝图,要在2028年底前在20多个领域做出“高质量”数据集,并打算开放给全球用。上海人工智能实验室已经在GitHub和Hugging Face上发布了“万卷”这类多语种数据集,覆盖历史、法律、医学,但要求内容对齐“中国主流价值观”。分析人士说这有两个目的:一是把发展中国家拉进中国的AI生态,二是补上中文训练数据的缺口——国内数据散落...

推荐理由:这篇NYT的深度稿把中国国家数据局的AI数据蓝图讲得很清楚,有具体项目、有时间表,不是通稿。它踩中了话语权、数据开放和价值观对齐这几个敏感点,对从业者判断合规风险和数据生态走向有直接参考价值。不过它偏政策和生态叙事,不是产品发布或技术突破,所以分数卡在78分这个区间。

FT · 科技

FT 评论:中国开源 AI 会像当年制造业一样,把大模型做成白菜价

这篇《金融时报》评论文章认为,中国正在用开源大模型复制当年制造业冲击全球的剧本——把技术变成超低价的商品,削弱西方公司的定价权。文章点名了 DeepSeek 和阿里通义千问(Qwen)系列,说它们的开源策略能快速拉拢开发者、建起生态,而美国公司还在闭源、烧钱堆算力。不过正文没给出具体的市场份额或企业采用数据,所以这更像一个方向性的判断,先别急着把它当成...

推荐理由:FT 这篇评论把中国开源模型(点名 DeepSeek 和 Qwen)说成是制造业冲击的 AI 版本——靠开源把技术打成白菜价,让西方公司没法靠闭源和堆算力维持高定价。角度抓得挺巧,但全文没给具体数字,更像一个提前发出的警告。我会先打个折,把它当方向判断看,别急着当成已经发生的事实。