跳到正文

#DeepSeek

今日 0 条

4月24日星期五

Hugging Face 博客

DeepSeek-V4 发布:百万 token 上下文,这次是给干活用的 agent 准备的

DeepSeek 发了 V4,分 Pro 和 Flash 两个版本,都支持 100 万 token 的上下文窗口。Pro 版总参数 1.6 万亿,每次推理激活 490 亿;Flash 版总参数 2840 亿,激活 130 亿。跑分不是最顶尖的,但这不是重点。真正的改进在推理成本上:跟 V3.2 比,Pro 版处理单个 token 的算力只要 27%,K...

推荐理由:DeepSeek-V4 是国产旗舰模型更新,Pro 版 1.6T 总参、49B 激活,Flash 版 284B 总参、13B 激活,都支持 100 万 token 上下文。最值得看的是成本:Pro 单 token 计算量只有 V3.2 的 27%,KV 缓存降到 10%;Flash 更狠,分别只有 10% 和 7%。这意味着跑长上下文 agent 时显存和算力开销大幅缩水,不是光喊口号。HKR 三项全中,放在当天必读档没问题。

4月23日星期四

FT · 科技

DeepSeek 首次寻求融资,估值冲到 200 亿美元,主要为了留住被挖角的研究员

DeepSeek 正在启动第一轮外部融资,目标估值约 200 亿美元。核心目的不是缺钱扩张,而是用更高的股权激励来对抗竞争对手对核心研究员的挖角。FT 的报道提到此前已有人员流失,但正文没披露具体融资金额、投资方名单和流失人数。这个估值放在还没拿过外部钱的 AI 公司里算很高,但信号很直白:人才争夺战里,光靠技术理想留不住人,得靠真金白银的股权。

推荐理由:我会先打个折:正文没披露融资规模、投资方和具体离职人数,所以估值数字本身先别太激动。真正值得盯的是人才防守这个角度——DeepSeek 把首次融资直接和阻止研究员跳槽挂钩,说明内部人才流失压力已经大到需要靠估值来筑墙。这点对从业者比估值更有信号意义,因为前沿模型竞争拼的就是那几十个核心研究员。

4月22日星期三

彭博科技

腾讯和阿里正在谈参投 DeepSeek 的第一轮融资

这是 DeepSeek 成立以来第一次对外融资,目前还在谈判阶段。正文没披露具体金额、估值和领投方,也没说钱会怎么用。腾讯和阿里这两家互联网大厂同时出现,我会先打个折——关键不是他们投不投钱,而是会不会附带算力或渠道上的合作条件,但这篇报道没提。

推荐理由:Bloomberg 给了一个实打实的信息点:DeepSeek 在推进首轮融资,腾讯和阿里都在谈。我会先打个折,因为金额、估值、领投方全都没说,正文也没给条款细节,所以重要性到不了顶。但 HKR 三项都成立——首轮融资本身就够新,两家巨头同时出现让故事性拉满,而且一旦成真,股权和云算力合作会同步放大,这对国内模型格局的影响比一轮融资大得多。

4月8日星期三

量子位 · 公众号

DeepSeek 深夜更新网页版,新增快速和专家模式,灰度测试视觉模型

DeepSeek 网页版悄悄加了两个模式:快速模式主打日常对话,专家模式则专攻代码、网页搜索和更难的生成任务。有用户通过对话套话,模型自己说专家模式就是 V4,但官方没发公告,正文也没披露模型 ID、上下文规格、定价和发布时间,这点先别太激动。目前专家模式限量供应,不支持多模态和文件上传,有用户测出上下文上限大约 13.3 万 token。另外,视觉模...

推荐理由:我会先打个折:V4 这个说法目前只有网友实测和模型自述,官方没确认模型名、价格和上下文窗口,这点先别太激动。但文章把能复现的行为讲清楚了——专家模式偏代码和复杂生成、限量、不能传文件,还给了约 133K token 的长度上限,对实际用的人有参考价值。真正该盯的是官方后续会不会补参数和上下文说明,现在信息缺口不小。

4月4日星期六

X · @dotey(宝玉)

DeepSeek V4 推迟发布,重写底层代码,就为了跑在华为昇腾 950PR 上

V4 跳票了几个月,原因是 DeepSeek 把模型底层模块重写了一遍,专门适配华为和寒武纪的硬件。现在 V4 能直接跑在华为昇腾 950PR 芯片上,预计几周内发布。这颗芯片单卡算力号称是英伟达 H20 的 2.87 倍,有 112GB 显存,带宽 1.4TB/s,还是国内唯一支持 FP4 低精度推理的芯片。FP4 的好处是大幅压缩显存占用,一个原本...

推荐理由:这条消息 H、K、R 都站得住:华为芯片部署是强钩子,底层重写和芯片规格有料,国产算力替代的话题自带传播。没给更高分是因为这还属于发布前报道,模型规模、价格和实测性能都没披露,我会先打个折。

4月3日星期五

X · @dotey(宝玉)

晚点发了一篇 DeepSeek 深度报道,讲 V4 发布前的人员变动、路线选择和梁文锋的管理逻辑

晚点 LatePost 这篇报道卡在 V4 发布前夕,信息量不小。先说人员:DeepSeek 确认走了四位核心成员,包括 R1 核心作者郭达雅(近期离职,可能去大厂)、第一代 LLM 作者王炳宣(去年底被腾讯挖走),以及 OCR 和多模态方向的两位。猎头开价翻 2 到 3 倍,有的公司直接给 8 位数总包,而 DeepSeek 的期权没标价,让一些人心...

推荐理由:这不是 V4 发布,但信息量够硬:4 人离职确认、发布推迟到 4 月、100 多人的研究团队规模、猎头报价翻倍,还有算子库迁移到 TileLang 的路线变化。HKR 三项都站得住。正文没给 V4 的参数、价格和基准成绩,所以到不了发布级或 p1,但作为 V4 前的信号已经够看了。

2月15日星期日

Computing Life · 鸭哥

OpenClaw 为什么突然火了:把程序员才有的本地 AI 代理,塞进了你的聊天软件

OpenClaw 在 2026 年 1 月底爆火,不是因为它技术有多新,而是它把 Cursor 这类能读写文件、执行命令的本地编程代理,接入了 Slack、WhatsApp 和飞书,让非技术人员第一次用上了有记忆、能干活、会自我进化的 AI。文章拆解了它背后的三个关键设计:统一的上下文池让 AI 跨平台记住你的一切;基于文件的持久化记忆加上自动维护机制...

推荐理由:这篇不是新闻通稿,是个人拆解。它把 OpenClaw 为什么火、代价是什么、真正该抄的设计模式(统一入口、文件化记忆、可组合 skills)都讲清楚了。HKR 三项全中,两个硬数字撑住了判断,但因为属于个人分析而非官方发布或行业事件,所以放在 featured 这一档。

Computing Life · 鸭哥

OpenClaw 为什么爆火:把程序员才有的 AI 代理体验,塞进了你的聊天软件

OpenClaw 在 2026 年 1 月底突然爆火,一周内换了三次名字,中间还被一个叫 $CLAWD 的假币骗走了 1600 万美元。它火的原因和一年前的 DeepSeek 几乎一样:不是技术上碾压对手,而是把一小撮早期用户已经用惯的体验——让 AI 能读文件、跑命令、记住上下文、持续迭代干活——第一次通过 WhatsApp、Slack、飞书这些日常...

推荐理由:我会先打个折:正文截断了,没看到后续成功因素的具体细节,所以这不是一手发布或官方研究,更像一篇二手深挖。但它的价值在于把OpenClaw为什么火说清楚了——不是技术多牛,而是分发路径对路。它把Agent接进WhatsApp、Slack、Lark,让不写代码的人第一次用上能读写文件、执行命令、带记忆的本地代理。同时也没回避风险,12%恶意技能和公网裸奔控制台这两条,比一般公关稿实在。综合来看,78分、featured层级是合理的。

2月12日星期四

MIT Technology Review · AI

中国开源 AI 下一步怎么走:从追赶变成铺管道

MIT Technology Review 这篇展望认为,DeepSeek 在 2025 年初放出 R1 之后,中国公司已经能反复拿出性能接近西方顶级系统、但价格便宜很多的模型。文章举了月之暗面 Kimi K2.5 的例子,说它在早期跑分上接近 Anthropic 的 Claude Opus,价格大约是后者的七分之一。在 Hugging Face 上,...

推荐理由:这篇不是产品发布,但给出了实在的市场信号——约七分之一的价格、Hugging Face 下载份额,以及一个清晰的判断:中国开源正从少数通用模型转向大量可蒸馏、可微调的专用变体。信息量够,对从业者有参考价值,放 featured 没问题。

1月30日星期五

彭博科技

美议员指控英伟达曾与 DeepSeek“共同设计”模型,正文因付费墙未披露具体证据

这条消息来自彭博社,但正文被付费墙挡住了,只拿到一段 RSS 摘要。众议院中国问题委员会主席、共和党人声称,英伟达给 DeepSeek 提供了技术支持,帮他们搞出了一个突破性模型,即便美国对中国有高端芯片出口管制。指控的核心不是英伟达卖没卖卡,而是这种技术合作是不是绕开了管制的本意。不过摘要里没提是哪个模型、具体给了什么支持、发生在什么时间点,也没列出...

推荐理由:Bloomberg 的信源权威性让这条消息值得放出来。H 和 R 都成立:指控本身出人意料,又直指出口管制合规这个行业痛点。K 没给是因为正文确实没拿出任何具体信息,所以只做低量推荐,不硬写。