跳到正文

#DeepSeek

今日 0 条

7月31日星期五

Product Hunt · AI

DeepSeek 发布 V4-Flash-0731,主打用 Flash 级价格跑智能体任务

DeepSeek 在 Product Hunt 上线了 V4-Flash 的正式版,代号 0731。官方说它的智能体能力比 V4-Pro 预览版还强,原生支持 Responses API,也适配了 Codex CLI 命令行工具。不过正文没给出具体的跑分数据和 API 定价,只提了一句“用 Flash 的价格拿到前沿智能体能力”。我会先打个折,等第三方...

推荐理由:DeepSeek V4-Flash 正式版声称智能体能力超过 V4-Pro 预览版,并原生支持 Responses API 和 Codex CLI。作为国内头部实验室的产品更新值得关注,但正文没给任何跑分和定价,信息缺口明显,所以分数压在 80 以下。

AI HOT 精选

DeepSeek V4 Flash 0731 发布,智能指数涨了 10 分,还压到了成本前沿线上

Artificial Analysis 的智能指数给这个新模型打了 50 分,比 4 月版高出 10 分,也比自家的 V4 Pro 多了 6 分。它同时踩到了智能和成本的帕累托前沿,意思是同等聪明的模型里它更省钱,同等价位的模型里它更聪明。不过原文没给具体定价和延迟数据,这点先别太激动,等实测跑分出来再看。

推荐理由:10分的智能指数跳升和反超V4 Pro的对比很有冲击力,帕累托前沿的说法也给了明确的性价比预期,值得推。扣分是因为原文没放定价和延迟数据,实际省钱程度没法验证,所以先不拉满。

AI HOT 精选

DeepSeek-V4-Flash API 公测,官方称 Agent 跑分远超 V4-Pro-Preview

DeepSeek 放出了 V4-Flash 的 API 公测,主打 Agent 能力升级。官方贴了一张性能对比图,说基准测试分数已经大幅超过 V4-Pro-Preview,但具体分数、成本和延迟都没给。这次原生支持了 Responses API 格式,也完全适配了 Codex,意味着你可以直接把它接进 Claude Code 这类编程工具里干活。我会先...

推荐理由:DeepSeek V4-Flash 开放公测,官方说 Agent 能力大幅提升,还贴了张对比图显示基准测试分数超过 V4-Pro-Preview。但具体分数、成本和延迟都没给,只放了一张图。我会先打个折:没数字的对比图看看就好,别太激动。不过原生支持 Responses API 和 Codex 是实打实的,接进 Claude Code 就能用,这点挺省钱。综合来看,发布动作本身和 Agent 定位足够让开发者关注,所以给到 featured 级别。

AI HOT 精选

国家发改委:上半年 AI 行业增速超 30%,全国智能算力同比翻 2.8 倍

国家发改委在 7 月 31 日的发布会上给了几个数:上半年 AI 相关行业增速保持在 30% 以上;到 6 月底,全国智能算力规模是去年同期的 2.8 倍,第一个全国产 10 万卡 AI 集群已经投用。模型这边,DeepSeek 和月之暗面发了万亿参数的开源大模型,国产大模型全球总下载量超过 100 亿次。数据层面,建成高质量数据集超过 12 万个。另...

推荐理由:国家发改委发布会给了上半年 AI 行业几个硬数:相关行业增速 30% 以上,全国智能算力规模是去年同期的 2.8 倍,第一个全国产 10 万卡 AI 集群已经投用。模型侧提到 DeepSeek 和月之暗面发了万亿参数开源大模型,国产大模型全球总下载量超 100 亿次,高质量数据集建成超 12 万个。信息来自官方渠道,数字具体、可引用,对从业者判断算力基建节奏和国产模型生态规模有直接帮助,三条 HKR 都踩实了。

Hacker News 首页

DeepSeek V4 Flash 公测:Agent 跑分大幅超过 V4 Pro 预览版

DeepSeek 把 V4 Flash 模型开放公测了,API 调用方式不变,模型名改成 deepseek-v4-flash 就行。这次只更新了 Flash,V4 Pro 和 App/Web 端都没动。Flash 的模型结构和尺寸跟之前的预览版一样,只是重新做了一遍后训练。最大的变化是 Agent 能力,官方给的跑分比 V4 Pro 预览版高出一大截:...

推荐理由:DeepSeek V4 Flash 开放公测,Agent 跑分压过自家 V4 Pro 预览版,这在国产大模型里算一个值得标记的能力更新。只动后训练不动结构,技术信号很明确。没给 90 分以上是因为它毕竟还是 Flash 这一档,不是满血旗舰,实际业务表现还得等用户反馈。

AI HOT 精选

DeepSeek V4 Flash 正式版 API 开始公测,只改了后训练,让模型干活的能力分涨了不少

DeepSeek 今天下午把 V4 Flash 正式版的 API 放出来公测了。模型结构和尺寸跟预览版一样,只是重新做了一遍后训练,但让模型进业务流程干活(Agent)的分数明显上去了。比如 Terminal Bench 2.1 跑到 82.7,DeepSWE 54.4,官方说远超 V4 Pro 预览版。Flash 现在原生支持 Responses A...

推荐理由:DeepSeek V4 Flash 正式版公测,Agent 跑分压过 V4 Pro 预览版,属于国产主力模型的一次实打实更新。两个具体分数(Terminal Bench 2.1、DeepSWE)让信号更实在。分数没给更高是因为它毕竟是 Flash 不是 Pro,而且正文没披露后训练具体改了什么、成本多少,这些缺口让判断得先打个折。

Latent Space

GPT-5.6 全线降价 20%-80%:四个月前旗舰模型的智力,现在只要十三分之一的价格

OpenAI 把 GPT-5.6 Luna 的价格砍到了每百万 token 输入 0.2 美元、输出 1.2 美元,降幅 80%。Terra 降了 20%,Sol 则多了一个 2.5 倍速模式,价格翻倍但智力不变。最狠的是,Luna 在 AA 基准测试上拿了 51 分,跟今年三月 GPT-5.4 开满推理强度时的分数一样,但 token 成本只有当时的...

推荐理由:四个月把同等智力成本压到十三分之一,这个信号比单纯降价狠得多。AA 基准 51 分直接对标 GPT-5.4 满血推理,让降价有了硬参照,不是拿弱化版糊弄人。文章没展开“递归自优化”具体怎么做的,这点先别太激动,但光看价格和分数,已经够让所有调 API 的人重新打算盘了。

AI HOT 精选

国家发改委放话,要加快《人工智能法》的立法了

国家发改委新闻发言人蒋毅在7月31日的发布会上说,上半年国产大模型全球下载量破了100亿次,像DeepSeek和月之暗面都发了万亿参数的开源模型。接下来除了继续搞基础研究和建应用试点基地,重点是会加快《人工智能法》的立法,想拿出一套能平衡发展和安全的治理方案。不过正文没披露具体的立法时间表和监管细则,这点先别太激动。

推荐理由:发改委首次明确承诺要加快《人工智能法》立法,还带了上半年100亿次下载量、万亿参数开源模型这些新数据,对国内AI从业者是个直接的政策信号。分数没给更高,因为正文没披露立法时间表和具体监管细节,现在激动还太早。

Computing Life · Share · 鸭哥调研

Kimi K3 技术报告:把模型做大,先得搞定显存、带宽、通信和延迟这四堵墙

Moonshot AI 放出了 Kimi K3 的技术报告,模型总参数 2.78 万亿,每次推理激活 1042 亿参数,总共 93 层,原生支持 100 万 token 上下文。但报告真正的看点不是参数大,而是他们怎么在真实硬件限制下做工程取舍。在序列处理上,他们用 69 层 KDA 以固定成本传递历史信息,再用 24 层 Gated MLA 做全局纠...

推荐理由:Moonshot AI 放出 Kimi K3 技术报告后,这篇解读绕开了“2.78 万亿参数”的标题党写法,直接拆他们怎么在真实硬件限制下做序列架构的取舍:69 层 KDA 控制成本,24 层 Gated MLA 做全局修正,整篇文章都在讲显存、带宽、延迟这些硬约束下的工程选择。对从业者来说,这比参数数字有用得多。

7月29日星期三

FT · 科技

扎克伯格反对美国封禁中国 AI,认为竞争比脱钩更管用

扎克伯格对《金融时报》说,美国不该封禁中国的 AI 模型。他点名 DeepSeek 和字节跳动,说这两家动作很快,但 Meta 的 Llama 系列在开源模型里还是领先的。他的核心逻辑是:如果美国公司被挡在中国市场外面,那中国公司就会拿下全球其他市场。文章没提他具体想要什么政策,也没说时间表。

推荐理由:扎克伯格在《金融时报》的独家表态有新闻性,直接点名中国公司让话题更具体。但整篇就是站队发言,没给政策建议也没时间表,信息增量有限,所以分数打78,别指望太高。

7月27日星期一

纽约时报中文网

中国开源模型追上来了,硅谷为“该不该封”吵成一团

智谱AI和月之暗面最近发了新模型,性能已经能跟美国顶级实验室的产品掰手腕。这直接点燃了硅谷的路线之争:OpenAI和Anthropic跑去华盛顿游说,说中国公司用“蒸馏”偷师他们的闭源系统,有国家安全风险,得管;另一边,英伟达、微软、Meta等一票大佬和近200家初创公司公开站队开源,认为封杀会阻碍创新、让巨头垄断。财政部长贝森特和科技顾问克拉齐奥斯放...

推荐理由:纽约时报的原创报道,细节扎实,把中国开源模型进步怎么撕裂硅谷、谁在游说谁在反对都写清楚了。热度、知识、共鸣三项全中,但本质是行业趋势分析,不是产品发布,按规则打到 82 分这一档。

7月26日星期日

Hacker News 首页

DeepSeek 暂停融资,梁文锋交流会文字稿被传到 GitHub

一份标注日期为 2026 年 7 月 22 日的 DeepSeek 投资者交流会文字稿 PDF 被上传到 GitHub。梁文锋在会上承认与美国在算力上的差距在拉大,并透露公司已暂停最新一轮融资。目前公开的只有 PDF 标题,正文是扫描件,具体发言内容和融资规模都没披露。

推荐理由:一份标注为2026年7月22日的DeepSeek投资者交流会文字稿PDF被传到GitHub。梁文锋在里头承认和美国在算力上的差距在拉大,还说公司已经暂停了最新一轮融资。目前公开的只有PDF标题,正文是扫描件,具体发言内容和融资规模都没披露。信息缺口太大,没法判断这件事对行业或公司到底有多大影响,所以重要性给0。

7月24日星期五

FT · 科技

英伟达和 Palantir 游说白宫别禁开源模型,说禁令会先伤到美国自己

白宫正在考虑限制开源权重大模型出口,起因是有报道说 DeepSeek 用美国的开源模型训练了军用 AI。英伟达和 Palantir 跳出来反对一刀切禁掉,他们的理由是:开源生态是美国 AI 领先地位的核心,全面禁止等于自断手脚,本土公司会先遭殃。他们提的替代方案是收紧最终用户管控,而不是封模型本身。文章没给出立法时间表,也没说白宫目前倾向哪边。

推荐理由:FT 独家,信源扎实。英伟达和 Palantir 联手反对开源模型出口禁令,提出的替代方案是收紧最终用户管控,而不是封模型。政策张力真实存在,对开源 AI 圈子直接相关。没给 85 是因为文章没披露白宫目前倾向哪边,也没立法时间表,判断先打个折。

纽约时报中文网

中国把开源、低成本 AI 当成新软实力,跟美国闭源模型抢全球市场

习近平上周公开站台开源 AI,说这是把技术红利扩散到全球的“历史机遇”,并承诺五年内给发展中国家 5000 个培训名额。中国公司(深度求索、月之暗面、智谱 AI、阿里等)主推开源模型,部分任务成本比美国方案低 50% 到 90%。美国那边反击很猛:Anthropic 指控阿里用 2.4 万个假账号爬取其技术,财长贝森特威胁制裁。安全争议两边都有——开源...

推荐理由:NYT 把中国开源 AI 当成地缘软实力故事来讲,习近平的背书、具体的成本数据和 Anthropic 的爬取指控让文章有了实感。但这是宏观叙事,不是一手产品发布,缺乏可复现的评测细节,所以分数没给到 85 以上。

7月23日星期四

r/LocalLLaMA

DeepSeek 创始人梁文锋四小时投资人会:AGI 优先,不追用户增长,不做超级应用

梁文锋花了四个小时反复说“不”:不做消费级或企业级产品,不碰视频生成和世界模型,不追用户增长,不闭源,也不想成为下一个字节或腾讯。他把产品、多模态和幻觉问题都归为支线任务,主线只有两个:编程智能体和通用智能体。在他看来,中美 AI 的差距本质是资源差距,他相信规模定律——模型做这么大不是因为够用,而是因为目前只有这么多资源。开源策略是主动放弃一部分价值...

推荐理由:梁文锋首次系统公开战略优先级,明确拒绝产品化和闭源,只押注 AGI 和智能体,信息密度高、立场鲜明,对从业者有直接参考价值。扣分点:来源是投资人会议转述,非一手官方公告,但内容具体程度足以支撑判断。

7月21日星期二

Sinocism · 比尔·毕晓普

月之暗面发布 Kimi K3,美国对开源 AI 的态度显得自相矛盾

这期付费播客主要聊了两件事:一是月之暗面推出了新模型 Kimi K3,在美国投资人和政策圈引发了类似“DeepSeek 2.0”的担忧。Andrew 和 Bill 认为,美国对开源 AI 生态的政策很拧巴——明明有手段可以拖慢中国进步,但特朗普政府可能不太愿意用。二是习近平在世界人工智能大会上的主旨演讲,以及中国对全球南方基础设施的叙事。节目最后还提到...

推荐理由:我会先打个折:这是付费播客的摘要,不是一手报道,细节和论证厚度肯定不如原文。但它的价值在于把 Kimi K3 引发的美国政策圈焦虑、开源政策的内在矛盾、以及特朗普政府可能的选择,几条线捏在一起讲。对关注中美 AI 博弈的人来说,这期节目提供了一个现成的讨论框架,哪怕只是当个引子也值得一看。

7月20日星期一

Hacker News 首页

让大模型学会省力思考:低、中、高三档推理模式怎么训出来

Sebastian Raschka 在这篇文章里讲了一种训练方法,让同一个推理模型能按需切换思考强度,而不是每次都全力运转。他先用 GPT-5.6 的五档推理设置引出话题,然后明确推理模型的定义:会输出中间步骤、一步步推演的模型。核心做法分两步:训练时用强化学习加可验证奖励(RLVR),推理时靠 token 预算来控制生成长度。具体操作是把不同长度的推...

推荐理由:Raschka 讲了一种训练方法,让同一个推理模型能按需切换思考强度。文章先把 GPT-5.6 的五档推理设置当引子,然后给出推理模型的定义——会输出中间步骤、一步步推演的模型。核心做法分两步:训练时用强化学习加可验证奖励,推理时靠 token 预算来控制生成长度。具体操作是把不同长度的推理链混在一起训,让模型学会根据预算指令调整输出。我会先打个折:正文没披露具体实验数据和效果对比,这点先别太激动。但思路本身对想省推理成本又有灵活需求的团队有参考价值。

7月19日星期日

TechCrunch · AI

月之暗面开源 Kimi K3,性能逼近 GPT-5.6 和 Claude Fable 5,但关键细节没公布

月之暗面这周把 Kimi K3 开源了。公司自己承认模型还打不过最强的闭源模型 Claude Fable 5 和 GPT-5.6 Sol,但 Arena.ai 和 Vals AI 的第三方评测显示,K3 已经能跟这些旗舰模型掰手腕了。发布正好赶上习近平在上海世界人工智能大会讲话,纳斯达克周五跌了约 1%,芯片股像英伟达被抛售。这波讨论很像 2025 年...

推荐理由:月之暗面把 Kimi K3 开源,第三方评测显示它能跟 GPT-5.6 Sol 和 Claude Fable 5 掰手腕,这是中国模型生态一个挺硬的信号。不过这篇是 TechCrunch 的评论稿,不是官方发布原文,所以重要性我打了 78 分,没再往上拉。

7月17日星期五

Hacker News 首页

Mozilla 发布首份开源 AI 报告:开放权重模型已吃掉大部分 token 流量,但落地工具链还是跟不上

Mozilla 的第一份《开源 AI 现状》报告给出了几个硬数字。开放权重模型现在占了 OpenRouter 上大部分 token 流量,排第一的是 DeepSeek V4 Flash。GPT-4 级别的推理成本在 36 个月内跌了 50 倍,现在每百万 token 只要 0.4 美元。能力差距还有 3.3%,主要卡在推理和多模态上,编程能力已经打平。...

推荐理由:这份报告不是公关稿,给的是可引用的流量占比、成本曲线和能力差距数字。我会先打个折:它是快照而非产品发布,所以没给更高分,但对开源生态的判断有实际参考价值。正文没披露样本覆盖时段和统计口径,这点先别太激动。

7月16日星期四

FT · 科技

Mira Murati 的 Thinking Machines 发布首款模型,训练方法借鉴了 DeepSeek 等中国团队

前 OpenAI 技术负责人 Mira Murati 创立的 Thinking Machines 推出了第一个模型。FT 报道说,这个模型用了和中国公司 DeepSeek 类似的训练技巧,用更少的算力做到了接近前沿的水平。不过正文没披露模型叫什么、参数量多大、具体跑分是多少,也没说是不是开源权重。

推荐理由:Mira Murati 创业首秀加上 FT 独家,故事分量够上 featured。但正文没给模型名、参数量、跑分和是否开源,信息缺口不小,所以分数先打 78,等更多细节出来再调。

7月14日星期二

FT · 科技

DeepSeek 刚融完第一轮钱,一个月后又开始谈新一轮融资

FT 的消息说,DeepSeek 在 6 月刚完成公司史上第一轮外部融资,现在已经在跟投资人聊新一轮了。第一轮到底融了多少钱、估值多少、谁投的,正文都没披露。新一轮的规模和用途也还没定。创始人梁文锋之前一直靠自有资金撑着,连着两轮融资说明公司正快速切到扩张模式。

推荐理由:FT独家消息,DeepSeek 6月刚完成史上第一轮外部融资,现在已经在谈第二轮了。梁文锋从自掏腰包到连续融资,是个重要的战略信号。不过第一轮到底融了多少、估值多少、谁投的,正文都没说,所以重要性没给满。我会先打个折,等具体数字出来再重新评估。

7月8日星期三

AI HOT 精选

Liquid AI 开源 Antidoom:用“最终 Token 偏好优化”修掉推理模型的死循环毛病

推理模型有时会卡在“死循环”里,反复输出无意义的 token 直到把上下文窗口塞满。Liquid AI 开源了 Antidoom,用最终 Token 偏好优化(FTPO,一种教模型在推理结束时学会停下来的训练方法)来解决这个问题。他们在 DeepSeek V4 Pro 上试了,用 1,040 组偏好样本训练后,死循环率从 3.2% 降到了 0.3%,而...

推荐理由:Liquid AI 开源了一个修推理模型死循环的实用方法,在 DeepSeek V4 Pro 上把死循环率从 3.2% 压到 0.3%,数字扎实。没给更高分是因为目前只有一篇博客,没有论文或第三方验证,单源信息到这个分数已经不错了。

7月7日星期二

纽约时报中文网

美国AI公司指责中国对手非法蒸馏技术,但这事没那么简单

Anthropic 6月致信美国参议员,指控阿里巴巴用数万个未经授权的账户,以工业级规模蒸馏其 Claude 模型。蒸馏本身不是什么新技术,谷歌十年前就发明了它,本质是让大模型当老师,教小模型学回答风格,省算力。马斯克4月也在法庭上承认 xAI 蒸馏过 OpenAI 的技术。目前法律上是否违法还不明确,法院没判过,版权法也管不着模仿行为。正文没披露阿里...

推荐理由:Anthropic 正式指控阿里巴巴用数万个账户大规模蒸馏 Claude,马斯克的案子是现成的平行案例。核心钩子是法律真空:模仿行为本身不违法,法院没判过,版权法也管不着。文章没披露阿里的回应和具体证据,所以分数没给到 85 以上。

7月6日星期一

Computing Life · Share · 鸭哥调研

SEO 服务正在变成模型蒸馏的访问基础设施

这篇文章把 AI 答案抓取从 SEO 工具重新定义为模型访问市场。NetNut 被 FBI 查封之所以值得关注,不是因为它做网页爬虫,而是它的爬虫目录里公开卖 ChatGPT、Perplexity 和 Google AI Mode 的访问接口。Anthropic 今年 2 月的报告指出,有 24,000 个欺诈账号对 Claude 发起了超 1,600...

推荐理由:这篇把一个看似常规的网络犯罪查封案,重新解释成模型蒸馏基础设施的曝光,视角新鲜。H、K、R 三条都踩中了。正文有硬证据:NetNut 的爬虫目录里直接列着模型访问接口,不是推测。Anthropic 的数据也给了攻击规模一个量级。我会先打个折——文章没展开讲这些被抓取的输出具体怎么喂进蒸馏流程,但把‘谁在卖、卖给谁、规模多大’这条线理得很清楚,对从业者来说信息密度够高。

7月4日星期六

AI HOT 精选

2.6万名学生追踪30个月:用AI写作业,平时分涨18%,大考分却跌了24%,这个坑两年才完全暴露

这项研究跟踪了华中某县2.6万多名中学生两年半,发现用AI写作业的学生平时成绩涨了18%,完成时间从64分钟缩到45分钟,但闭卷月考成绩直接掉了20%。更麻烦的是,中考、高考这类关键考试的成绩下滑了18%到24%,而且这个跌幅要差不多两年才会完全显现,短期研究根本看不出来。约81%的长期用户出现了典型的“外包模式”——作业做得又快又好,考试却一塌糊涂。...

推荐理由:这篇研究用大规模纵向数据(2.6万人、2.5年)挖出了AI辅助学习的一个隐藏成本:效果恶化有两年延迟期。HKR三项都打中了,但只覆盖一个县、原文付费墙,信息细节有限,所以分数没再往上拉。

7月2日星期四

Hacker News 首页

11 个模型比赛重构一个 1500 行的 LangGraph 巨型节点,Fable 的方案拿了第一

作者把一个 1500 行的 LangGraph 巨型节点(god node,所有逻辑塞在一个函数里)扔给 11 个模型,让它们各自出重构方案和完整代码,然后让模型互相打分。Fable-5 的方案在同行评审里排第一,GPT-5.5 和 DeepSeek-4-pro 紧随其后,GPT-5.4 和 Opus-4.7 垫底。每个模型都产出了架构文档和代码,评审...

推荐理由:一篇 11 模型重构实战,有完整代码和同行互评排名,不是纸上谈兵。Fable-5 拿第一本身就值得讨论。扣分是因为这只是个人单次实验,不是受控基准测试,所以停在 feature 级别。

6月30日星期二

Hacker News 首页

美团开源 LongCat-2.0:1.6 万亿参数 MoE 模型,48B 激活,全程用自研 AI ASIC 训练

美团放出了 LongCat-2.0,一个总参数 1.6 万亿、每次推理激活约 480 亿参数的混合专家模型。它全程跑在美团自研的 AI ASIC 超算集群上,用超过 5 万张卡、没出过需要回滚的重大训练事故,预训练吞下了超过 35 万亿个 token。模型专门为长上下文和智能体任务做了优化:引入 LongCat 稀疏注意力来加速百万 token 级长文...

推荐理由:美团开源了一个总参数 1.6 万亿、每次激活约 480 亿参数的 MoE 模型,全程用自研 AI ASIC 训练,5 万多张卡零回滚跑完,预训练数据量超过 35 万亿 token。模型专门为长上下文和智能体场景做了优化,引入了 LongCat 稀疏注意力来加速百万 token 级处理。我会先打个折:目前只有官方博客,没有第三方评测或真实业务反馈,所以分数停在 82 而不是更高。如果是真的,这套非 GPU 训练方案挺省钱,但稳定性和性能还需要更多证据。

6月29日星期一

Hacker News 首页

DeepSeek V4 七月中旬上线,API 开始分峰谷时段计价

DeepSeek 宣布 V4 模型会在七月中旬正式发布,同时上线峰谷计价:北京时间每天 9:00–12:00 和 14:00–18:00 算高峰,API 价格翻倍。高性能版 deepseek-v4-pro 输出从每百万 token 6 元涨到 12 元,轻量版 deepseek-v4-flash 从 2 元涨到 4 元。用户会在调价前 24 小时收到邮...

推荐理由:V4 发布加上峰谷计价,是国内大模型 API 头一回把电力市场的逻辑搬过来。高峰时段价格翻倍对重度用户是实打实的成本信号,所以给 featured。没打更高是因为正文只放了价格和时段,模型能力、性能提升这些关键信息都还没披露,先别太激动。

6月27日星期六

AI HOT 精选

AI账单比员工工资还高,部分美国公司已把全部流量切给DeepSeek

旧金山一家25人的公司Lindy,CEO说每月AI费用已经超过所有员工的工资总和,这个月他们把100%的调用从Anthropic的Claude切到了DeepSeek,预计未来几个月能省下数百万美元。他之前在Uber的同事也说,Uber现在给部分AI工具设了每月1500美元的开支上限。咨询公司Highspring的人提到,有些客户干脆暂停AI投入,等能证...

推荐理由:有公司名和具体数字,不是空谈趋势。Lindy 的 100% 切换和 Uber 的 1500 美元上限是可验证的决策信号。没给更高分是因为目前只有标题和摘要,正文还没披露切换后的实际效果和确切节省金额。

6月26日星期五

FT · 科技

DeepSeek 要大规模招人,中国 AI 圈抢人大战升级

DeepSeek 正在从字节、阿里等大厂高薪挖人,部分 offer 能给到候选人当前薪资的 2 到 3 倍。团队会从现在的几百人快速扩张,但正文没披露具体要招到多少人。我会先打个折——能不能持续这个节奏,还得看下一轮融资和收入能不能跟上。

推荐理由:FT 独家报道了 DeepSeek 用 2-3 倍薪资高调挖人的动作,有硬数字、有明确的大厂对手,信息冲击力够。缺点是正文没披露具体要招到多少人,且 FT 有付费墙,部分读者看不到全文。

AI HOT 精选

华盛顿邮报实测:主流AI聊天机器人政治立场仍偏左,连标榜“反觉醒”的模型也未能幸免

华盛顿邮报拿六个主流AI模型做了次政治立场测试,结果发现它们整体还是偏左。OpenAI的GPT-5.5回答里80%只给左派论点,DeepSeek V4 Pro也有70%,两者都反对死刑,尽管美国多数民众几十年来一直支持。Anthropic的Claude Opus 4.8有43%的回答纯左派。xAI的Grok 4.3虽然右派回答比其他模型多,但纯左派回答...

推荐理由:华盛顿邮报这次测试给了具名模型和百分比,不是那种“AI可能有偏见”的模糊喊话。三个HKR维度都踩中了,但这是媒体做的基准测试,不是产品发布或技术突破,所以放在72分上下的featured档位。信息源是媒体,正文没披露测试方法和样本量,这点先别太激动。

6月25日星期四

Hacker News 首页

开源模型便宜到让闭源厂商没法打价格战

作者在试用 DeepSeek V4 时发现,它的 API 价格只要 0.09 美元,而 Anthropic 的同类模型要 5 美元,差了将近 50 倍。文章认为,Anthropic 和 OpenAI 被自己的高成本结构卡住了脖子,很难把价格砍掉一两个数量级去跟 DeepSeek 或小米的 Mimo 竞争。作者猜测,这两家可能会走奢侈品路线,靠制造稀缺感...

推荐理由:作者用一个真实的定价对比,把开源权重模型和闭源厂商之间的结构性成本矛盾摆到了台面上。50 倍价差是硬数据,不是修辞。正文被截断了,完整论证看不到,所以评分停在 featured 档,不加码。

6月20日星期六

AI HOT 精选

微软在测试 DeepSeek-R1 和 V4,打算把中国模型卖给西方客户,同时也在把 ChatGPT 卖给中国企业

彭博社说微软正在测试 DeepSeek-R1 和 DeepSeek-V4,准备把这些中国模型提供给西方客户。另一边,微软也在把 ChatGPT 卖给中国企业,相当于在中美之间做 AI 模型的中间商。正文没披露定价、分成比例和具体上线时间,所以这个双向贸易网络到底能跑多大,现在还不清楚。

推荐理由:彭博社的信源让这事有可信度,微软在中美之间双向倒卖 AI 模型这个定位以前没被挑明过,所以信息增量是实的。我会先打个折:正文没披露定价、分成比例和具体上线时间,所以这个双向贸易网络到底能跑多大、赚多少,现在全是问号。但光是微软同时卖 GPT 给中国、卖 DeepSeek 给西方这个事实,就足够让从业者重新盘算自己的采购和合规策略了。

Hacker News 首页

GPT-5.5 的幻觉率是开源模型 GLM-5.2 的三倍,大模型迷信该破了

作者拿 GPT-5.5、DeepSeek V4 Pro 和智谱的 GLM-5.2 做了个对比测试。在 AA-Omniscience 幻觉基准上,GPT-5.5 的幻觉率高达 86%,DeepSeek V4 Pro 更是飙到 94%,而 GLM-5.2 只有 28%。这意味着前两者遇到不会的问题时,十次里有八九次会瞎编一个答案,而不是老实说“我不知道”。...

推荐理由:这篇是个人博客做的第一手对比测试,数字很具体、结论也反直觉,所以 H、K、R 三个维度都踩中了。分数定在 78 而不是更高,是因为样本量和测试方法没完全展开,权威性有限,我会先打个折。

6月19日星期五

AI HOT 精选

DeepSeek研究员开源AutoResearch:AI自己跑完285B模型强化学习全流程

DeepSeek研究员Deli Chen放出了一个叫AutoResearch的实验协议,让AI智能体在285B参数的模型上独立跑完了一整套强化学习研究闭环——自己设计实验、写代码、提交GPU任务、修bug、写总结,全程没人插手。系统用了GRPO这个工具。不过正文没披露具体做了什么任务、训练了多久、成功率多少,这些关键信息都缺着,所以先别太激动,等有人复...

推荐理由:DeepSeek 研究员放出了一个实验协议,让智能体在 285B 模型上独立跑完强化学习研究闭环,设定很强。但正文没披露具体任务、训练时长、成功率这些关键指标,信息缺口太大,所以分数先打个折,等有人复现再说。

6月18日星期四

AI HOT 精选

DeepSeek 识图模式在 App 和网页端上线,App 端仍标注“内测中”

DeepSeek 多模态研究员 Xiaokang Chen 宣布,识图模式今天在网页和 App 端正式上线。这个模式跟“快速模式”“专家模式”并列,打开后可以上传图片让模型理解画面内容,不只是提取文字。IT之家实测发现,App 端还挂着“图片理解功能内测中”的提示,网页端没有。今年 4 月 DeepSeek 公开过背后的多模态框架“Thinking w...

推荐理由:DeepSeek 把图片理解做成一个正式模式,产品上算是一个节点,补上了多模态输入的缺口,而且有公开框架背书。IT之家实测提到 App 端还挂着内测提示,说明全量放开可能还要等一等,所以重要性没给满。整体上,这件事对用 DeepSeek 做开发的团队来说是个直接可用的更新,值得提一下。

6月17日星期三

Computing Life · Share · 鸭哥调研

推理模型四年史:你以为的石破天惊,其实早有暗线

推理模型不是2024年突然蹦出来的。让模型写解题步骤的思维链、用自己生成的正确推理训练自己的STaR、给中间步骤打分的过程奖励模型,这些技术从2022年起就陆续成熟了。o1真正改变的是产品化:把推理变成一种可以计费、可以调度的资源,在API里引入reasoning tokens和可调节的思考强度参数,相当于给scaling law开了第二个轴。Deep...

推荐理由:这是一篇有信息量的长文综述,用具体论文和时间线追溯推理模型的技术源头,核心判断是o1的分水岭在于把推理产品化成可计费算力,而非发明了推理本身。HKR三项都踩中,但属于梳理整合型内容而非独家爆料,放在78分、featured层级合理。

AI HOT 精选

微软考虑在 Copilot Cowork 里加一个 Azure 托管的 DeepSeek V4,当便宜选项

Copilot Cowork 要从无限用改成按量计费了,因为有人一周跑几百个任务,成本扛不住。微软想了个省钱方案:在 Azure 上托管一个微调过、加了安全护栏的 DeepSeek V4,让用户自己选要不要用。Axios 说微软已经微调出一个能跑的模型,但最终上不上还没定。

推荐理由:两条实质变化:Copilot Cowork 从无限用改按量计费,以及微软考虑在 Azure 上托管微调版 DeepSeek V4 来省钱。Axios 确认模型已经微调出来了,但最终上不上还没定,所以分数停在 78。

6月16日星期二

AI HOT 精选

DeepSeek 首次拿外部投资,估值超 500 亿美元,但钱进的是梁文锋管的有限合伙,不是公司本身

DeepSeek 完成了第一轮外部融资,融了超过 500 亿人民币(约 74 亿美元),估值推到 500 亿美元以上。这笔交易的结构不太常规:投资人的钱进的是一个由 CEO 梁文锋管理的有限合伙企业,而不是直接投进 DeepSeek 公司。这些外部投资者没有投票权,而且股份要锁定五年才能退出。唯一有投票权的直接投资者是中国国有 AI 投资基金。梁文锋自...

推荐理由:我会先打个折:正文没披露这轮融资的具体用途和投资人完整名单,所以没法判断钱会怎么花。但这条消息本身信息密度够高——500 亿美元估值、74 亿美元融资额、有限合伙结构、五年锁定期、唯一有投票权的是国有基金,每一条都在说同一件事:梁文锋把控制权抓得很紧,外部人出钱但没什么话语权。这种安排在国内头部 AI 公司里不常见,对想理解 DeepSeek 权力结构和资本逻辑的人来说,是条硬消息。

AI HOT 精选

本地编程栈实测:Qwen 3.6 35B-A3B 免费换来 5 倍提速

Tomasz Tunguz 翻完 Hacker News 上 500 多条评论,画出了现在程序员用本地模型写代码的主流配置。模型这边,Qwen 3.6 35B-A3B 被提到最多,占 33%,它的 27B 版本占 20%,后面是 DeepSeek Pro 和 Gemma4 31B。这些模型都用了混合专家架构,好处是能在普通家用显卡上跑起来——35B 总...

推荐理由:Tunguz 从 500 多条 HN 评论里挖出了真实的本地编程配置:模型端 Qwen 3.6 35B-A3B 占 33%,工具端 Pi 占 49%,混合专家架构让消费级显卡能跑起来。有对比有数字,不是厂商通稿。扣分是因为这是二手整理,不是一手评测,而且正文没给出性能对比基准,只能当社区风向看。