跳到正文

开源生态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

329 条精选相关主题模型发布Hugging FaceAI 编码

最新精选

第 141–160 条 · 共 329 条

6月19日星期五

AI HOT 精选

DeepSeek研究员开源AutoResearch:AI自己跑完285B模型强化学习全流程

DeepSeek研究员Deli Chen放出了一个叫AutoResearch的实验协议,让AI智能体在285B参数的模型上独立跑完了一整套强化学习研究闭环——自己设计实验、写代码、提交GPU任务、修bug、写总结,全程没人插手。系统用了GRPO这个工具。不过正文没披露具体做了什么任务、训练了多久、成功率多少,这些关键信息都缺着,所以先别太激动,等有人复...

推荐理由:DeepSeek 研究员放出了一个实验协议,让智能体在 285B 模型上独立跑完强化学习研究闭环,设定很强。但正文没披露具体任务、训练时长、成功率这些关键指标,信息缺口太大,所以分数先打个折,等有人复现再说。

AI HOT 精选

Steve Yegge:Fable 被美国政府短暂关闭,意味着最聪明的 AI 模型以后会像核武器一样被锁起来

Steve Yegge 认为,Fable 模型被美国政府短暂关停是一个分水岭,说明模型智能已经危险到需要管控了。他预测,最多再过两三代模型,最前沿的 AI 就会像核武器一样被政府严格管制,绝大多数财富 500 强公司都拿不到访问权限。开源模型虽然能追到 Fable 这个级别,但受限于算力壁垒和供应链封锁,很难再往上突破。对大多数人来说,AI 能力曲线会...

推荐理由:Steve Yegge 把 Fable 被短暂关停这件事当成一个分水岭来聊,核心论点是 AI 能力曲线很快会被政府管制压平。判断很锋利,预测也具体,但本质是评论分析,不是一手报道,缺可核实的新事实,所以分数上我会打个折。

6月18日星期四

AI HOT 精选

阿里开源 LOGOS 科学模型,用 1/56 参数量在多项任务上超过微软 NatureLM

阿里和人大高瓴学院开源了一个叫 LOGOS 的科学模型,把蛋白质、小分子、材料等七种科学数据统一编成一套“科学语法”的 token 序列,让模型用预测下一个词的方式直接处理。它把蛋白质口袋和配体的 3D 接触模式也转成了离散 token,不依赖显式 3D 坐标就能预测空间相互作用。LOGOS-1B 只有 10 亿参数,微软 NatureLM 是 8×7...

推荐理由:阿里开源了一个 10 亿参数的科学模型 LOGOS,把七种科学数据统一成 token 序列,用预测下一个词的方式处理,还在多个任务上赢了参数多 56 倍的微软 NatureLM。有具体数字、有开源代码,知识增量扎实。但领域太专,我会先打个折——对科学 AI 圈内人是硬货,对圈外人共鸣不强,所以放在 featured 里比较合适。

Computing Life · Share · 鸭哥调研

Vercel 开源 eve:一个 agent 就是一个文件夹,这句话不是在玩文字游戏

Vercel 在伦敦 Ship 大会上开源了 eve,核心主张是“一个 agent 就是一个文件夹”。文件名自动注册为工具,Git 仓库就是 agent 本体,改一句指令就生成一个 diff 和预览部署。它内置了 durable execution(审批等待期间不烧算力)、沙箱 microVM 和多渠道支持(Slack、Discord、Teams、HT...

推荐理由:Vercel 在伦敦 Ship 大会上把 eve 开源了,核心主张是“一个 agent 就是一个文件夹”。文章没停留在口号上,而是拆解了具体怎么做到的:文件名自动注册为工具,Git 仓库就是 agent 本体,改一句指令就生成 diff 和预览部署。它还内置了 durable execution,审批等待期间不烧算力,用沙箱 microVM 做隔离,支持 Slack、Discord、Teams 等多渠道。这些机制细节让“文件夹即 agent”从一句营销话变成了可验证的架构选择。对在 LangChain 和托管服务之间摇摆的团队来说,eve 提供了一...

6月17日星期三

AI HOT 精选

AWS 开源 Strands Robots SDK:一套代码同时跑仿真和真机,数据直接存到 Hugging Face Hub

AWS 把 LeRobot 这套机器人训练工具包封装成了一个统一的智能体,叫 Strands Robots SDK,用 Apache 2.0 协议开源。默认跑 MuJoCo 物理仿真,不用买硬件就能先试;想上真机时把参数改成 mode="real" 就行,仿真和真机代码完全一样,只差这一个关键字。你操作机器人的演示数据会被录成 LeRobotDatas...

推荐理由:AWS 把 LeRobot 封装成一个统一智能体 SDK,一键切换仿真和真机,对机器人开发者是个趁手工具。但纯物理机器人的话题在 AI 应用层读者里热度有限,R 轴没完全打满,刚好卡在 featured 门槛上。

AI HOT 精选

GLM-5.2 开源:Code Arena 盲测登顶,专攻长任务和代码

智谱把 GLM-5.2 用 MIT 协议开源了。它在 Code Arena 前端开发盲测里拿了公开可用模型第一,代码能力卡在 Claude Opus 4.7 和 4.8 之间。模型支持 100 万 token 无损上下文,能跑跨天的长任务。在 FrontierSWE 上只比 Opus 4.8 低 1%,超过了 GPT-5.5 和 Opus 4.7;Te...

推荐理由:智谱把 GLM-5.2 用 MIT 协议开源了,代码能力在 Code Arena 前端盲测里排公开模型第一,夹在 Claude Opus 4.7 和 4.8 之间,FrontierSWE 只比 Opus 4.8 低 1%,还支持 100 万 token 无损上下文跑跨天长任务。这几个数字放在一起,对国内做应用和工具链的人来说是近期最值得上手试的国产模型。没给更高分是因为目前只看到摘要,完整评测和实际落地表现还没出来,先打个折。

Hugging Face 博客

Hugging Face 发布 ARD 发现工具,让 AI 代理能自己搜工具、技能和其他代理

Hugging Face 上线了 Discover Tool,这是 ARD(代理资源发现)规范的一个参考实现。ARD 是一份由微软、谷歌、GoDaddy、Hugging Face 等共同起草的开放草案,解决的是当前代理生态里一个很实际的问题:现在用 MCP 工具、A2A 代理或技能,都得靠人提前写好配置、指定好地址,代理自己不会找。ARD 相当于在它们...

推荐理由:ARD 瞄准的是代理工具发现这个真实痛点,背后有微软、谷歌、Hugging Face 等跨厂商背书,还给了可用的参考实现。没打更高分是因为它目前还是开放草案,不是正式标准,文章也没说清楚谁会跟进落地、生态铺开要多久。

AI HOT 精选

智谱上线并开源 GLM-5.2,主攻编程和长链条任务,综合跑分进了全球前三

智谱把 GLM-5.2 放出来了,代码开源,MIT 协议,可以商用。这个模型在 Artificial Analysis 综合榜上拿了 51 分,跟 Anthropic、OpenAI 排在前三,是开源模型里目前最好的。前端开发盲测 Code Arena 上拿了全球可用模型第一。这次最大的升级是实打实的 100 万 token 无损上下文,专门用来跑长链条...

推荐理由:智谱把 GLM-5.2 完整开源了,MIT 协议,商用没限制。模型在 Artificial Analysis 综合榜拿 51 分,跟 Anthropic、OpenAI 排在前三,是开源模型里目前最好的成绩;Code Arena 前端开发盲测也拿了全球可用模型第一。这次最大的升级是实打实的 100 万 token 无损上下文,专门跑长链条任务,FrontierSWE 和 SWE-Marathon 两个长程基准上的分数落在 Claude Opus 4.7 和 4.8 之间,还放出了一个 88 万 token 的完整跑通案例。对做 AI 工程的人来说,这...

6月16日星期二

AI HOT 精选

蚂蚁百灵开源三款新模型,用混合注意力架构把推理速度拉到 340 tokens/s

蚂蚁百灵发了 Ling-2.6-flash、Ling-2.6-1T 和 Ring-2.6-1T 的技术报告,代码和权重都公开了。三款模型用了同一种 Hybrid Linear Attention 架构,把 Lightning Attention 和 MLA 按 7:1 的比例拼在一起,主要为了在长文本上跑得快、省资源。Ling-2.6-flash 在 ...

推荐理由:蚂蚁百灵这次开源了三款模型,核心卖点是把 Lightning Attention 和 MLA 按 7:1 的比例揉成一个 Hybrid Linear Attention,主要为了在长文本上省资源、跑得快。报告给了具体参数和效率数据,代码权重都公开,信息扎实,所以给了 featured。没打更高是因为蚂蚁的模型在社区关注度上还比不上那几个顶流实验室,实际业务里的表现也得再观察,我会先打个折。

6月15日星期一

AI HOT 精选

MiniMax 开源 M3 模型,428B 总参数里只激活 23B,长文本推理更省钱

MiniMax 把 M3 模型权重放出来了,总参数 428B,每次推理只激活 23B,同时发了 MSA 稀疏注意力论文,专门降长上下文推理成本。M3 是第一个从预训练阶段就用图文交错数据练出来的开源模型。发布两周后,它在 Artificial Analysis 综合智能指数和 GDPval-AA 上拿了开源第一,Code Arena WebDev 进了...

推荐理由:MiniMax 把 428B 的 M3 模型权重和 MSA 稀疏注意力论文一起放出来,主打长上下文推理省钱,两周内拿了两个开源第一。我会先打个折,因为这是官方公告,没有第三方基准或具体的 MSA 成本数字,但架构稀缺性和开源排名已经够上 featured。

6月13日星期六

AI HOT 精选

智谱发了新旗舰 GLM-5.2,主打编程和 1M 上下文,下周开源

GLM-5.2 现在就能用,但只对 Coding Plan 的付费用户开放。模型强调编程能力强,上下文窗口拉到 1M token,也就是一次能塞进整本《三体》的量。API 和对话入口要等到下周,开源也同步,用 MIT 许可证,商用友好。正文没给跑分和具体定价,所以实际编程水平、长文本召回率都还不好说。如果是真的强,下周开源后社区会很快验出来。

推荐理由:智谱放出 GLM-5.2,主打编程能力,上下文拉到 1M token,下周用 MIT 许可证开源。正文没给跑分和定价,实际水平还没法验证,所以分数没给到 85 以上。但国产旗舰更新加开源,信号够强,值得放进 featured。

AI HOT 精选

智谱发布 GLM-5.2,1M 上下文窗口全量开放,下周开源

智谱今晚向 GLM Coding Plan 全量用户推送了 GLM-5.2,覆盖 Lite、Pro、Max 和团队版。这个模型支持 1M 上下文窗口,智谱说在长文本任务上继续领先,并称它是目前最强的国产编程模型。API 下周上线,模型下周会以 MIT 协议开源。

推荐理由:智谱这次发布有三个实打实的点:一是全量推送不墨迹,付费用户今晚就能用;二是 1M 上下文和'最强国产编程模型'的宣称,虽然自卖自夸但下周开源就能验证,不是空头支票;三是 MIT 协议开源,商用友好度拉满。整体判断和之前给的 86 分、featured 级别一致——这是国产旗舰模型的正常发布节奏,没有过度包装,信息密度够高。正文没提具体 benchmark 分数和推理成本,这点先别太激动,等开源后看实测。

AI HOT 精选

MiniMax 把 M3 模型权重放上 HuggingFace,顺带怼了 Anthropic 的出口管制

MiniMax 在 HuggingFace 上放出了 M3 模型的权重,帖子用了一句“M3 would never”,暗讽 Anthropic 的 Fable 5 和 Mythos 5 因为美国出口管制被强制禁用、连外国员工都不能碰。正文没披露 M3 的参数量、跑分成绩和具体开源协议,所以模型到底多大、性能怎么样、能不能商用,这些关键信息都还不清楚。

推荐理由:MiniMax 在 HuggingFace 放出 M3 权重,帖子用了一句暗讽 Anthropic 被出口管制卡脖子的事,冲突和话题性都够。但正文没披露参数量、跑分和协议,模型实力和商用条件全悬着,所以分数只能给到 72。

6月12日星期五

r/LocalLLaMA

MiniMax 开源 M3 模型:428B 总参数,每次推理只激活 23B

MiniMax 在 Hugging Face 上放出了 M3 的权重。这是一个混合专家模型,总参数量约 4280 亿,但每次推理只调用其中约 230 亿参数,相当于用 23B 模型的算力撬动一个超大规模模型的知识。帖子没提训练数据、跑分成绩,也没说本地运行最低要多少显存,想自己部署的话得先做好硬件摸底。

推荐理由:MiniMax 把 M3 的完整权重扔上了 Hugging Face,一个 4280 亿参数的 MoE 模型,每次只叫醒 230 亿参数干活,在开源权重里属于效率很能打的那一档。帖子没给跑分、没提训练数据、也没说本地跑要多少显存,这些信息缺口把分拉下来了一点,但光凭权重公开这件事就值得看一眼。

AI HOT 精选

Kimi 开源了 K2.7-Code 代码模型,内部跑分比上一代高 11% 到 31.5%,推理还省了 30% 的 token

Kimi 把最新的代码模型 K2.7-Code 开源了。跟上一代 K2.6 比,它在自家三个测试集上分数都涨了:Kimi Code Bench v2 涨了 21.8%,Program Bench 涨了 11%,MLS Bench Lite 涨了 31.5%。推理时吐出的 token 量少了 30%,相当于同样的活儿更省算力。长代码任务里,模型更听指令、...

推荐理由:Kimi 开源 K2.7-Code,自家三个基准分数都涨了两位数,推理 token 量还砍了 30%,成本信号很实在。但没给参数量,也没跑外部通用基准,所以分数先打个折,定在 82。国内大模型公司开源代码模型这件事本身就有竞争意义,值得关注。

r/LocalLLaMA

华为发布 openPangu 2.0,6 月 30 日开源:Pro 版总参数 505B 但只激活 18B

华为在 HDC 2026 上发了 openPangu 2.0,两个版本都是稀疏模型,Pro 版总参数 505B、实际干活只激活 18B,Flash 版总参数 92B、激活 6B,稀疏比拉到 28:1。上下文窗口 512K,专门为昇腾芯片做了优化,单卡吞吐量号称是主流开源模型的 2 倍。余承东解释总参数量做这么大,是因为华为把大部分算力分给了其他国内企业...

推荐理由:华为在 HDC 上发了 openPangu 2.0,两个版本都是稀疏模型,Pro 版总参数 505B、激活 18B,Flash 版总参数 92B、激活 6B,上下文窗口 512K,6 月 30 号开源。28:1 的稀疏比是个技术钩子,昇腾单卡 2 倍吞吐的宣称需要独立验证,所以分数没给到 80 以上。余承东说总参数量做这么大是因为华为把大部分算力分给了其他国内企业,这个解释有点意思,但正文没展开讲具体怎么分的。

阮一峰的网络日志

rsync 维护者用 Claude 写代码,社区炸锅了

文件同步工具 rsync 的最新版本被发现是用 Claude 生成的,社区担心这会引入安全漏洞,吵了三百多楼。维护者 Andrew Tridgell 回应说,他年纪大了精力不够,而 AI 发现的漏洞越来越多,他一个人根本修不过来,所以改成“AI 写代码,人写测试”的模式。他认为加上更严格的测试,rsync 反而会更安全。这件事可能预示了未来开源项目的常...

推荐理由:rsync 维护者公开承认用 Claude 写代码,还提出“人写测试,AI 写实现”的新分工,这不是普通的产品更新,而是开源维护方法论的一次公开碰撞。三百多楼的讨论本身就是信号。

AI HOT 精选

Hugging Face 开源了 Open-R1,要完整复现 DeepSeek-R1 的推理能力

Hugging Face 在 GitHub 上发布了 Open-R1 仓库,目标是完全复现 DeepSeek-R1 这个推理模型。目前仓库已经拿到 2.61 万颗星和 2.4k 次复刻,但正文只放了项目首页的导航和元数据,没有公开具体的实现计划、训练数据、复现进度或跑分结果。我会先打个折,把它看作一个公开的复现框架和协作入口,等有技术报告出来再判断还原...

推荐理由:Hugging Face 发起了 DeepSeek-R1 的完整开源复现,仓库星数冲到 2.61 万,社区关注度很高。但正文只搭了个项目框架,没披露具体怎么实现、用什么数据、复现到哪一步了,也没有任何跑分。我先打个折,把它看作一个公开的复现入口和协作框架,等有技术报告或训练细节出来再判断到底还原了多少。

6月11日星期四

机器之心 · 公众号

谷歌开源 26B 文本扩散 MoE 模型 DiffusionGemma,推理时只激活 3.8B 参数,一次生成 256 个 token

谷歌发了一个实验性的开源模型 DiffusionGemma,用的是 Apache 2.0 协议。它不走自回归模型逐 token 生成的路线,而是一次性起草 256 个 token 的文本块,把解码瓶颈从内存带宽转向了计算本身。在单张 H100 上能跑到每秒 1000+ token,比自回归模型快最多 4 倍。模型总规模 26B,但推理时只激活 3.8B...

推荐理由:谷歌开源了一个 26B 的文本扩散模型,跳过自回归解码,推理只激活 3.8B 参数,单张 H100 跑到每秒 1000+ token。Apache 2.0 协议,有具体的速度对比和机制说明,对做推理优化的人有直接参考价值。不是公关稿,数字和做法都给了,值得放进精选。

量子位 · 公众号

谷歌开源扩散文本模型 DiffusionGemma,生成速度比自回归模型快 4 倍

谷歌把生成图片的扩散模型思路搬到了文字生成上,开源了 DiffusionGemma。它不像传统模型那样一个字一个字往外蹦,而是一次铺开 256 个 token 的“画布”,从噪声开始多轮去噪,整段文字同时浮现。在 H100 上跑到每秒 1000+ token,消费级 RTX 5090 上也有 700+,比同规格自回归模型快了约 4 倍。这个 26B 参...

推荐理由:谷歌悄悄开源 DiffusionGemma,把扩散模型那套一次去噪整段文字的路子用在文本生成上,速度数字很漂亮,比同类模型快约 4 倍。我会先打个折——目前只有速度数据,生成质量、实际任务表现都没披露,这点先别太激动。分数没更高就是因为缺这些关键验证。