TurboGPT:用 CUDA C++ 在 13 秒内训练 22KiB Transformer
TurboGPT 是一个用 CUDA C++ 实现的字节级微型 GPT 训练项目,采用 MIT 协议,可在 13 秒内训练 22KiB 的 Transformer。
TurboGPT 是一个用 CUDA C++ 实现的字节级微型 GPT 训练项目,采用 MIT 协议,可在 13 秒内训练 22KiB 的 Transformer。
PostHog 在 GitHub 开源 Jeeves 项目,通过推理能力改进 Jev 类决策模型。仓库包含 drafter、inference、loader、model、prep、sdk 等模块,并附有 calibrate.py、checkpoint.py 等脚本,采用 master 单分支,已获 49 星、7 次 fork。
Jeff 是一组从 Qwen3.5 和 Gemma 4 微调出来的 0.8B 参数小模型,专门做零样本分类——也就是不给例子直接判断类别。亮点是作者说在家用普通显卡上就能训练,推理一次只要 30 毫秒左右,延迟很低,适合塞进实时决策流程。模型兼容 Jev 格式,GitHub 上放了代码和权重。不过正文没披露用了多大训练集、在什么基准上测过,所以实际效果...
GitHub 的安全团队拿安卓开源项目(AOSP)跑了一遍他们开源的 AI 安全 Agent,自动扫出 24 个漏洞,还顺手把补丁交了。这个 Agent 相当于一个能自己看代码、找问题、写修复方案的自动化工具,把以前靠人肉审计的活变成了机器自主跑流程。不过正文没提具体是哪些类型的漏洞,也没说误报率有多高、底层用的是哪个模型。工具代码已经开源,想试的可以...
英伟达推出了一个叫 Open Agent Safety Platform 的安全方案,分两层:软件层 OpenShell 是开源的,能追踪代理的每一步操作并强制设限;硬件层 Sentry 是一块独立于主芯片的 BlueField-4 参考设计,相当于一个外部裁判,一旦代理越界,能在几毫秒内把它隔离并停掉。这套控制机制不放在模型内部,所以代理没法靠说话或...
推荐理由:英伟达这个方案把代理安全从软件承诺升级成了硬件强制,两层设计讲得清楚,还有两家头部公司背书,HKR 全中。没给更高分是因为目前只有一篇博客报道,没有英伟达官方技术白皮书或实测数据,硬件延迟、误判率、量产成本这些关键信息都还没披露,先打个折。
Imp把斯坦福的DSPy框架完整移植到了Elixir的BEAM虚拟机上。DSPy的核心思路是让你用声明式的方式组合大模型调用,并且能自动优化——说白了就是不用手写prompt模板,而是定义好输入输出和验证规则,框架自己帮你调。Imp把这个模式搬到了Elixir生态里。项目还很新,56个星,25个未关闭issue。如果你用Elixir做LLM应用,可以关...
NVIDIA 把 OpenShell 0.1.0 开源了,它是一个专门管 AI Agent 能碰哪些系统和数据的运行时。你不用改 Agent 本身的代码,OpenShell 就能在外部拦住不该做的 API 操作、保护密钥,还能用形式化逻辑验证权限有没有越界。它由网关、监督器和沙箱三块组成:网关管 Agent 集群,监督器按策略检查对外请求,沙箱在系统内...
推荐理由:NVIDIA 把 OpenShell 0.1.0 开源了,一个专门给 AI Agent 做权限管控和安全沙箱的运行时。我会先打个折:版本号才 0.1.0,正文没给性能数据,也没提真实部署案例,所以别当成熟方案看。但它的设计思路很实在——网关管 Agent 集群、监督器按策略检查对外请求、沙箱在系统内隔离执行,还用了形式化逻辑来验证权限有没有越界。对正在头疼 Agent 安全的团队来说,这是个值得跟进的信号,只是现在还没法判断实际效果。
NVIDIA 发布了一个开源智能体安全平台,核心思路是不再信任 AI 智能体自己的代码,而是在硬件和系统底层强制做安全检查。平台分两层:OpenShell 跑在 Vera CPU 上,给智能体一个内核级隔离的沙箱运行环境;NVIDIA Sentry 跑在 BlueField-4 DPU(数据处理单元)上,独立于主系统,实时审计智能体的所有活动并执行安全...
推荐理由:NVIDIA 把智能体安全压到芯片级,两层架构讲得清楚,不是画饼。扣分点在于这是 NVIDIA 开发者博客,有推自家 DPU 硬件的动机,目前没有第三方验证或交叉讨论,所以我会先打个折。
过去七天,四份公开文件把 AI 在不同场合撞上的边界记录了下来。五角大楼内部调查首次将“对算法系统过度依赖”写进伊朗小学误击致死事故的原因链,当时平民伤害缓解团队被裁了九成,Maven 系统在情报七年未更新的情况下把学校推荐成了打击目标。Meta 发布个人代理 Muse,安全白皮书承认目前防不住 Meta 自己,靠的是公司内部规章,真正让官方也无法读取...
推荐理由:这周的四件事都指向同一个问题:AI 系统在真实场景里撞上的边界,比实验室里想象的硬得多。五角大楼那份调查报告把误击小学的链条拆得很清楚——Maven 系统用七年前的旧情报推荐目标,平民伤害缓解团队被裁到只剩十分之一,操作员又过度信任算法输出,三个环节叠在一起出了事。Meta 的 Muse 白皮书更直白,承认端到端加密在技术层面防不住公司自己,目前全靠内部规章挡着,等于把隐私底线押在管理流程上。另外两份材料分别涉及开放训练的审计记录和跨站 Cookie 的追踪链路,都是把平时藏在系统背后的机制摊开来看。整体信息密度高,每一条都有具体的技术细节和制度缺...
Reladraw 是一个新的画图语言,核心卖点是你手动控制元素位置,而不是让工具自动排版。对于架构图、流程图这类场景,自动布局经常摆得不对,手动拖又很烦,Reladraw 想用代码的方式让你精确控制每个方块放哪。刚发 v0.4.0,GitHub 上 36 个星,项目还非常早期。正文没披露性能基准或支持导出哪些格式,所以实际画大图会不会卡、能不能接进文档...
Floci 把 AWS、Azure、GCP 和 OCI 的云服务做成了能在本地跑的独立二进制文件,MIT 协议开源。AWS 模拟器直接占 4566 端口,兼容 LocalStack,覆盖 119 个服务,冷启动 24 毫秒,空闲只吃 13 MiB 内存。Azure 覆盖 28 个服务,GCP 25 个,OCI 8 个。项目明确冲着 LocalStack...
OpenAI Codex 仓库代码直接曝光了 Pro Max 档位,月费 600 美元(税前底价 500),和已有的 Lite(100 刀)、Pro(200 刀)凑齐三档,核心卖点是速度而非额度。下周二 DevDay 大概率官宣,群里还抓到一个未公开的模型名 gpt-6.1-astra-max。另一边,Astra 的 3D 打印能力被多人验证:从口头描...
推荐理由:代码提交记录实锤了 Pro Max 档位和定价,不是传闻,所以重要性给到 78。但来源是群聊日报,不是官方公告,分数没往上拉。三档定价和未公开模型名对从业者来说信息量够大,DevDay 倒计时又增加了紧迫感,所以给了 featured。Astra 的 3D 打印验证是加分项,但主菜还是定价泄露。
一个GitHub项目火了:在没GPU的笔记本上跑700亿参数的GLM模型。办法是把SSD当显存用,用存储换速度。正文没披露具体延迟和精度损失,但思路很直接——内存不够硬盘凑。对没显卡的开发者来说,是个低成本试大模型的办法。
Typst 0.15 正式支持可变字体,一个字体文件就能包含所有粗细和样式,省空间也灵活。数学公式现在可以导出为 MathML,浏览器原生就能渲染出 TeX 级别的公式,不用再挂 JavaScript 库或图片。新增的打包功能允许从一个源文件同时输出 PDF、SVG、HTML 等多种格式,还能共享数据和跨文档链接——很适合做网站,或者一篇论文同时生成文...
Jevmem 是一个开源工具,能让 Claude Code 记住项目上下文,下次打开会话不用再重复说一遍。它也兼容 Cursor 和 Codex。原理是基于另一个项目 Jev 做的,但具体怎么存、怎么取、性能开销多大,正文没披露。目前 GitHub 上 39 颗星,还比较早期,如果是真的能省掉每次手动贴上下文的时间,对用 Claude Code 写代码...
Git-bug 把 bug 追踪器直接嵌进 Git 仓库里,bug 存成 Git 对象,不需要任何云服务。离线也能用,同步靠 push/pull。HN 上 42 个点赞、7 条评论,说明关注度还行,但正文没披露版本号或性能数据,实际用起来稳不稳、快不快还不清楚。适合不想依赖第三方平台、又习惯 Git 工作流的团队。
荷兰政府上线了 DAWO 社区,目标是用开源模块拼出一套数字办公环境,替代微软全家桶。每个组件——操作系统、云、协作工具、AI——都可替换、可审查,代码已经挂在 code.overheid.nl 上。目前没有公布部署时间表和预算,所以还处于“先搭架子”的阶段。如果真能落地,政府 IT 不再被一家供应商绑死,安全性和可审计性都会好很多。
DHH 在 Rails World 2026 的开场演讲里说自己已经从专业程序员退休,现在是个“maker”。他认为英语是最好的编程语言,手写代码对大多数程序员来说已经不再划算。37signals 正在用 LLM 把 Hey 重写成六个原生客户端,后端换成 Rust——他说 Rust 对人类很丑,但对 LLM 很友好。他八月写了 15 万行代码,Rub...
推荐理由:DHH 在 Rails World 2026 的开场演讲几乎没怎么谈 Rails 本身,反而抛出了一堆有数字、有产品决策支撑的挑衅性判断。文章是二手转述,不是完整演讲实录,Rails 路线图细节也偏少,所以没给更高分。但“退休声明”加“手写代码不划算”加“用 LLM 重写 Hey”这三件事放在一起,对 AI 从业者来说是个很具体的信号——一个顶级程序员在用自己的产品和行动投票。
Once UI 2.0 是一个开源的设计系统,帮你用 React 搭出一致的前端界面。新版专门给 AI 编码代理(比如 Claude Code)加了组件目录、紧凑规则和任务指南,让 AI 能按规范写代码,而不是瞎猜。对人类开发者来说,API 保持可预测,上手不费劲。正文没披露定价或许可证细节,但开源项目通常可以免费自用。如果你团队在用 AI 写前端代码...
LaunchVideo 的做法是:你给它一个网址或一段文字描述,Opus 5.5 直接写 HTML、CSS 和动画脚本,然后一个无头 Chromium 微虚拟机逐帧渲染成 1080p 30fps 的 MP4。整个过程没有用到视频生成模型,靠的是把页面里的时钟(requestAnimationFrame、Date、CSS 动画等)替换成虚拟时钟,保证每一...
推荐理由:把 Opus 5.5 的写代码能力包装成“贴链接出视频”的工具,管线解释得清楚,例子也看得见,H 和 K 都打中了。但产品本身还轻,R 偏弱,分数刚好卡在 featured 门槛上。
Simon Willison 发布 commit-rewriter 0.2。该工具与 git 相关,具体功能与更新细节原文未作说明。
RxFilm Studio 是一个 macOS 原生应用,把产品视频制作的全流程塞进一个窗口。AI 代理充当“导演”,负责生成配乐(用的 Lyria,但正文没说是哪个模型)、多角色配音、自动字幕(支持翻译,可导出 VTT/SRT)、静态图片,最后通过 Remotion 输出 4K 60fps 视频。每次编辑都会先提方案让你审核。1.9.0 版免费,仅支...
Jevper 是一个轻量封装,让任何兼容 OpenAI 接口的模型输出分类概率和置信度分数,而不是直接吐文字。它复刻了 Jev 的“TypeSafe System One”接口,把生成模型当分类器用。项目没给基准测试或生产案例,但思路很直接:用概率做决策,而不是靠模型自己写答案。如果你需要模型在几个固定类别里做选择,并且想知道它有多确定,这个工具能省掉...
蚂蚁开源了 Ming-Image-0.1-Design 系列,包含两个 6B 参数模型,分别负责设计图生成和图层编辑。6B 参数属于中等规模,比动辄几十B的大模型更轻量,部署成本低。但原文页面被拦截,正文没披露模型架构、训练数据、评测指标,也没说跟现有方案比效果如何。目前能确认的是:开源、两个模型、覆盖从生成到编辑的流程。具体能不能打,得等代码和权重放...
通义千问把 Qwen-Image-2.1 的权重放出来了。在 Arena 的图像编辑榜上拿了 1367 分,开源模型里排第一,总榜第 16。这个分数离第 15 名的 GPT-Image-1.5-high-fidelity 只差 3 分,差距很小。文生图榜也拿了开源第一。正文没提参数量、具体架构和用的什么开源协议,这些关键信息得等后续披露。
推荐理由:Qwen-Image-2.1 权重放出来了,Arena 图像编辑榜开源第一、总榜第 16,离 GPT-Image-1.5 高保真版就差 3 分,文生图榜也是开源第一。分数没给更高是因为正文没提参数量、架构和开源协议,我们只能按榜单成绩打分——光看这个分差,确实值得关注。
NVIDIA 推出了 Isaac ROS 5.0,重点是把机器人往“智能体”方向推——也就是让机器人能自己感知环境、做规划,而不是死板地执行固定指令。这次更新改进了视觉感知和路径规划模块,并且把更多代码开源了,方便社区参与。不过正文没披露具体的性能提升数据,也没说需要什么硬件配置,所以实际效果要等跑起来才知道。
oMLX 的作者 Jun Kim 加入 Hugging Face,专职支持 MLX 社区。oMLX 是苹果 MLX 框架的扩展库,能让大模型在 Mac 上跑得更高效。正文没披露具体合作细节或后续计划。
Tim Dettmers 的 dlab 这周会开源一整套工具,目标是让前沿 AI 能在本地硬件上跑起来。他们放出了一个能自己优化 Metal 内核的智能体,把 Qwen 3.6 35B-A3B 模型压到每个权重只占 1.5 比特,在 Mac 上跑出了每秒 450 个 token 的速度。核心观点是,现在做研究的基本单位不再是单篇论文,而是一套能互相配合...
推荐理由:Tim Dettmers 在量化领域是核心人物,这次不是发论文而是直接甩工具链,数字也具体(1.5 比特、450 tok/s),可复现路径摆出来了。我会先打个折:目前只是博客预告,实际兼容性和稳定性要等代码放出来才知道,但信息量和话题性都够上 featured。
Foremerge 是一个架在 Git 上的开源协调协议,专门解决多个 AI 编程助手并行干活时“逻辑打架”的问题。它不是处理代码合并冲突,而是提前发现两个助手改了不同文件、但逻辑上互相矛盾的情况。做法是让助手在动手写代码前,先在意图文件里声明自己要改什么、为什么改,协议先比对意图,再合并代码。项目目前还在早期阶段,正文没披露具体支持哪些助手框架,也没...
这个开源项目承诺AI能记住每一次对话的每个细节,不做任何摘要。但正文没披露具体怎么实现、存储成本多高、检索延迟多大。目前只是一个GitHub仓库,在Hacker News上只有8个点赞、0条评论。对需要完美回忆的用户有吸引力,但可行性先打个折。
Jared Palmer 开源了 Kev,一组基于 Qwen3.5 的小型决策模型,思路跟 Jev 差不多。正文没披露参数量、训练数据和跑分,社区还在观望(29 票 14 条评论)。如果真能做到小模型快速做决策,成本会很低,但验证还不够,先别太激动。
AX 是 Google 刚开源的 AI 任务调度器,代码在 GitHub 上,用 Apache 2.0 协议。它把 AI 干活需要的沙盒环境、代码仓库、网络权限和模型配置,抽象成四种声明式的配置项,你写个 YAML 文件它就能自动把环境搭好。底层靠一个叫 Agent Substrate 的运行时撑着,用轻量级的“演员”模型来跑任务:AI 在等模型回复或...
推荐理由:Google 开源了一个 agent 调度器,用声明式 YAML 管沙盒、代码仓库和网络规则,底层是轻量 actor 运行时。对搭 agent 基础设施的人直接有用,三个维度都踩中了。没给更高分是因为刚开源,正文没披露生产环境的规模验证和实际故障恢复表现,这点先别太激动。
Chester Wisniewski 这篇文章的核心判断是:大语言模型在网上无差别抓取内容,完全无视版权和许可证,直接打破了开源社区运转了 40 年的平衡。作者认为,现在公开分享代码反而成了给自己找麻烦的事。他列出了三个很现实的风险:第一,公开的代码会被 AI 用来更高效地找漏洞,等于自己给攻击者递刀;第二,GitHub 这类公开仓库会被 AI 生成的...
阶跃星辰发布了旗舰模型 Step 5 Preview,并计划在10月15日开源模型权重。不过原文页面被拦截,正文没披露模型参数量、性能指标或开源范围,所以目前能确认的只有发布时间和开源日期。开源权重意味着开发者可以下载模型自己跑,不用走API,这对想微调或部署私有模型的团队是个好消息。但具体效果如何、能不能打,得等开源后实测才知道。
Simon Willison 发布 datasette-explain 0.2.2。该版本与 SQLite 和 Datasette 相关,具体更新内容原文未作说明。
PlanetScale 把 TIN 正式推成 GA 了,这是一个给 Postgres 用的全文搜索扩展。它支持布尔、短语、模糊和正则匹配,并且在并发写入时能正确处理 MVCC 可见性。文章用 1.5 亿条 Stack Exchange 数据跑了基准测试,给了索引构建时间和混合查询延迟,但没直接跟现有的 Postgres 全文搜索方案做横向对比,这点先别...
作者认为现代计算科学本质上就是开源软件。科学需要可检验、可系统化的结果,而软件正是我们编码和分享预测模型的方式。如果软件不开放、不可修改,结果就无法复现,科学也就失效了。愿景是:每项成果都能即时复现,科学软件像维基百科一样由社区维护。
TypeSafe 刚推出的 Jev 是一个只输出概率分布、不生成文字的判断接口,专门在智能体工作流里做快速分类。社区实测发现,用开源小模型直接读 logits 的方案,判断质量只差不到 4 个百分点,但延迟从 178 毫秒降到 71 毫秒,输出还是确定性的,而且完全免费。这种把判断拆出来单独卖的想法并不新鲜,从 2017 年 Perspective A...
推荐理由:这是一篇社区实测对比,用延迟和质量数据把 Jev 和开源读 logits 的方案摆在一起,结论偏向已有方案,新闻性不如首发产品,但工程参考价值够硬。
一个叫 Tool-Prune 的小工具,能把 50 多个工具的定义(schema)快速过滤到只剩几个候选,只花 0.4 毫秒,省掉 92% 的提示词 token,而且零依赖。对需要给模型挂一堆工具的开发者来说,能明显缩短输入长度、省成本。不过 Reddit 正文被屏蔽了,没披露具体怎么剪枝的、测试环境是什么,所以算法可靠性和泛化能力暂时没法判断。
开发者 ferstar 逆向分析了 Z.ai 的桌面编程助手 ZCode,发现只要登录,它就会把整个工作区——包括完整的 .git 历史、LFS 缓存、reflog 和全局配置——打包加密,然后传到阿里云 OSS。一个 345MB 的商业项目被压成了 313MB 的加密包,其中 .git 目录占了 86.6%。更关键的是加密方式:它用信封加密,对称密钥...
推荐理由:这是一次有实锤证据的安全披露,不是猜测。逆向分析把上传内容、加密方式和密钥归属都讲清楚了,对用 AI 编程助手的人来说是直接的风险警报。没给更高分是因为目前只涉及 ZCode 这一款产品,影响面还没扩大到整个 GLM 生态,但证据本身够硬,值得让开发者立刻检查自己有没有在用。