跳到正文

#开源/仓库

今日 1 条

今天 · 9月30日星期三 · 1 条

昨天 · 9月29日星期二

Hacker News 首页

PostHog 开源 Jeeves:用推理改进 Jev 类决策模型

PostHog 在 GitHub 开源 Jeeves 项目,通过推理能力改进 Jev 类决策模型。仓库包含 drafter、inference、loader、model、prep、sdk 等模块,并附有 calibrate.py、checkpoint.py 等脚本,采用 master 单分支,已获 49 星、7 次 fork。

Hacker News 首页

Jeff:在家用消费级显卡训的 0.8B 决策模型,推理只要 30 毫秒

Jeff 是一组从 Qwen3.5 和 Gemma 4 微调出来的 0.8B 参数小模型,专门做零样本分类——也就是不给例子直接判断类别。亮点是作者说在家用普通显卡上就能训练,推理一次只要 30 毫秒左右,延迟很低,适合塞进实时决策流程。模型兼容 Jev 格式,GitHub 上放了代码和权重。不过正文没披露用了多大训练集、在什么基准上测过,所以实际效果...

AI HOT 精选

GitHub 安全团队用自家开源 AI 安全 Agent 在安卓项目里自动找出 24 个漏洞

GitHub 的安全团队拿安卓开源项目(AOSP)跑了一遍他们开源的 AI 安全 Agent,自动扫出 24 个漏洞,还顺手把补丁交了。这个 Agent 相当于一个能自己看代码、找问题、写修复方案的自动化工具,把以前靠人肉审计的活变成了机器自主跑流程。不过正文没提具体是哪些类型的漏洞,也没说误报率有多高、底层用的是哪个模型。工具代码已经开源,想试的可以...

9月28日星期一

Hacker News 首页

英伟达发布硬件看门狗芯片,能在几毫秒内掐断失控的 AI 代理

英伟达推出了一个叫 Open Agent Safety Platform 的安全方案,分两层:软件层 OpenShell 是开源的,能追踪代理的每一步操作并强制设限;硬件层 Sentry 是一块独立于主芯片的 BlueField-4 参考设计,相当于一个外部裁判,一旦代理越界,能在几毫秒内把它隔离并停掉。这套控制机制不放在模型内部,所以代理没法靠说话或...

推荐理由:英伟达这个方案把代理安全从软件承诺升级成了硬件强制,两层设计讲得清楚,还有两家头部公司背书,HKR 全中。没给更高分是因为目前只有一篇博客报道,没有英伟达官方技术白皮书或实测数据,硬件延迟、误判率、量产成本这些关键信息都还没披露,先打个折。

Hacker News 首页

Imp:把斯坦福DSPy搬到Elixir的BEAM虚拟机上

Imp把斯坦福的DSPy框架完整移植到了Elixir的BEAM虚拟机上。DSPy的核心思路是让你用声明式的方式组合大模型调用,并且能自动优化——说白了就是不用手写prompt模板,而是定义好输入输出和验证规则,框架自己帮你调。Imp把这个模式搬到了Elixir生态里。项目还很新,56个星,25个未关闭issue。如果你用Elixir做LLM应用,可以关...

AI HOT 精选

NVIDIA 开源 OpenShell 0.1.0:给 AI Agent 加一个运行时的权限开关和安全沙箱

NVIDIA 把 OpenShell 0.1.0 开源了,它是一个专门管 AI Agent 能碰哪些系统和数据的运行时。你不用改 Agent 本身的代码,OpenShell 就能在外部拦住不该做的 API 操作、保护密钥,还能用形式化逻辑验证权限有没有越界。它由网关、监督器和沙箱三块组成:网关管 Agent 集群,监督器按策略检查对外请求,沙箱在系统内...

推荐理由:NVIDIA 把 OpenShell 0.1.0 开源了,一个专门给 AI Agent 做权限管控和安全沙箱的运行时。我会先打个折:版本号才 0.1.0,正文没给性能数据,也没提真实部署案例,所以别当成熟方案看。但它的设计思路很实在——网关管 Agent 集群、监督器按策略检查对外请求、沙箱在系统内隔离执行,还用了形式化逻辑来验证权限有没有越界。对正在头疼 Agent 安全的团队来说,这是个值得跟进的信号,只是现在还没法判断实际效果。

AI HOT 精选

NVIDIA 开源了一套智能体安全方案,把监控和隔离直接做进了 CPU 和 DPU 芯片里

NVIDIA 发布了一个开源智能体安全平台,核心思路是不再信任 AI 智能体自己的代码,而是在硬件和系统底层强制做安全检查。平台分两层:OpenShell 跑在 Vera CPU 上,给智能体一个内核级隔离的沙箱运行环境;NVIDIA Sentry 跑在 BlueField-4 DPU(数据处理单元)上,独立于主系统,实时审计智能体的所有活动并执行安全...

推荐理由:NVIDIA 把智能体安全压到芯片级,两层架构讲得清楚,不是画饼。扣分点在于这是 NVIDIA 开发者博客,有推自家 DPU 硬件的动机,目前没有第三方验证或交叉讨论,所以我会先打个折。

9月27日星期日

Computing Life · Share · 鸭哥调研

本周 AI 四事:一次误击的成因链、一份隐私账本、一次开放训练自审计、一个跨站 Cookie

过去七天,四份公开文件把 AI 在不同场合撞上的边界记录了下来。五角大楼内部调查首次将“对算法系统过度依赖”写进伊朗小学误击致死事故的原因链,当时平民伤害缓解团队被裁了九成,Maven 系统在情报七年未更新的情况下把学校推荐成了打击目标。Meta 发布个人代理 Muse,安全白皮书承认目前防不住 Meta 自己,靠的是公司内部规章,真正让官方也无法读取...

推荐理由:这周的四件事都指向同一个问题:AI 系统在真实场景里撞上的边界,比实验室里想象的硬得多。五角大楼那份调查报告把误击小学的链条拆得很清楚——Maven 系统用七年前的旧情报推荐目标,平民伤害缓解团队被裁到只剩十分之一,操作员又过度信任算法输出,三个环节叠在一起出了事。Meta 的 Muse 白皮书更直白,承认端到端加密在技术层面防不住公司自己,目前全靠内部规章挡着,等于把隐私底线押在管理流程上。另外两份材料分别涉及开放训练的审计记录和跨站 Cookie 的追踪链路,都是把平时藏在系统背后的机制摊开来看。整体信息密度高,每一条都有具体的技术细节和制度缺...

Hacker News 首页

Reladraw:一个让你自己摆位置的画图语言

Reladraw 是一个新的画图语言,核心卖点是你手动控制元素位置,而不是让工具自动排版。对于架构图、流程图这类场景,自动布局经常摆得不对,手动拖又很烦,Reladraw 想用代码的方式让你精确控制每个方块放哪。刚发 v0.4.0,GitHub 上 36 个星,项目还非常早期。正文没披露性能基准或支持导出哪些格式,所以实际画大图会不会卡、能不能接进文档...

9月26日星期六

Hacker News 首页

Floci 开源了一套本地云模拟器,24 毫秒冷启动,不用注册、不用密钥

Floci 把 AWS、Azure、GCP 和 OCI 的云服务做成了能在本地跑的独立二进制文件,MIT 协议开源。AWS 模拟器直接占 4566 端口,兼容 LocalStack,覆盖 119 个服务,冷启动 24 毫秒,空闲只吃 13 MiB 内存。Azure 覆盖 28 个服务,GCP 25 个,OCI 8 个。项目明确冲着 LocalStack...

AI 群聊日报

OpenAI 代码实锤 Pro Max 定价,Astra 3D 打印全链路跑通但手机架翻车

OpenAI Codex 仓库代码直接曝光了 Pro Max 档位,月费 600 美元(税前底价 500),和已有的 Lite(100 刀)、Pro(200 刀)凑齐三档,核心卖点是速度而非额度。下周二 DevDay 大概率官宣,群里还抓到一个未公开的模型名 gpt-6.1-astra-max。另一边,Astra 的 3D 打印能力被多人验证:从口头描...

推荐理由:代码提交记录实锤了 Pro Max 档位和定价,不是传闻,所以重要性给到 78。但来源是群聊日报,不是官方公告,分数没往上拉。三档定价和未公开模型名对从业者来说信息量够大,DevDay 倒计时又增加了紧迫感,所以给了 featured。Astra 的 3D 打印验证是加分项,但主菜还是定价泄露。

量子位 · 公众号

笔记本跑7000亿参数GLM:没显卡也行,把SSD当显存用

一个GitHub项目火了:在没GPU的笔记本上跑700亿参数的GLM模型。办法是把SSD当显存用,用存储换速度。正文没披露具体延迟和精度损失,但思路很直接——内存不够硬盘凑。对没显卡的开发者来说,是个低成本试大模型的办法。

Hacker News 首页

Typst 0.15 发布:支持可变字体、MathML 导出和打包输出

Typst 0.15 正式支持可变字体,一个字体文件就能包含所有粗细和样式,省空间也灵活。数学公式现在可以导出为 MathML,浏览器原生就能渲染出 TeX 级别的公式,不用再挂 JavaScript 库或图片。新增的打包功能允许从一个源文件同时输出 PDF、SVG、HTML 等多种格式,还能共享数据和跨文档链接——很适合做网站,或者一篇论文同时生成文...

Hacker News 首页

Jevmem:给 Claude Code 装上自动项目记忆,不用每次重复上下文

Jevmem 是一个开源工具,能让 Claude Code 记住项目上下文,下次打开会话不用再重复说一遍。它也兼容 Cursor 和 Codex。原理是基于另一个项目 Jev 做的,但具体怎么存、怎么取、性能开销多大,正文没披露。目前 GitHub 上 39 颗星,还比较早期,如果是真的能省掉每次手动贴上下文的时间,对用 Claude Code 写代码...

9月25日星期五

Hacker News 首页

把 Bug 追踪器塞进 Git 仓库,离线也能用

Git-bug 把 bug 追踪器直接嵌进 Git 仓库里,bug 存成 Git 对象,不需要任何云服务。离线也能用,同步靠 push/pull。HN 上 42 个点赞、7 条评论,说明关注度还行,但正文没披露版本号或性能数据,实际用起来稳不稳、快不快还不清楚。适合不想依赖第三方平台、又习惯 Git 工作流的团队。

Hacker News 首页

荷兰政府用 NixOS 自建办公系统,想彻底甩掉微软

荷兰政府上线了 DAWO 社区,目标是用开源模块拼出一套数字办公环境,替代微软全家桶。每个组件——操作系统、云、协作工具、AI——都可替换、可审查,代码已经挂在 code.overheid.nl 上。目前没有公布部署时间表和预算,所以还处于“先搭架子”的阶段。如果真能落地,政府 IT 不再被一家供应商绑死,安全性和可审计性都会好很多。

Hacker News 首页

DHH 在 Rails World 2026 上宣布:Hey 将离开 Rails,用 Rust 和 LLM 重写原生应用

DHH 在 Rails World 2026 的开场演讲里说自己已经从专业程序员退休,现在是个“maker”。他认为英语是最好的编程语言,手写代码对大多数程序员来说已经不再划算。37signals 正在用 LLM 把 Hey 重写成六个原生客户端,后端换成 Rust——他说 Rust 对人类很丑,但对 LLM 很友好。他八月写了 15 万行代码,Rub...

推荐理由:DHH 在 Rails World 2026 的开场演讲几乎没怎么谈 Rails 本身,反而抛出了一堆有数字、有产品决策支撑的挑衅性判断。文章是二手转述,不是完整演讲实录,Rails 路线图细节也偏少,所以没给更高分。但“退休声明”加“手写代码不划算”加“用 LLM 重写 Hey”这三件事放在一起,对 AI 从业者来说是个很具体的信号——一个顶级程序员在用自己的产品和行动投票。

Product Hunt · AI

Once UI 2.0:开源设计系统,同时服务人类开发者和AI编码代理

Once UI 2.0 是一个开源的设计系统,帮你用 React 搭出一致的前端界面。新版专门给 AI 编码代理(比如 Claude Code)加了组件目录、紧凑规则和任务指南,让 AI 能按规范写代码,而不是瞎猜。对人类开发者来说,API 保持可预测,上手不费劲。正文没披露定价或许可证细节,但开源项目通常可以免费自用。如果你团队在用 AI 写前端代码...

Hacker News 首页

LaunchVideo 用 Opus 5.5 把链接或一句话变成产品解说视频,不用视频生成模型

LaunchVideo 的做法是:你给它一个网址或一段文字描述,Opus 5.5 直接写 HTML、CSS 和动画脚本,然后一个无头 Chromium 微虚拟机逐帧渲染成 1080p 30fps 的 MP4。整个过程没有用到视频生成模型,靠的是把页面里的时钟(requestAnimationFrame、Date、CSS 动画等)替换成虚拟时钟,保证每一...

推荐理由:把 Opus 5.5 的写代码能力包装成“贴链接出视频”的工具,管线解释得清楚,例子也看得见,H 和 K 都打中了。但产品本身还轻,R 偏弱,分数刚好卡在 featured 门槛上。

9月23日星期三

Hacker News 首页

RxFilm Studio:一个 AI 导演帮你搞定产品视频的配乐、配音、字幕和渲染

RxFilm Studio 是一个 macOS 原生应用,把产品视频制作的全流程塞进一个窗口。AI 代理充当“导演”,负责生成配乐(用的 Lyria,但正文没说是哪个模型)、多角色配音、自动字幕(支持翻译,可导出 VTT/SRT)、静态图片,最后通过 Remotion 输出 4K 60fps 视频。每次编辑都会先提方案让你审核。1.9.0 版免费,仅支...

Hacker News 首页

Jevper:给任意 OpenAI 兼容模型套个壳,让它输出分类概率和置信度

Jevper 是一个轻量封装,让任何兼容 OpenAI 接口的模型输出分类概率和置信度分数,而不是直接吐文字。它复刻了 Jev 的“TypeSafe System One”接口,把生成模型当分类器用。项目没给基准测试或生产案例,但思路很直接:用概率做决策,而不是靠模型自己写答案。如果你需要模型在几个固定类别里做选择,并且想知道它有多确定,这个工具能省掉...

AI HOT 精选

蚂蚁开源两个6B模型,一个做设计图生成,一个做图层编辑

蚂蚁开源了 Ming-Image-0.1-Design 系列,包含两个 6B 参数模型,分别负责设计图生成和图层编辑。6B 参数属于中等规模,比动辄几十B的大模型更轻量,部署成本低。但原文页面被拦截,正文没披露模型架构、训练数据、评测指标,也没说跟现有方案比效果如何。目前能确认的是:开源、两个模型、覆盖从生成到编辑的流程。具体能不能打,得等代码和权重放...

9月22日星期二

AI HOT 精选

Qwen-Image-2.1 开源,图像编辑榜排开源第一,总分只比 GPT-Image-1.5 高保真版低 3 分

通义千问把 Qwen-Image-2.1 的权重放出来了。在 Arena 的图像编辑榜上拿了 1367 分,开源模型里排第一,总榜第 16。这个分数离第 15 名的 GPT-Image-1.5-high-fidelity 只差 3 分,差距很小。文生图榜也拿了开源第一。正文没提参数量、具体架构和用的什么开源协议,这些关键信息得等后续披露。

推荐理由:Qwen-Image-2.1 权重放出来了,Arena 图像编辑榜开源第一、总榜第 16,离 GPT-Image-1.5 高保真版就差 3 分,文生图榜也是开源第一。分数没给更高是因为正文没提参数量、架构和开源协议,我们只能按榜单成绩打分——光看这个分差,确实值得关注。

NVIDIA 博客

NVIDIA 发布 Isaac ROS 5.0:让机器人更像“智能体”,代码开源

NVIDIA 推出了 Isaac ROS 5.0,重点是把机器人往“智能体”方向推——也就是让机器人能自己感知环境、做规划,而不是死板地执行固定指令。这次更新改进了视觉感知和路径规划模块,并且把更多代码开源了,方便社区参与。不过正文没披露具体的性能提升数据,也没说需要什么硬件配置,所以实际效果要等跑起来才知道。

Hacker News 首页

Tim Dettmers 实验室开源周:在你自己的硬件上跑前沿 AI

Tim Dettmers 的 dlab 这周会开源一整套工具,目标是让前沿 AI 能在本地硬件上跑起来。他们放出了一个能自己优化 Metal 内核的智能体,把 Qwen 3.6 35B-A3B 模型压到每个权重只占 1.5 比特,在 Mac 上跑出了每秒 450 个 token 的速度。核心观点是,现在做研究的基本单位不再是单篇论文,而是一套能互相配合...

推荐理由:Tim Dettmers 在量化领域是核心人物,这次不是发论文而是直接甩工具链,数字也具体(1.5 比特、450 tok/s),可复现路径摆出来了。我会先打个折:目前只是博客预告,实际兼容性和稳定性要等代码放出来才知道,但信息量和话题性都够上 featured。

Hacker News 首页

Foremerge 在代码冲突发生前,先检查多个 AI 编程助手的修改意图有没有打架

Foremerge 是一个架在 Git 上的开源协调协议,专门解决多个 AI 编程助手并行干活时“逻辑打架”的问题。它不是处理代码合并冲突,而是提前发现两个助手改了不同文件、但逻辑上互相矛盾的情况。做法是让助手在动手写代码前,先在意图文件里声明自己要改什么、为什么改,协议先比对意图,再合并代码。项目目前还在早期阶段,正文没披露具体支持哪些助手框架,也没...

9月21日星期一

Hacker News 首页

Lossless-memory:一个号称“永不总结”的个人AI记忆项目

这个开源项目承诺AI能记住每一次对话的每个细节,不做任何摘要。但正文没披露具体怎么实现、存储成本多高、检索延迟多大。目前只是一个GitHub仓库,在Hacker News上只有8个点赞、0条评论。对需要完美回忆的用户有吸引力,但可行性先打个折。

Hacker News 首页

Kev:一个超小型的决策模型,跑在Qwen3.5上,类似Jev

Jared Palmer 开源了 Kev,一组基于 Qwen3.5 的小型决策模型,思路跟 Jev 差不多。正文没披露参数量、训练数据和跑分,社区还在观望(29 票 14 条评论)。如果真能做到小模型快速做决策,成本会很低,但验证还不够,先别太激动。

Hacker News 首页

Google 开源了 AX,一个能管几十亿个 AI 任务不卡顿的调度器

AX 是 Google 刚开源的 AI 任务调度器,代码在 GitHub 上,用 Apache 2.0 协议。它把 AI 干活需要的沙盒环境、代码仓库、网络权限和模型配置,抽象成四种声明式的配置项,你写个 YAML 文件它就能自动把环境搭好。底层靠一个叫 Agent Substrate 的运行时撑着,用轻量级的“演员”模型来跑任务:AI 在等模型回复或...

推荐理由:Google 开源了一个 agent 调度器,用声明式 YAML 管沙盒、代码仓库和网络规则,底层是轻量 actor 运行时。对搭 agent 基础设施的人直接有用,三个维度都踩中了。没给更高分是因为刚开源,正文没披露生产环境的规模验证和实际故障恢复表现,这点先别太激动。

9月20日星期日

Hacker News 首页

AI 正在撕毁开源世界四十年的社会契约

Chester Wisniewski 这篇文章的核心判断是:大语言模型在网上无差别抓取内容,完全无视版权和许可证,直接打破了开源社区运转了 40 年的平衡。作者认为,现在公开分享代码反而成了给自己找麻烦的事。他列出了三个很现实的风险:第一,公开的代码会被 AI 用来更高效地找漏洞,等于自己给攻击者递刀;第二,GitHub 这类公开仓库会被 AI 生成的...

AI HOT 精选

阶跃星辰旗舰模型 Step 5 Preview 发布,10月15日开源权重

阶跃星辰发布了旗舰模型 Step 5 Preview,并计划在10月15日开源模型权重。不过原文页面被拦截,正文没披露模型参数量、性能指标或开源范围,所以目前能确认的只有发布时间和开源日期。开源权重意味着开发者可以下载模型自己跑,不用走API,这对想微调或部署私有模型的团队是个好消息。但具体效果如何、能不能打,得等开源后实测才知道。

Simon Willison

datasette-explain 0.2.2 发布

Simon Willison 发布 datasette-explain 0.2.2。该版本与 SQLite 和 Datasette 相关,具体更新内容原文未作说明。

9月19日星期六

Hacker News 首页

PlanetScale 发布 TIN:给 Postgres 用的全文搜索插件

PlanetScale 把 TIN 正式推成 GA 了,这是一个给 Postgres 用的全文搜索扩展。它支持布尔、短语、模糊和正则匹配,并且在并发写入时能正确处理 MVCC 可见性。文章用 1.5 亿条 Stack Exchange 数据跑了基准测试,给了索引构建时间和混合查询延迟,但没直接跟现有的 Postgres 全文搜索方案做横向对比,这点先别...

Hacker News 首页

科学就是开源软件

作者认为现代计算科学本质上就是开源软件。科学需要可检验、可系统化的结果,而软件正是我们编码和分享预测模型的方式。如果软件不开放、不可修改,结果就无法复现,科学也就失效了。愿景是:每项成果都能即时复现,科学软件像维基百科一样由社区维护。

Computing Life · Share · 鸭哥调研

更好的替代品早已存在,Jev 留给研究的只剩时机

TypeSafe 刚推出的 Jev 是一个只输出概率分布、不生成文字的判断接口,专门在智能体工作流里做快速分类。社区实测发现,用开源小模型直接读 logits 的方案,判断质量只差不到 4 个百分点,但延迟从 178 毫秒降到 71 毫秒,输出还是确定性的,而且完全免费。这种把判断拆出来单独卖的想法并不新鲜,从 2017 年 Perspective A...

推荐理由:这是一篇社区实测对比,用延迟和质量数据把 Jev 和开源读 logits 的方案摆在一起,结论偏向已有方案,新闻性不如首发产品,但工程参考价值够硬。

r/LocalLLaMA

Tool-Prune:0.4ms 从 50+ 工具里筛出候选,省 92% 提示词

一个叫 Tool-Prune 的小工具,能把 50 多个工具的定义(schema)快速过滤到只剩几个候选,只花 0.4 毫秒,省掉 92% 的提示词 token,而且零依赖。对需要给模型挂一堆工具的开发者来说,能明显缩短输入长度、省成本。不过 Reddit 正文被屏蔽了,没披露具体怎么剪枝的、测试环境是什么,所以算法可靠性和泛化能力暂时没法判断。

9月18日星期五

Hacker News 首页

ZCode 编程助手会悄悄上传你的整个 Git 历史,解密密钥只在 Z.ai 手里

开发者 ferstar 逆向分析了 Z.ai 的桌面编程助手 ZCode,发现只要登录,它就会把整个工作区——包括完整的 .git 历史、LFS 缓存、reflog 和全局配置——打包加密,然后传到阿里云 OSS。一个 345MB 的商业项目被压成了 313MB 的加密包,其中 .git 目录占了 86.6%。更关键的是加密方式:它用信封加密,对称密钥...

推荐理由:这是一次有实锤证据的安全披露,不是猜测。逆向分析把上传内容、加密方式和密钥归属都讲清楚了,对用 AI 编程助手的人来说是直接的风险警报。没给更高分是因为目前只涉及 ZCode 这一款产品,影响面还没扩大到整个 GLM 生态,但证据本身够硬,值得让开发者立刻检查自己有没有在用。