PostHog 开源 Jeeves:用推理改进 Jev 类决策模型
PostHog 在 GitHub 开源 Jeeves 项目,通过推理能力改进 Jev 类决策模型。仓库包含 drafter、inference、loader、model、prep、sdk 等模块,并附有 calibrate.py、checkpoint.py 等脚本,采用 master 单分支,已获 49 星、7 次 fork。
PostHog 在 GitHub 开源 Jeeves 项目,通过推理能力改进 Jev 类决策模型。仓库包含 drafter、inference、loader、model、prep、sdk 等模块,并附有 calibrate.py、checkpoint.py 等脚本,采用 master 单分支,已获 49 星、7 次 fork。
Jeff 是一组从 Qwen3.5 和 Gemma 4 微调出来的 0.8B 参数小模型,专门做零样本分类——也就是不给例子直接判断类别。亮点是作者说在家用普通显卡上就能训练,推理一次只要 30 毫秒左右,延迟很低,适合塞进实时决策流程。模型兼容 Jev 格式,GitHub 上放了代码和权重。不过正文没披露用了多大训练集、在什么基准上测过,所以实际效果...
有人在Reddit发帖,说自己用WhatsApp群聊记录微调了一个2B参数的小模型,并且把完整流程做成了GitHub cookbook开源。正文被Reddit屏蔽了,所以看不到基座模型、训练成本、效果评测这些关键信息。2B模型的好处是本地跑得动,适合拿自己的聊天记录训练一个模仿群聊口吻的玩具。如果你也想试试,这个cookbook是个不错的起点,但具体花...
OpenCV 5 最大的变化是换了一套全新的 DNN 引擎,从原来的逐层执行改成基于计算图的架构,能做算子融合,跑 Transformer、视觉语言模型和大语言模型都成了原生能力。ONNX 算子的覆盖率从 4.x 时期不到 23% 一下子拉到 80% 以上,以前很多导不进来的模型现在能直接用了。另外硬件加速层也重新整理了,厂商可以直接插优化后的计算内核...
推荐理由:HKR 三项都站得住:OpenCV 加原生大模型支持是个实打实的跨界信号,计算图引擎和 ONNX 覆盖率暴涨是硬核知识增量,本地推理和兼容性又切中部署痛点。作为大版本更新,重要性够上 featured,但还没到模型实验室发新作那种必写级别。
Miso One 放出了一个 8B 参数的开源 TTS 模型,主打一次语音克隆——给它一小段音频样本就能模仿那个人的说话风格和节奏。推理延迟标称 110ms,对实时对话场景算可用。模型权重直接挂在 GitHub 上,你可以自己部署,音频数据不用上传到第三方服务器。官方说 API 之后会出,但正文没提价格和上线时间。
推荐理由:我会先打个折:这是单条推文来源的发布,没有跑分对比、没写许可证细节、也没有第三方复现结果。但8B参数、110ms延迟、能自托管的一次语音克隆这几个事实本身够硬,放在featured刚好,再往上就缺验证了。
Google 给 AI Edge Gallery 这个手机端模型体验应用加了三个新能力。一是安卓版开始实验性支持 MCP(模型上下文协议),你可以给手机上的 Gemma 4 模型配一个外部工具服务器地址,比如连上 Google Workspace 查日历邮件,或者接 Google Maps 问路、接网页抓取工具读链接内容。模型在本地决定调哪个工具,请求...
推荐理由:Google 在安卓 AI Edge Gallery 里塞了实验性 MCP 支持,Gemma 4 能直接调 Workspace、Maps 这些外部工具,还补了通知和会话记忆。我会先打个折——正文没披露延迟、耗电和实际可用工具数量,目前更像开发者尝鲜版。但方向很明确:让手机端模型从聊天框跳出来,进到系统里干活。这点先别太激动,等看实际跑起来的稳定性。
作者用程序给 BigCodeBench 的 400 道题植入单点 bug,发现很多模型在修 bug 时会过度编辑——明明改一行就能修好,它却把半个函数重写了,甚至加一堆没必要的检查。文章用 token 级编辑距离来量化这种“改多了”的程度,并尝试通过训练让模型学会只做最小改动。正文没披露最终测试结果和模型排名,也没说训练后到底省了多少编辑量。
推荐理由:这篇文章的切入点很巧,用 400 道题的 bug 注入实验把“模型修 bug 时过度改写”这个模糊感受变成了可量化的编辑距离。对 AI 编程工具的用户来说,多改一行正确代码就是多一份审查成本和上线风险,所以相关性直接拉满。不过正文截取没给出具体结果、模型排名和效果幅度,我会先打个折——知道问题存在,但不知道严重到什么程度、哪些模型更爱乱改,这点先别太激动。