llama.cpp 新增对 Spark-X2.5 的支持,两个 1.7B 和 4B 小模型,原生支持 100 万 token 上下文
[Model] Support for Spark2_5ForCausalLM implementation by KnightYao · Pull Request #27868 · ggml-org/llama.cpp
llama.cpp 的 PR #27868 合并了 XHToken 的 Spark-X2.5-1.7B 和 4B 两个小模型。它们用了一种混合注意力设计——一层全局注意力加三层滑动窗口注意力——来把长文本的计算量压下来,原生支持最长 100 万 token 的上下文窗口。官方说在对话、写作、翻译、推理、写代码和让模型进业务流程干活(agent 任务)这...