MODEL INFRA / LONG-CONTEXT CACHE已开源
HeadWiseKV
不让每一个 KV Head,都为完整上下文付出相同代价
HeadWiseKV 是面向长上下文 LLM 推理的静态、按头 KV Cache 分配方案。它以层和 KV Head 为单位配置缓存窗口,并在 llama.cpp 运行时中实际改变 KV Cache 的驻留范围。
查看 GitHub容量数据来自公开仓库保留的 24 GB 4090D CUDA 全量 GPU 卸载实测。
确认上下文长度
UD-Q4_K_XL 在公开 4090D 实测中达到模型完整上下文。
Q6_K + KV q8_0
相同公开设置下,未修改 llama.cpp 路径为 53,248。
公开实测显存
结果面向单张 4090D CUDA 全量 GPU 卸载环境。
把缓存窗口从“整模型统一”拆成逐层、逐 Head 的静态配置
识别缓存需求
区分不同层与 KV Head 对长程上下文的依赖,不再假设所有位置需要相同窗口。
SWA / Full 编码
在配置中为不同 Head 指定滑动窗口或完整窗口,形成可检查的静态分配方案。
物理改变驻留
补丁版 llama.cpp 运行时实际切分 KV Cache,而不是只在注意力计算阶段添加逻辑掩码。
保留复现路径
仓库提供源码快照、补丁、默认配置、启动脚本与实验产物,用于检查当前公开版本。
目标场景是单张 24 GB 消费级显卡上的本地长上下文推理
容量数字只在已公开的模型、量化方式和硬件条件下成立
精确容量来自 4090D 实测,不应直接理解为 macOS Metal 或所有 3090/4090 显卡的容量声明。当前质量结果没有进行统计显著性检验,且不包含每次容量探测的完整原始日志。
浙公网安备33011002019019号