量化模型
围绕不同模型结构、精度预算与本地硬件,记录 TyloQuant 和 HeadWiseKV 当前覆盖的量化适配方向。
模型权重、许可证与具体可用版本以 Hugging Face 模型仓库为准;本页不构成通用性能承诺。不同结构,需要不同的量化策略
这些档案展示当前适配和验证方向,而不是把所有模型压进同一个固定精度模板。
DENSE / ROUTED MoE
Qwen3.6
长上下文与专家级精度分配
覆盖 27B 长上下文运行路径与 routed MoE 结构探索,结合混合格式量化和按 Head KV Cache 分配控制显存预算。
Qwen3.6-27B 已进入 HeadWiseKV 公开复现路径;具体量化档位需按硬件和质量目标重新验证。
DENSE / LONG CONTEXT
Qwen3.5
逐层、逐 KV Head 敏感性分析
以 9B 规模模型作为长上下文缓存和量化误差的校准参考,用于比较不同窗口、精度和运行配置。
当前公开材料包含敏感性分析与汇总结果,模型文件及完整测试条件以对应仓库说明为准。
ARCHITECTURE ADAPTATION
Gemma 4
结构感知的混合格式量化
针对模型内部不同权重分布分配编码格式与精度预算,验证 TyloQuant 格式选择和 packed runtime 的适配路径。
适配状态会随上游模型结构和运行时支持更新;尚未公开的权重不会在本站标记为可下载。
EXPERT-AWARE QUANTIZATION
DeepSeek V4 Flash
异构专家容器与低比特预算
探索 MoE 模型不同专家使用不同格式和比特预算,让量化配置更贴合专家敏感度与实际推理路径。
该方向属于研究适配范围;正式模型版本、许可证和可运行环境以发布页面为准。
量化不只是选择 Q4 或 Q8
TyloQuant 将编码格式、精度分配与运行时放在同一条链路中,让不同层、计算组和专家获得不同预算。
面向规则低比特整数编码的基础格式族。
面向不同权重分布和质量预算的向量与分组编码。
用于需要更细粒度精度表达的扩展编码路径。
在同一 MoE tensor 中容纳异构专家格式与比特预算。
页面介绍研究覆盖,模型仓库决定实际可用性
模型是否可下载、可商用或可通过 API 调用,取决于上游许可证、当前验证状态和发布仓库。部署前仍需根据目标硬件、上下文长度、质量指标与并发需求重新测试。
浙公网安备33011002019019号