MODEL CATALOG / QUANTIZED INFERENCETYLOGI / PUBLIC INDEX

量化模型

围绕不同模型结构、精度预算与本地硬件,记录 TyloQuant 和 HeadWiseKV 当前覆盖的量化适配方向。

模型权重、许可证与具体可用版本以 Hugging Face 模型仓库为准;本页不构成通用性能承诺。
4当前模型家族
16TyloQuant 编码格式
0.84–8.30BPW 研究范围
MODEL PROFILES / 01

不同结构,需要不同的量化策略

这些档案展示当前适配和验证方向,而不是把所有模型压进同一个固定精度模板。

01验证中

DENSE / ROUTED MoE

Qwen3.6

长上下文与专家级精度分配

覆盖 27B 长上下文运行路径与 routed MoE 结构探索,结合混合格式量化和按 Head KV Cache 分配控制显存预算。

Q4_K_MQ6_KQ8_0NINTM v2

Qwen3.6-27B 已进入 HeadWiseKV 公开复现路径;具体量化档位需按硬件和质量目标重新验证。

02校准参考

DENSE / LONG CONTEXT

Qwen3.5

逐层、逐 KV Head 敏感性分析

以 9B 规模模型作为长上下文缓存和量化误差的校准参考,用于比较不同窗口、精度和运行配置。

Q8_0PPLHeadWiseKVGGUF

当前公开材料包含敏感性分析与汇总结果,模型文件及完整测试条件以对应仓库说明为准。

03适配中

ARCHITECTURE ADAPTATION

Gemma 4

结构感知的混合格式量化

针对模型内部不同权重分布分配编码格式与精度预算,验证 TyloQuant 格式选择和 packed runtime 的适配路径。

NINTNVQNPQNEPQ

适配状态会随上游模型结构和运行时支持更新;尚未公开的权重不会在本站标记为可下载。

04适配中

EXPERT-AWARE QUANTIZATION

DeepSeek V4 Flash

异构专家容器与低比特预算

探索 MoE 模型不同专家使用不同格式和比特预算,让量化配置更贴合专家敏感度与实际推理路径。

NINTM v2Mixed BPWCUDAC++ Runtime

该方向属于研究适配范围;正式模型版本、许可证和可运行环境以发布页面为准。

FORMAT SYSTEM / 02

量化不只是选择 Q4 或 Q8

TyloQuant 将编码格式、精度分配与运行时放在同一条链路中,让不同层、计算组和专家获得不同预算。

NINT

面向规则低比特整数编码的基础格式族。

NVQ / NPQ

面向不同权重分布和质量预算的向量与分组编码。

NEPQ

用于需要更细粒度精度表达的扩展编码路径。

NINTM v2

在同一 MoE tensor 中容纳异构专家格式与比特预算。

RELEASE BOUNDARY / 03

页面介绍研究覆盖,模型仓库决定实际可用性

模型是否可下载、可商用或可通过 API 调用,取决于上游许可证、当前验证状态和发布仓库。部署前仍需根据目标硬件、上下文长度、质量指标与并发需求重新测试。

[ 交互以创造生命 ]