MODEL INFRA / MIXED-FORMAT QUANTIZATION开源研究原型
TyloQuant MFQ
把每一比特,放在精度真正需要的位置
TyloQuant MFQ 联合设计量化格式、精度分配与推理内核,让压缩后的权重能够通过 CUDA kernel 与 C++ runtime 直接执行,面向高保真本地大模型推理。
查看 GitHub本页依据公开仓库整理,完整实现、测试条件与复现说明以仓库为准。
BPW 编码范围
自定义权重编码覆盖从低于 1 bit 到 8 bit 以上的质量档。
正式编码格式
NINT、NVQ、NPQ、NEPQ 等格式服务于不同精度预算。
直接推理运行时
执行 packed 权重,不需要展开完整 FP16 权重。
从权重结构到实际执行,精度预算贯穿整条链路
混合格式编码
以 NINT、NVQ、NPQ 与 NEPQ 形成不同质量和体积档位,而不是让所有权重使用同一格式。
精度动态分配
依据梯度校准结果,按计算组选择精度;MoE 模型还可按专家分配比特预算。
异构专家容器
NINTM v2 在同一 MoE tensor 中保存异构格式,让不同专家获得不同精度。
Packed 直接执行
CUDA kernel 与 C++ runtime 直接运行压缩权重,并提供 OpenAI 兼容接口与本地 WebUI。
当前公开实现覆盖多类新一代模型结构
这是可检查、可复现的研究原型,而不是无条件的性能承诺
完整模型服务当前仍以单 GPU CUDA 研究原型为主。模型质量、速度和可用显存会随模型结构、量化档位、硬件与运行配置变化;Apple Silicon 的 Metal HTTP 服务仍在开发中。
浙公网安备33011002019019号