MODEL INFRA / MIXED-FORMAT QUANTIZATION开源研究原型

TyloQuant MFQ

把每一比特,放在精度真正需要的位置

TyloQuant MFQ 联合设计量化格式、精度分配与推理内核,让压缩后的权重能够通过 CUDA kernel 与 C++ runtime 直接执行,面向高保真本地大模型推理。

查看 GitHub本页依据公开仓库整理,完整实现、测试条件与复现说明以仓库为准。
010.84 – 8.30

BPW 编码范围

自定义权重编码覆盖从低于 1 bit 到 8 bit 以上的质量档。

0216

正式编码格式

NINT、NVQ、NPQ、NEPQ 等格式服务于不同精度预算。

03CUDA + C++

直接推理运行时

执行 packed 权重,不需要展开完整 FP16 权重。

METHOD / 量化与运行时协同

从权重结构到实际执行,精度预算贯穿整条链路

01

混合格式编码

以 NINT、NVQ、NPQ 与 NEPQ 形成不同质量和体积档位,而不是让所有权重使用同一格式。

02

精度动态分配

依据梯度校准结果,按计算组选择精度;MoE 模型还可按专家分配比特预算。

03

异构专家容器

NINTM v2 在同一 MoE tensor 中保存异构格式,让不同专家获得不同精度。

04

Packed 直接执行

CUDA kernel 与 C++ runtime 直接运行压缩权重,并提供 OpenAI 兼容接口与本地 WebUI。

CURRENT SCOPE / 当前覆盖

当前公开实现覆盖多类新一代模型结构

Qwen3.5Qwen3.6 routed MoEGemma4DeepSeek-V4-FlashOpenAI-compatible APIApple Silicon / Metal 研发中
BOUNDARY / 适用边界

这是可检查、可复现的研究原型,而不是无条件的性能承诺

完整模型服务当前仍以单 GPU CUDA 研究原型为主。模型质量、速度和可用显存会随模型结构、量化档位、硬件与运行配置变化;Apple Silicon 的 Metal HTTP 服务仍在开发中。

[ 交互以创造生命 ]