SP4E 的定位
SP4E,Stellaria Split Precision 4 Extended,是 SP4 的扩展层,不是 SP4 的替代品。SP4 仍然是普通 GPU ALU 与 CPU fallback 的默认路径;SP4E 只在 backend 暴露原生 FP4 matrix acceleration、强 low-bit tensor throughput,或 profile 证明其比 SP4 更快时启用。
Runtime Gate
SP4E 不应只因为 asset 存在就运行。loader 与 backend 会按能力选择 SP4E_TENSOR_PATH、SP4E_LOWQ_ALU_PATH、SP4E_PROFILE_GUIDED_PATH,或退回 SP4E_SP4_SUBSET_PATH。
当前公开文档中,本地 host 探测会记录 SP4-compatible partial fallback path,这意味着 SP4E 可以被编译、加载和检查,但执行路径仍以可用硬件能力为准。
A1P Container
A1P container 包含 magic、container version、manifest length、manifest JSON 与 payload sections。公开文档中列出的 section 包括 qweight_fp4、qweight_int4、scale_fp4、bias、mode、aux、residual_index、residual_value、activation_precision、tile_plan、low_rank_u/v 与 channel_correction 等。
Tools 与本地验证
公开流程通过 CMake 构建 SDK,再使用 sp4ec compile 与 sp4einspect-cpp 检查资产。CPU reference path 用于 correctness 与 asset inspection,不作为性能声明。
验证流程还会运行 validate_backends.sh 和 comparison chart generation,证明工程链可以编译 .sp4e、加载它、重建 weights、运行 CPU reference operators,并在没有 matrix acceleration hardware 的情况下测量本地精度。
