模型量化
-
本地跑大模型不再只拼显卡:llama.cpp 量化优化里的两条关键路径
llama.cpp 的 Q4_K_M 量化方案通过混合精度和双重量化,在压缩模型体积的同时保留关键层效果,为本地大模型部署提供了更现实的工程路径。
-
英伟达研究人员突破 4 位精度 LLM 训练技术,性能媲美 8 位精度
2025 年 10 月 29 日,Ben Dickson 报道,英伟达(Nvidia)研究团队开发出全新 4 位量化格式训练技术 “NVFP4”,成功实现以 4 位浮点(FP4)精…