小模型
-
从零训练321万参数小模型:MLX环境下Transformer训练链路拆解
不加载预训练权重,也不是 LoRA 或蒸馏。这个实验用 640 条中文短句,在 MLX 上从零训练一个约 321 万参数的字符级 Transformer,拆解了词表、层数、注意力头、损失函数和推理生成的完整链路。
不加载预训练权重,也不是 LoRA 或蒸馏。这个实验用 640 条中文短句,在 MLX 上从零训练一个约 321 万参数的字符级 Transformer,拆解了词表、层数、注意力头、损失函数和推理生成的完整链路。