Meta 在 arXiv 上公开的 Llama 3 技术报告,围绕 8B、70B 和 405B 三个稠密 Transformer 开放权重模型,给出了从预训练、后训练到推理部署的完整路径。报告对应的模型版本为 2024 年 7 月发布的 Llama 3.1,其知识截止时间为 2023 年底。此次梳理的重点,并不是单纯复述模型能力,而是从工程与部署角度,观察开源大模型如何在有限算力条件下优化性能。
值得关注的是,Llama 3 系列在架构上的变化相对克制,性能提升主要来自数据质量、训练规模以及后训练策略调整。对于国内开发者和企业而言,这类信息比单纯跑分更有参考价值:当模型开放权重后,真正的竞争并不只发生在榜单上,还发生在量化、显存占用、长上下文推理等落地环节。
架构没有大改,数据和规模才是核心变量
从模型结构看,Llama 3 与 LLaMA 1、Llama 2 保持高度一致,仍然采用 Pre-norm、RMSNorm、SwiGLU 和 RoPE 等成熟设计。所有规模模型均使用 GQA,词表扩展到 128,256,另有 256 个位置留给特殊 token,RoPE 基频也提高至 500,000。这些改动并不追求结构创新,而是服务于更大规模训练和更长上下文需求。
报告明确指出,性能提升主要来自更多、更干净的数据和更大的训练规模。以 405B 模型为例,其预训练数据达到 15.6T token,计算量为 3.8×10^25 FLOPs,约为 Llama 2 70B 的 50 倍。上下文长度则通过 6 个阶段,从 8K 逐步扩展到 128K。
在训练策略上,Meta 也没有依赖复杂的新算法,而是通过 IsoFLOPs 曲线分析不同算力预算下的最优模型配置。实验覆盖 6×10^18 到 10^22 FLOPs 的算力区间,训练模型参数规模在 40M 到 16B 之间。通过外推,Meta 判断在 3.8×10^25 FLOPs 条件下,最优方案大约是 402B 参数搭配 16.55T token,这也与最终 405B 模型的配置基本吻合。
这种路线说明,当前头部开放权重模型的提升重点,已经从“改结构”转向“做数据、扩规模、控质量”。对部署方而言,理解这一点很重要,因为模型能力上限并不完全由参数决定,训练数据清洗、配比和退火策略同样会直接影响最终效果。
后训练转向拒绝采样与 DPO,合成数据权重上升
Llama 3 的后训练同样体现出工程化取向。报告提到,Meta 放弃了 Llama 2 时期使用的 PPO,改为 6 轮“奖励模型 + 拒绝采样 + SFT + DPO”的组合流程,并大幅提高合成数据比例。与上一代不同,这次不再区分帮助性和安全性两个奖励模型,而是使用一个覆盖多种能力的奖励模型。
这种变化带来的直接影响,是后训练流程更集中,也更依赖数据筛选能力。报告中提到,后训练数据大量来自模型生成,因此质控成为重点。Meta 针对代码、多语言、数学与推理、长上下文、工具调用、事实性和可控性等方向,分别设计了过滤和验证机制。
例如在代码方向,训练覆盖 Python、Java、JavaScript、C/C++、TypeScript、Rust、PHP、HTML/CSS、SQL 和 bash 等语言;多语言则涉及德语、法语、意大利语、葡萄牙语、印地语、西班牙语和泰语。事实性训练的目标不是灌输新知识,而是让模型“知道自己知道什么”,对于经常回答得具体但错误的问题,会生成拒答样本。
在工具调用方面,Llama 3 还设计了新的多消息对话格式,通过 <|start_header_id|> 和 <|end_header_id|> 标明消息来源,并引入 <|eot_id|> 与 <|eom_id|> 两种结束符,同时新增 ipython 角色,用于表示工具输出。这一细节说明,Llama 3 并不只是增强通用对话能力,也在为 Agent、函数调用和多轮工具交互做底层适配。
FP8 量化与长上下文实测,指向真实部署成本
相比模型训练,Llama 3 报告后半部分关于推理部署的内容更值得行业关注。405B 的 bf16 权重约为 812GB,单台 8×H100 服务器只有 640GB 显存,无法直接加载,因此需要两台机器、16 张卡协同运行。具体方案是机内使用张量并行,机间使用流水线并行,并通过 micro-batch 提升吞吐。
在输入 4,096 token、输出 256 token 的负载下,两个 micro-batch 能够同时提升预填充和解码吞吐,代价是同步点增加、延迟略有上升。这种取舍非常典型:大模型部署往往不是单纯追求最低延迟,而是在吞吐、延迟和硬件利用率之间寻找平衡。
FP8 量化是另一条关键路径。H100 原生支持 FP8,因此量化成为降低推理成本的重要选项。报告在 8B 模型上验证了模拟 FP8 量化后的困惑度、与 bf16 的分布差异以及奖励分数变化,并统计哪些 token 的激活超过 1200。此外,还在 4080 SUPER 上实测了 FP8 矩阵乘法速度。
长上下文方面,Llama 3.1 将上下文从 8K 扩展到 128K,并没有简单依赖线性外推,而是采用类似“按频率分段的位置插值”策略。高频维度保持原样,低频维度在波长超过原训练长度 8K 后压缩 8 倍,使 128K 范围内的角度落回可学习区间。官方代码中的 rope_scaling 参数包括 scale_factor=8、low_freq_factor=1、high_freq_factor=4、old_context_len=8192。
这意味着,长上下文不只是“能输入多少字”的展示指标,背后还牵涉位置编码、推理显存、吞吐和延迟等一整套工程问题。对于需要处理长文档、代码仓库或长对话的企业用户来说,这类实测细节比单点跑分更有参考价值。
开放权重模型的意义,正在从“可用”转向“可优化”
Llama 3 报告的另一个重要信息,是安全与评测体系被纳入模型生态。Meta 同步发布了 Llama Guard 3,这是一个基于 Llama 3 8B 微调的安全分类器,用于判断输入提示或模型输出是否违反安全政策。报告还给出对抗基准和污染分析,例如在 MMLU 上测试选项标签、顺序和提示措辞扰动,并基于 8-gram 重叠检测评测污染。
这类内容表明,开放权重模型的竞争已经不只是基础能力竞争,还包括安全审查、评测透明度、部署工具链和二次优化空间。对于中文行业而言,Llama 3 的价值不只是“又一个开源模型”,而是提供了一套可复现、可拆解的工程样本。
从 8B 到 405B,Llama 3 系列展示了一条相对清晰的路线:架构保持稳定,通过数据治理、后训练迭代、FP8 量化和长上下文扩展提升实际可用性。对于准备自建推理集群或进行模型微调的团队来说,这份报告更像一份部署参考,而不是一次单纯的能力发布。
原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/llama-3-ji-shu-bao-gao-chai-jie-kai-fang-quan-zhong-mo-xing