Google 在 2026 年 9 月 2 日发布了普通版 Gemini 3.8 Flash,重点面向长程编码与自主 Agent 场景。对开发者来说,第一眼看到的官方 API 价格并没有变化:每百万输入 token 仍为 0.75 美元,包含思考 token 的输出为 3.75 美元,这一限时优惠持续到 2026 年 12 月 31 日。
但在独立评测机构 Artificial Analysis 的测试快照中,3.8 Flash High 档位的综合任务均价比前代 3.7 高约 40%。换言之,单价没有上调,模型完成同类复杂任务时消耗的 token 更多,最终账单可能随之上升。
官方牌价未变,任务均价上升
Artificial Analysis 在 9 月 2 日发布的评测快照显示,在包含 Agent 调用的特定 Intelligence Index 综合任务集中,Gemini 3.8 Flash High 档位每任务平均花费 0.58 美元,而前代 3.7 为 0.40 美元。
同一份快照还记录了两个关键变化:
- High 档位平均输出 token 数量比 3.7 多出 30%;
- Agent 交互轮次有所拉长。
Google 官方文档对此的解释也很直接:面对复杂任务时,模型会主动扩充思维链与工具调用步骤。如果开发者选择高 effort 档位,就可能消耗更多 token;如果更看重算力效率,官方建议使用低 effort 档位,或者继续使用 3.7。
这也解释了为什么“API 单价”与“任务成本”不能直接画等号。模型报价只是输入、输出单价的组合,而真实任务支出还取决于模型为完成工作生成了多少内容、调用了多少轮工具、是否需要更长的推理过程。
更贵的背后是更高的任务完成能力
从 Google 公布的基准看,3.8 Flash 的提升集中在软件工程修复类任务。在官方同设置的 DeepSWE v1.1 评测中,3.8 Flash 得分为 73.7%,而 3.7 为 65.3%。
不过,这一基准并不能直接换算成所有开发场景的成本变化。Artificial Analysis 的综合任务集包含 Agent 调用等复杂链路,也不等同于纯编码任务,更不能被开发者拿来当作本地项目的最终账单。9 月 4 日,Artificial Analysis 已更新 v4.2 榜单,9 月 2 日快照只是特定环境下的样本。
素材中的本地验证也呈现出类似复杂性。在两个真实工程模块的测试中,Astra High、Flash Low 的首稿分别跑通了 ShipSite 的 15 项和 ShipSolo 的 36 项行为测试,并通过了 TypeScript 检查。Flash High 在 ShipSite 任务中出现过交付波动:第一轮渠道工具拒绝返回空响应,第二轮输出被上限截断;从未人工修改的完整片段中提取出的补丁通过了 15 项行为测试,但提取过程脱离了原生完整交付,且 TypeScript 检查中同一处可选 close 在回调内丢失类型收窄,产生了两条诊断。
到了 ShipSolo 任务,Flash High 第二轮交付恢复正常,通过全部 36 项行为测试与 TypeScript 检查。这说明模型在不同任务、不同轮次中的表现可能存在波动,不能仅凭单次结果判断稳定性。
测试全绿不代表防御完备
在拿到 ShipSolo 模块通过验收的代码后,测试又追加了四种边界场景复验,每个场景重复运行两次。由于没有让模型依据新约束重新修复,这项复验衡量的是既有生成代码的防御底线,而不是模型能力上限。
在正向防御场景中,模拟上游返回 HTTP 200 但响应体为非法 JSON。三份模型候选方案表现一致:都拒绝了 4 个并发调用者,并且在上游恢复后,下一次同 key 查询可以重新回源。
但在另外三种非预期场景中,现有方案暴露了共性缺口:
- 当上游返回 HTTP 200、JSON 语法合法但只有 error 字段而缺失 results 时,三份候选方案都将错误响应作为有效数据存入缓存;
- 当上游恢复正常后,下一次同 key 查询仍读取缓存中的错误对象,没有触发回源;
- 在模拟上游挂起时,200 毫秒本地观察窗内两个相同 key 调用均未完成,底层仅触发 1 次模拟 fetch;
- 在 150 个不同 query key 并发进入时,系统释放模拟上游之前一次性发起了 150 次模拟 fetch。120 项结果缓存容量只限制最终存储规模,无法限制同时进行的请求数量。
值得注意的是,原工程保留的人工参考解在这些场景中也出现了相同的未拦截情况。这意味着单元测试全部通过,只能证明代码满足了已经写明的规格;没有被测试覆盖的业务防御,仍需要人工介入定义。
开发者需要重新计算“推理经济学”
Gemini 3.8 Flash 此次带来的变化,提醒开发者在评估模型时要区分两类指标:每 token 单价,以及完成单项任务的实际支出。前者适合做预算框架,后者才决定真实成本。
现行标准 API 属于限时优惠,2026 年底结束后,每百万输入将调整为 1.50 美元,输出调整为 7.50 美元。到那时,任务均价的变化会被进一步放大。
对于规则清晰、配备自动化验收的日常修复任务,可以优先尝试 Low 档位。Artificial Analysis 数据显示,Low 档位平均单任务支出为 0.24 美元,具备一定性价比尝试空间,但这并不意味着它能在所有任务中达到 High 档位的解决能力。
对于探索性更强、步骤更繁琐的复杂场景,再考虑开启 High 档位。关键不是它是否多消耗了 30% 的输出 token,而是这些额外消耗是否换来了团队真正需要的业务结果。返回业务结构校验、主动超时、在途并发限制等环节,也应显式纳入工程验收。单价更高的调用不能替代校验,模型预算最终要围绕自动化验证带来的实际收益来分配。
原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/gemini-3-8-flash-guan-fang-api-jia-ge-bu-bian-dan-agent-ren