对于需要把整个代码库交给大模型阅读、总结或排查问题的开发者来说,上下文长度和调用成本往往是第一道门槛。近期,有开发者在 OpenRouter 的公开模型目录中发现,已经有 5 个文本模型同时满足两个条件:提示和生成价格均为 0,上下文窗口达到或超过 100 万 token。这意味着,开发者可以不花钱就把约 4 MB 规模的源码或长文档一次性喂给模型,而不必先切分文件、再做复杂检索。
5 个免费长上下文模型浮出水面
根据开发者通过 OpenRouter API 查询的结果,截至 2026 年 8 月 28 日,以下 5 个文本模型支持免费调用,并拥有 100 万 token 及以上上下文窗口:
- thinkingmachines/inkling,上下文长度为 1048576 token
- thinkingmachines/inkling-small,上下文长度为 1048576 token
- minimax/minimax-m3,上下文长度为 1048576 token
- nvidia/nemotron-3-ultra-550b-a55b,上下文长度为 1000000 token
- nvidia/nemotron-3.5-lightning,上下文长度为 1000000 token
其中,1048576 token 大致相当于 4 MB 源代码。值得注意的是,nemotron-3-ultra-550b-a55b 被标注为 550B 参数的 MoE 模型,这类规模的模型出现在免费列表中,显示 OpenRouter 正在给开发者提供较低成本的长上下文试验入口。
素材同时提到,Google Lyria 相关模型中也有两个 100 万 token 上下文、价格为 0 的条目,但由于它们不是聊天模型,未被纳入本次讨论范围。
免费额度能做什么:适合低频分析,不适合线上服务
这类免费长上下文模型的限制并不在上下文长度,而在吞吐量。根据素材描述,OpenRouter 免费模型当前默认限制为每分钟 20 次请求、每天 50 次请求。若账户历史上曾购买过 10 美元积分,每日请求上限可提升至 1000 次。
换句话说,这组免费模型更适合一次性任务,而不是高并发应用。例如:
- 对大型仓库做一次整体阅读和结构总结
- 让模型批量分析代码库中的模块关系
- 执行夜间的长文档摘要或代码解释任务
- 在正式接入付费模型前验证提示词和切分策略
如果开发者需要面向真实用户提供服务,或者需要持续高频调用,免费额度显然不够。但从工程角度看,这类预算恰好适合“每天读几次超大内容”的场景,而不是“每分钟处理大量用户请求”的场景。
从免费到付费的迁移成本较低
这次发现的另一个价值在于,它展示了长上下文模型供给正在变多。素材显示,OpenRouter 同一目录中还有 119 个付费模型的上下文长度超过 100 万 token。也就是说,如果开发者因为请求限制需要升级,通常只需要更换模型 ID,而不必重新设计整套系统。
对于 AI 编程工具、代码审查助手或仓库级问答系统来说,这种迁移路径比较友好。团队可以先用免费模型验证“整库输入”的可行性,确认模型是否能理解项目结构、依赖关系和关键入口,再决定是否切换到更高吞吐、更稳定的付费模型。
对 AI 编程行业的意义
过去,处理大型代码库通常意味着要先做文件拆分、向量检索、片段排序和上下文拼接。长上下文模型降低了一部分这类工程复杂度,使模型可以直接接触更完整的项目信息。免费模型提供 100 万 token 级别上下文后,开发者能够以更低成本测试这种工作方式。
不过,长上下文并不自动等同于高质量代码理解。模型是否能准确找到关键函数、是否会在大仓库中遗漏细节、是否会在超长输入下产生更高延迟,仍需要开发者结合具体任务测试。此次素材给出的信息主要确认了模型列表、价格、上下文长度和请求限制,并未提供具体代码理解准确率或延迟数据。
但即便如此,这组免费长上下文模型仍提供了一个清晰信号:长上下文能力正在从少数高价模型扩展到更多可试用的基础设施层。对于想探索仓库级 AI 编程助手的团队而言,OpenRouter 上的这批模型值得作为低成本起点。
原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/openrouter-shang-5-ge-mian-fei-mo-xing-ke-chu-li-100-wan