0.6B小模型不做文本生成:NanoJev把决策压缩成一次概率输出

NanoJev用0.6B模型直接输出概率分布,减少自回归文本生成带来的解码开销,为游戏智能体和批量决策任务提供了一种更轻量的模型形态。

当大模型被用来做选择题、判断动作路径或游戏决策时,常见做法是让模型先输出一段解释性文字,再从文字中提取答案。开源项目NanoJev试图跳过这一步:它以Qwen3-0.6B为骨干网络,加入专门的决策头,让模型在接收状态、问题和候选集后,通过一次前向传播直接输出概率分布,而不进行输出token解码。

把决策从“生成文本”改成“输出分布”

NanoJev被开发者定义为一个0.6B参数的并行决策模型。其输入是状态和问题,输出是完整概率分布。项目的核心主张是:如果任务本身只需要在候选项之间作出选择,模型没有必要自回归生成一段自然语言,再依赖外部解析得到最终结果。

素材显示,NanoJev目前在GitHub上获得954 Stars,采用MIT协议,并通过迷宫导航和Snake游戏基准验证效果。官方给出的一个示例是:6个状态、18个问题、44条候选路径,只需要1次骨干网络前向传播。

  • 传统方案:状态加问题输入后,模型生成解释文本,再从文本中解析决策。
  • NanoJev方案:状态、问题和候选集一起输入,模型直接返回候选项概率。
  • 差异:减少逐token解码开销,同时让置信度以数值形式输出。

三种决策头对应三类任务结构

NanoJev没有使用单一输出头处理所有决策,而是根据任务统计结构设计了三种决策头。素材提到,每个决策由状态、问题和候选集组成,共享的决策头会根据候选集返回相应类型的分布输出。

  • Choice:面向动态选择任务,候选数量可在2到255之间变化,需要理解候选之间是互斥选项。
  • Boolean:面向单一命题的是或否判断,采用单路径sigmoid输出。
  • Score:面向有序评分任务,例如1星到5星,通过概率加权得到期望分数。

这种设计的意义在于避免把选择、判断和评分强行塞进同一个输出结构。不同任务对输出分布的要求不同:选择需要处理候选集合,布尔判断只关心单一命题,评分则需要保留等级顺序。

训练流程与验证重点都在“概率质量”

素材给出的训练流程分为五步:构建查询、整理数据、训练、评估、服务与可视化。其中,训练阶段以Qwen3-0.6B初始化,并进行决策头预热,损失函数面向完整问题分布。评估阶段关注概率质量,同时通过游戏控制器记录实际动作。

NanoJev在三个游戏基准上与原版Jev以及未微调的Qwen3-0.6B进行了对比。素材没有列出具体分数,但强调项目将自身定位为轻量级、可复现的研究替代方案,而非追求全面超越原版Jev。其路线图提到扩大数据规模和RLCD等扩展方向,重点仍是验证并行决策模型这一架构路线。

推理延迟和模型形态的影响

NanoJev的价值不只在于节省解码时间,更在于它提出了一种不同于常见LLM Agent的模型形态:保留语言模型对状态和问题描述的理解能力,但把输出端改成结构化概率分布。这样一来,模型不再承担“解释自己为什么这样选”的文本生成任务,而是直接服务于排序、贪心选择或概率采样。

  • 推理延迟:避免逐token生成,把多个状态、问题和候选路径压缩进同一批前向计算。
  • 决策任务:概率分布可直接用于动作选择、风险评估或候选排序。
  • 模型形态:语言模型从文本生成器转向结构化决策器,适配游戏智能体、局部安全判断和批量决策场景。

素材也提到,NanoJev不是图像生成或编辑工具,而是一个结构化决策模型和推理框架。它提供的本地演示、模型检查点和数据服务,更适合研究者验证“并行决策模型”的可行性。对于需要低延迟、可校准概率输出的任务,这种不生成文字、直接给出分布的方式,提供了一种更贴近决策本质的选择。

原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/6b-xiao-mo-xing-bu-zuo-wen-ben-sheng-cheng-nanojev-ba-jue

Like (0)
点点的头像点点
Previous 17小时前
Next 15小时前

相关推荐