斯坦福与英伟达研究人员发布对比语言模型(CLM)方法及CLM-8B模型,通过状态与动作表征匹配而非逐token生成来做决策,可缓存可复用动作表征。零样本测试中在电脑操作、游戏与工具调用任务上最高比TypeSafe的Jev快9倍,BFCL v4得分95.2%(Jev为99.2%),WikiRacing完成26/30(Jev为30)。