知识库 / 测试时训练

测试时训练问题地图

本 topic 问的是:冻结后的任务技能为什么测不到智力,以及测试时改参数、加算力或做 ICL,各自对应技能获取效率的哪一段。

Overview

冻结模型在已知任务上刷高分,测到的是已经结晶的技能,不是智力。Chollet 把智力写成 技能获取效率:在给定任务范围上,相对先验、经验和泛化难度,把信息转成新技能的速率。原文:On the Measure of Intelligence

本 topic 的主骨架仍是这张测量地图。方法侧已经有一条可更新的机制:测试时用当前样本上的损失改权重。测试时加算力、ICL 与冻结后训练的对照仍等后续来源。

问题地图

测到的是技能还是获取效率

任务技能可以被无上限先验或无上限训练数据买到,同时掩盖系统自己的泛化力。公平比较要控制 scope、priors、experience、generalization difficulty。原文:Chollet 2019

评价集对谁未知

只测系统没见过的样本,仍可能测到工程师写进程序里的智力。developer-aware generalization 要求任务对系统和开发者都未知。原文:Chollet 2019

先验如何对人机公平

通用基准应显式穷尽先验,并只假设人类 Core KnowledgeARC 是按这条契约做的测量物,不是又一个技能榜。原文:Chollet 2019

测试时如何改权重

分布一旦在测试时才出现,冻结 $\theta$ 就无法用当前 $x$ 里的提示。TTT 把无标签 $x$ 做成自监督问题,更新共享特征再预测。这解决的是已知任务上的分布偏移,不是评价集对开发者未知的新任务。原文:Sun et al. 2020

共同主张

  • 智力不是二进制属性,而是相对某个 scope 的谱:local / broad / extreme。原文:Chollet 2019
  • 技能是智力过程的结晶输出;要测的是把先验和经验转成新技能的效率。原文:Chollet 2019
  • 对人机公平的通用基准必须控制先验、经验,并测量 developer-aware generalization。原文:Chollet 2019
  • 测试时改 $\theta$ 需要一个不依赖 $y$ 的损失;辅助任务与主任务的梯度需要正相关,否则更新会伤害主任务。原文:Sun et al. 2020

开放接口

Chollet 已写出、但尚未展开的效率轴包括 skill program 的计算代价、训练时计算、时间、能量与风险。测试时加算力、ICL、熵最小式 TTA,以及把 TTT 接到有示范对的新任务上,留给后续来源。ARC 的竞赛协议与数据集修订同样留给 ARC Prize 报告。

边界

本 topic 不收录量化、不收录 On-Policy Distillation。冻结模型的外部资产演化属于 Harness Evolution:那边明确把直接改权重划出;这边问的是技能测量与后来会碰到的测试时适应。两边只做边界对照,不把同一篇来源倒进两个 topic。

See Also