Overview
冻结模型在已知任务上刷高分,测到的是已经结晶的技能,不是智力。Chollet 把智力写成 技能获取效率:在给定任务范围上,相对先验、经验和泛化难度,把信息转成新技能的速率。原文:On the Measure of Intelligence。
本 topic 的主骨架仍是这张测量地图。方法侧已经有一条可更新的机制:测试时用当前样本上的损失改权重。测试时加算力、ICL 与冻结后训练的对照仍等后续来源。
问题地图
测到的是技能还是获取效率
任务技能可以被无上限先验或无上限训练数据买到,同时掩盖系统自己的泛化力。公平比较要控制 scope、priors、experience、generalization difficulty。原文:Chollet 2019。
评价集对谁未知
只测系统没见过的样本,仍可能测到工程师写进程序里的智力。developer-aware generalization 要求任务对系统和开发者都未知。原文:Chollet 2019。
先验如何对人机公平
通用基准应显式穷尽先验,并只假设人类 Core Knowledge。ARC 是按这条契约做的测量物,不是又一个技能榜。原文:Chollet 2019。
测试时如何改权重
分布一旦在测试时才出现,冻结 $\theta$ 就无法用当前 $x$ 里的提示。TTT 把无标签 $x$ 做成自监督问题,更新共享特征再预测。这解决的是已知任务上的分布偏移,不是评价集对开发者未知的新任务。原文:Sun et al. 2020。
共同主张
- 智力不是二进制属性,而是相对某个 scope 的谱:local / broad / extreme。原文:Chollet 2019。
- 技能是智力过程的结晶输出;要测的是把先验和经验转成新技能的效率。原文:Chollet 2019。
- 对人机公平的通用基准必须控制先验、经验,并测量 developer-aware generalization。原文:Chollet 2019。
- 测试时改 $\theta$ 需要一个不依赖 $y$ 的损失;辅助任务与主任务的梯度需要正相关,否则更新会伤害主任务。原文:Sun et al. 2020。
开放接口
Chollet 已写出、但尚未展开的效率轴包括 skill program 的计算代价、训练时计算、时间、能量与风险。测试时加算力、ICL、熵最小式 TTA,以及把 TTT 接到有示范对的新任务上,留给后续来源。ARC 的竞赛协议与数据集修订同样留给 ARC Prize 报告。
边界
本 topic 不收录量化、不收录 On-Policy Distillation。冻结模型的外部资产演化属于 Harness Evolution:那边明确把直接改权重划出;这边问的是技能测量与后来会碰到的测试时适应。两边只做边界对照,不把同一篇来源倒进两个 topic。