当前语言下暂无文章。
主题
深度搜索智能体
关于搜索任务合成、轨迹诊断与长程证据获取能力的持续整理。
深度搜索问题地图
深度搜索训练数据的核心问题是如何制造答案出现前的长证据前缀,而不是只把轨迹、hop 数或图结构做长。
阅读文章实现难度与 Shortcut
实现搜索难度由最便宜的 identifying route 决定;四类 shortcut 会把表观复杂任务塌成浅层检索或先验绑定。
阅读文章轨迹签名
用 solving cost、answer hit time 与 prior-shortcut rate 诊断实现难度;长轨迹不等于长答案前前缀,FORT 显著拉长 pre-answer search。
阅读文章FORT-Searcher
FORT 在构造期控制四类 shortcut,用轨迹签名校准可解但搜索重的任务;仅 SFT 的 FORT-Searcher 在同规模开源搜索 agent 中总体最优。
阅读文章主题
Harness Evolution
关于冻结模型如何通过技能库、context engineering、workflow、harness code、评估与权限边界实现外部能力演化的持续整理。
Harness Evolution 概览
Harness Evolution 关注冻结模型如何通过技能库、context、workflow、harness code 与评估闭环积累外部能力。
阅读文章Skill Library
技能库是 harness evolution 的外部程序性记忆层;核心形态包括可执行代码、SKILL.md、SkillRepo 和带测试的 Agent Skills 包。
阅读文章技能生命周期
技能库瓶颈常在 librarian 与评估:AutoSkill / Ratchet / MUSE 管任务技能;MCE、Meta-Harness 与 Self-Harness 则把生命周期问题抬到 harness 层。
阅读文章Skill Curation RL
SkillOS 把冻结 executor 与可训练 curator 拆开,用 grouped task streams 与 composite rewards 从延迟反馈中学习长期技能策展策略。
阅读文章MUSE-Autoskill
ByteDance 的训练无关技能生命周期框架:运行时创建、skill-level memory、单测评估与跨 agent 迁移,在 SkillsBench / SkillLearnBench 上验证。
阅读文章Harness Engineering
Harness engineering 把模型外部的 workflow、context、工具、文件系统记忆、评估与权限控制视为可演化的能力层。
阅读文章Meta Context Engineering
MCE 用双层优化共演化 CE skills 与 context artifacts:meta 层 agentic crossover,base 层以 files/code 做完全 agentic 上下文工程。
阅读文章Meta-Harness
Meta-Harness 用 coding agent 外环搜索 harness 代码,经 filesystem 访问历次源码、分数与执行轨迹,在分类、数学检索与 TerminalBench-2 上超过 ACE/MCE 与手工 harness。
阅读文章自写技能有效性争议
Ratchet 将 SkillsBench 的 LLM 自写技能 null result 解释为 librarian 问题;MUSE-Autoskill 则显示全生命周期 agent 下自建技能仍有正增益。
阅读文章Self-Harness
Self-Harness 让固定模型依据自身失败轨迹提出 bounded harness edits,并用 held-in / held-out 非回归门控筛选可推广的 harness 改动。
阅读文章主题
大模型量化
关于大模型量化基本原理、PTQ/QAT 训练流程、GPTQ/AWQ 与 QLoRA 的持续整理。
大模型量化问题地图
大模型量化的核心问题是如何在降精度省显存的同时控制量化噪声,以及何时用校准式 PTQ、何时回到 QAT 或 QLoRA 训练。
阅读文章线性量化基础
线性量化用 scale 与 zero-point 把浮点映射到低比特整数,粒度与对称性决定精度与算力折中。
阅读文章PTQ 与 QAT
PTQ 在训后用校准或优化压精度;QAT 在训练中插入伪量化并用 STE 适应噪声,精度更高但成本更大。
阅读文章GPTQ 与 AWQ
GPTQ 用 Hessian 做层内误差补偿,AWQ 保护高激活通道;两者都是面向 LLM 的校准式 INT4 权重量化,常见配方为 W4A16。
阅读文章LLM 上的 QAT
torchao / torchtune 的 LLM QAT 通过 prepare 插入伪量化、微调后再 convert,可在 8da4w 等设定上大幅回收相对 PTQ 的精度损失。
阅读文章QLoRA
QLoRA 用 NF4 冻结基座、高精 LoRA adapter 与 Double Quantization / Paged Optimizer,把大模型微调塞进单卡,但不是经典 QAT。
阅读文章FP8 训练 Recipe
FP8 训练靠 TE/MCore recipe 在 GEMM 上用 E4M3/E5M2 或 MXFP8;显存与通信收益取决于 primary weights 与并行策略,不等于推理侧 FP8 PTQ。
阅读文章MXFP4 推理量化
MXFP4 用 E2M1 四比特浮点加每 32 元一块的 block scale,让 gpt-oss 等模型以远低于 BF16 的显存跑推理,并依赖专用 Triton kernel。
阅读文章主题
On-Policy Distillation
关于学生自采样、老师 token 级监督的后训练方法、成功条件与稳定化做法的持续整理。
主题
测试时训练
关于测试时改参数或增加算力以获取新技能的方法,以及它与冻结后训练、ICL、ARC-AGI 测量的边界。
测试时训练问题地图
本 topic 问的是:冻结后的任务技能为什么测不到智力,以及测试时改参数、加算力或做 ICL,各自对应技能获取效率的哪一段。
阅读文章技能获取效率
智力被定义为在给定任务范围上,相对先验、经验与泛化难度,把信息转成新技能的效率;任务技能本身可以被先验或数据买到。
阅读文章通用智能测量
通用基准应控制先验与经验、测量 developer-aware generalization,并只假设人类 Core Knowledge;ARC 是这条契约的 2019 年测量物。
阅读文章测试时参数更新
TTT 把当前无标签测试样本做成自监督问题,先更新共享特征再预测;辅助任务与主任务的梯度需要正相关。
阅读文章