知识库

从原始资料中持续整理、可复用的个人知识库。

语言

主题

深度搜索智能体

4 篇

关于搜索任务合成、轨迹诊断与长程证据获取能力的持续整理。

主题

Harness Evolution

10 篇

关于冻结模型如何通过技能库、context engineering、workflow、harness code、评估与权限边界实现外部能力演化的持续整理。

中文

Harness Evolution 概览

Harness Evolution 关注冻结模型如何通过技能库、context、workflow、harness code 与评估闭环积累外部能力。

阅读文章
中文

Skill Library

技能库是 harness evolution 的外部程序性记忆层;核心形态包括可执行代码、SKILL.md、SkillRepo 和带测试的 Agent Skills 包。

阅读文章
中文

技能生命周期

技能库瓶颈常在 librarian 与评估:AutoSkill / Ratchet / MUSE 管任务技能;MCE、Meta-Harness 与 Self-Harness 则把生命周期问题抬到 harness 层。

阅读文章
中文

Skill Curation RL

SkillOS 把冻结 executor 与可训练 curator 拆开,用 grouped task streams 与 composite rewards 从延迟反馈中学习长期技能策展策略。

阅读文章
中文

MUSE-Autoskill

ByteDance 的训练无关技能生命周期框架:运行时创建、skill-level memory、单测评估与跨 agent 迁移,在 SkillsBench / SkillLearnBench 上验证。

阅读文章
中文

Harness Engineering

Harness engineering 把模型外部的 workflow、context、工具、文件系统记忆、评估与权限控制视为可演化的能力层。

阅读文章
中文

Meta Context Engineering

MCE 用双层优化共演化 CE skills 与 context artifacts:meta 层 agentic crossover,base 层以 files/code 做完全 agentic 上下文工程。

阅读文章
中文

Meta-Harness

Meta-Harness 用 coding agent 外环搜索 harness 代码,经 filesystem 访问历次源码、分数与执行轨迹,在分类、数学检索与 TerminalBench-2 上超过 ACE/MCE 与手工 harness。

阅读文章
中文

自写技能有效性争议

Ratchet 将 SkillsBench 的 LLM 自写技能 null result 解释为 librarian 问题;MUSE-Autoskill 则显示全生命周期 agent 下自建技能仍有正增益。

阅读文章
中文

Self-Harness

Self-Harness 让固定模型依据自身失败轨迹提出 bounded harness edits,并用 held-in / held-out 非回归门控筛选可推广的 harness 改动。

阅读文章

主题

大模型量化

8 篇

关于大模型量化基本原理、PTQ/QAT 训练流程、GPTQ/AWQ 与 QLoRA 的持续整理。

中文

大模型量化问题地图

大模型量化的核心问题是如何在降精度省显存的同时控制量化噪声,以及何时用校准式 PTQ、何时回到 QAT 或 QLoRA 训练。

阅读文章
中文

线性量化基础

线性量化用 scale 与 zero-point 把浮点映射到低比特整数,粒度与对称性决定精度与算力折中。

阅读文章
中文

PTQ 与 QAT

PTQ 在训后用校准或优化压精度;QAT 在训练中插入伪量化并用 STE 适应噪声,精度更高但成本更大。

阅读文章
中文

GPTQ 与 AWQ

GPTQ 用 Hessian 做层内误差补偿,AWQ 保护高激活通道;两者都是面向 LLM 的校准式 INT4 权重量化,常见配方为 W4A16。

阅读文章
中文

LLM 上的 QAT

torchao / torchtune 的 LLM QAT 通过 prepare 插入伪量化、微调后再 convert,可在 8da4w 等设定上大幅回收相对 PTQ 的精度损失。

阅读文章
中文

QLoRA

QLoRA 用 NF4 冻结基座、高精 LoRA adapter 与 Double Quantization / Paged Optimizer,把大模型微调塞进单卡,但不是经典 QAT。

阅读文章
中文

FP8 训练 Recipe

FP8 训练靠 TE/MCore recipe 在 GEMM 上用 E4M3/E5M2 或 MXFP8;显存与通信收益取决于 primary weights 与并行策略,不等于推理侧 FP8 PTQ。

阅读文章
中文

MXFP4 推理量化

MXFP4 用 E2M1 四比特浮点加每 32 元一块的 block scale,让 gpt-oss 等模型以远低于 BF16 的显存跑推理,并依赖专用 Triton kernel。

阅读文章

主题

On-Policy Distillation

1 篇

关于学生自采样、老师 token 级监督的后训练方法、成功条件与稳定化做法的持续整理。

主题

测试时训练

4 篇

关于测试时改参数或增加算力以获取新技能的方法,以及它与冻结后训练、ICL、ARC-AGI 测量的边界。