BEGIN:VCALENDAR
VERSION:2.0
PRODID:-//gyh//12week-plan//CN
CALSCALE:GREGORIAN
METHOD:PUBLISH
X-WR-CALNAME:个人综合素质提升计划
X-WR-TIMEZONE:Asia/Shanghai
X-WR-CALDESC:12周计划｜每天点开看详情：课程名、讲师、
 哪里看、目的、看完该会答什么
BEGIN:VEVENT
UID:plan12w-000-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20260902T183000
DTEND;TZID=Asia/Shanghai:20260902T185500
SUMMARY:【25分钟】进门先别坐下 3B1B 深度学习 第1章
DESCRIPTION:【课程】3Blue1Brown《深度学习》系列 第1章\n【
 原名】But what is a neural network?（2017年10月）\n【讲师】Gr
 ant Sanderson，斯坦福数学系出身，3Blue1Brown 频道主\n【时
 长】约18分钟\n【哪看】B站搜「3Blue1Brown」官方中文账
 号→深度学习合集；原版 3blue1brown.com\n【为什么先看这
 个】论文劝退人，是因为它默认你已经有画面。先建画
 面，再读论文\n【看完你该能回答】\n1. 一个"神经元"到
 底在算什么？\n2. 权重和偏置分别管什么事？\n3. 为什
 么要分层，层与层之间怎么连的？\n【别做】不要记公
 式，不要暂停查名词。这一集只要"看懂画面"\n【顺手
 】下单两本书：《你的第一本哲学书》Thomas Nagel、《这
 才是心理学》Keith Stanovich\n【今天的真正目标】不是学
 会什么，是让"打开材料"这个动作发生一次
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:3B1B 深度学习 第1章
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：3B1B 深度学习 第1章
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-001-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20260903T183000
DTEND;TZID=Asia/Shanghai:20260903T185500
SUMMARY:【25分钟】进门先别坐下 3B1B 深度学习 第2章
DESCRIPTION:【课程】3Blue1Brown《深度学习》第2章\n【原名
 】Gradient descent\, how neural networks learn\n【讲师】Grant Sande
 rson\n【哪看】同上，B站官方中文账号深度学习合集\n【
 这一集讲什么】梯度下降——把"一堆随机数"变成"学会
 了的模型"的那台发动机\n【看完你该能回答】\n1. "损失
 函数"是在衡量什么？\n2. 为什么叫"下降"？下降的是什
 么，沿着什么方向？\n3. 学习率太大太小分别会怎样？\
 n【一个比喻】想象你在浓雾里下山，只能看见脚下一
 小块地。梯度下降就是"每一步都朝最陡的下坡方向迈
 一小步"\n【别慌】看到偏导数符号不用停下来学微积分
 ，看画面就行
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:3B1B 深度学习 第2章
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：3B1B 深度学习 第2章
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-002-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20260904T183000
DTEND;TZID=Asia/Shanghai:20260904T185500
SUMMARY:【25分钟】进门先别坐下 3B1B 深度学习 第3章
DESCRIPTION:【课程】3Blue1Brown《深度学习》第3章\n【原名
 】What is backpropagation really doing?\n【讲师】Grant Sanderson\n
 【哪看】同上\n【这一集讲什么】反向传播——误差怎
 么从最后一层一路"倒推"回去，告诉每个权重该往哪调\
 n【看完你该能回答】\n1. 为什么要"反向"？正向不行吗
 ？\n2. 每个权重怎么知道自己该调多少？\n3. 什么叫"这
 个神经元希望上一层怎么变"？\n【这一集的价值】看完
 你会觉得反向传播"只能是这样设计"，而不是"有人发明
 了一个技巧"\n【下一集可跳】第4章是本集的微积分版
 ，数学吃力就先跳过，不影响后面
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:3B1B 深度学习 第3章
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：3B1B 深度学习 第3章
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-003-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20260905T090000
DTEND;TZID=Asia/Shanghai:20260905T120000
SUMMARY:【项目半天】 3B1B 第4-6章：一口气看到 Transformer
DESCRIPTION:【今天看三集，约90分钟】\n第4章 Backpropagation 
 calculus —— 第3章的微积分版。数学吃力可跳，不影响
 后面\n第5章 Transformers\, the tech behind LLMs（2024年新增）\n
 第6章 Attention in transformers\, step-by-step\n【讲师】Grant Sand
 erson（3Blue1Brown）\n【哪看】B站官方中文账号深度学习
 合集\n【第5、6章是重点】这是目前解释注意力机制最
 清楚的可视化，没有之一\n【看完必做一件事】关掉视
 频，在纸上手画一遍注意力的数据流：\n一个词进来 →
  变成向量 → Q/K/V 是怎么算出来的 → 它们怎么互相看 
 → 输出是什么\n画不出来就回去重看。这张图你后面要
 看无数遍\n【看完你该能回答】\n1. 为什么叫"注意力"？
 谁在注意谁？\n2. Q、K、V 三个东西各自扮演什么角色？
 \n3. 为什么这个设计能处理"长距离依赖"？\n【今天不写
 代码】下周六才开始敲。今天只建图像
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:3B1B 第4-6章：一口气看到 Transformer
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：3B1B 第4-6章：一口气看到 Transformer
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-004-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20260906T200000
DTEND;TZID=Asia/Shanghai:20260906T203000
SUMMARY:【写笔记】自己写，不许过AI 写笔记 W0
DESCRIPTION:【写笔记】W0《神经网络到底在干什么》\n【字
 数】300字，是上限不是下限。压缩本身就是训练\n【写
 给谁】一个完全不懂的外行，比如你同事\n【铁律】自
 己写，一个字不许过 AI。这是整个计划里唯一不能外包
 的东西\n【判定】写不出来 = 没懂，回去重看。不看文
 笔，只看外行能不能懂\n【头号毛病】用术语解释术语
 （拿"注意力权重"解释"注意力机制"）—— 这是没懂最
 明显的信号\n【存哪】计划目录的「笔记」文件夹，命
 名 W0-神经网络到底在干什么.md\n【今晚21:17】我会自动
 读你的笔记给评语，写进进度记录\n【提示】这是第一
 篇，别追求写好。写"我原来以为X，其实是Y"这种句子
 最有价值\n【写完这一篇，方案就算启动成功了】
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:写笔记 W0
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：写笔记 W0
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-005-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20260907T183000
DTEND;TZID=Asia/Shanghai:20260907T185500
SUMMARY:【25分钟】进门先别坐下 Karpathy 手写GPT 视频 0:00-2
 5:00
DESCRIPTION:【课程】Let's build GPT: from scratch\, in code\, spelled
  out.\n【讲师】Andrej Karpathy（前特斯拉 AI 总监、OpenAI 创
 始成员）\n【属于】Neural Networks: Zero to Hero 系列\n【全
 片时长】1小时56分。今天只看前25分钟\n【哪看】YouTube 
 原版；B站搜「Karpathy 从零构建GPT」有中文字幕搬运\n【
 代码仓库】github.com/karpathy/nn-zero-to-hero\n【课程主页】ka
 rpathy.ai/zero-to-hero.html\n【今天怎么看】先看，不敲。周
 六才动手\n【这25分钟讲什么】读入莎士比亚文本、做
 字符级 tokenizer、划分训练/验证集、搭出最简单的 bigram
  模型\n【看完你该能回答】\n1. 什么叫"字符级"？和"词
 级"差在哪？\n2. 模型的输入和输出到底是什么形状的东
 西？\n【为什么这个视频是本计划的核心】300行代码从
 零跑出一个能生成莎士比亚文风的 GPT。\n公式看十遍，
 不如自己实现一遍矩阵维度对不上被卡两小时
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:Karpathy 手写GPT 视频 0:00-25:00
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：Karpathy 手写GPT 视频 0:00-25:00
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-006-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20260908T183000
DTEND;TZID=Asia/Shanghai:20260908T185500
SUMMARY:【25分钟】进门先别坐下 《你的第一本哲学书》
 第1-2章
DESCRIPTION:【书】《你的第一本哲学书》\n【原名】What Doe
 s It All Mean? A Very Short Introduction to Philosophy\n【作者】Thom
 as Nagel，纽约大学哲学系\n【全书】88页，九个问题，没
 有任何行话\n【今天读】导言 + 第1章（我们怎么知道任
 何事情）\n【篇幅】约15页，25分钟够\n【为什么从这本
 开始】它不讲哲学史、不报人名，直接问真问题。\n是
 我知道的最好的哲学入门，读完你会发现哲学不是背观
 点，是学会问\n【今天带走一个问题】你怎么证明这个
 世界不是你的一场梦？\n想不出答案没关系——Nagel 自
 己也没给答案。哲学的价值在问题的锋利，不在答案的
 现成\n【读法】慢，可以只读15页，但每一页都要真的
 想一下
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:《你的第一本哲学书》第1-2章
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：《你的第一本哲学书》第1-2章
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-007-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20260909T183000
DTEND;TZID=Asia/Shanghai:20260909T185500
SUMMARY:【25分钟】进门先别坐下 Karpathy 手写GPT 视频 25:00-
 50:00
DESCRIPTION:【课程】Let's build GPT（Andrej Karpathy）\n【今天
 】25:00 – 50:00，仍然只看不敲\n【这一段讲什么】从 big
 ram 过渡到"self-attention"的动机：\n为什么一个词需要看
 见它前面的词？最笨的办法（求平均）怎么一步步演化
 成注意力\n【重点：注意"数学技巧"那一段】他用矩阵
 乘法实现"只看前面不看后面"，这个技巧很妙\n【看完
 你该能回答】\n1. bigram 模型的根本缺陷是什么？\n2. 为
 什么"求前面所有词的平均"是个可行但很笨的方案？\n3.
  从"平均"到"加权平均"，权重是怎么来的？\n【和周日3B
 1B第6章对照】同一件事的两种讲法：3B1B 给画面，Karpath
 y 给代码。\n两个都看过，你对注意力的理解就立体了
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:Karpathy 手写GPT 视频 25:00-50:00
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：Karpathy 手写GPT 视频 25:00-50:00
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-008-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20260910T183000
DTEND;TZID=Asia/Shanghai:20260910T185500
SUMMARY:【25分钟】进门先别坐下 《你的第一本哲学书》
 第3-4章
DESCRIPTION:【书】《你的第一本哲学书》Thomas Nagel\n【今
 天读】第2章 他人的心灵 + 第3章 身心问题\n【篇幅】约
 18页\n【这两章问什么】\n· 你怎么知道别人也有"感受"
 ，而不是一台行为逼真的机器？\n· 你的"意识"和你的"
 大脑"是同一个东西吗？\n【和你在学的东西直接相关】
 这正是"大模型有没有理解"这个争论的哲学底座。\n你
 后面读 InstructGPT、读可解释性论文时，会一次次撞回这
 两个问题\n【读完想一下】如果一个模型说"我感到困惑
 "，你凭什么判断这句话是真是假？\n你判断别人时用的
 又是什么标准？
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:《你的第一本哲学书》第3-4章
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：《你的第一本哲学书》第3-4章
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-009-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20260911T183000
DTEND;TZID=Asia/Shanghai:20260911T185500
SUMMARY:【25分钟】进门先别坐下 弹性日 / 看《十二怒汉
 》
DESCRIPTION:【弹性日】落下的今天补。没落下就看片\n【
 片】十二怒汉 12 Angry Men（1957）\n【导演】Sidney Lumet｜96
 分钟｜黑白\n【为什么排它第一】这是一部完整的推理
 教科书。\n一个人靠拆解证据、追问"什么叫合理怀疑"
 ，把 11:1 的局面整个翻过来\n【看的时候盯住一件事】
 每次有人改票，他是被什么说服的？\n是出现了新证据
 ，还是原有证据被重新解释了？——注意，几乎全是后
 者\n【和你的目标的关系】你说想练"思维逻辑"。这部
 片给了这件事最具体的样子：\n不是懂多少道理，是能
 不能在一屋子人都说"显然如此"的时候，问出那句"等一
 下"\n【一句话】它讲的其实不是正义，是认知谦逊
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:弹性日 / 看《十二怒汉》
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：弹性日 / 看《十二怒汉》
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-010-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20260912T090000
DTEND;TZID=Asia/Shanghai:20260912T120000
SUMMARY:【项目半天】 S1：敲出第一个 bigram 模型
DESCRIPTION:【项目】手写GPT · S1 阶段｜今天3-4小时\n【今
 天做完】跟着 Karpathy 视频敲出字符级 bigram 模型，能吐
 出乱码就算成功\n【跟哪一段】Let's build GPT 的 0:00 – 
 约1:00:00\n【代码参考】github.com/karpathy/nn-zero-to-hero（卡
 死了再看，别一上来就抄）\n【环境】PyTorch。3070Ti 够
 用，其实 CPU 都能跑\n【建在哪】新建「手写GPT」项目
 ，第一件事 git init\n【今天的铁律】每一行自己敲。\n
 可以问 AI"这个报错什么意思"、"这个函数参数是什么"
 。\n不许说"帮我实现一下 attention"。破一次例，这项目
 就退化成又一个 vibe coding 项目\n【卡住了怎么办】卡住
 是正常的，卡住才是在学。先自己想20分钟再去问\n【
 验收标准】能跑起来、loss 在下降、能生成一串字符（
 哪怕是乱码）\n【收工前】git commit，写清楚今天做了什
 么
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:S1：敲出第一个 bigram 模型
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：S1：敲出第一个 bigram 模型
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-011-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20260913T200000
DTEND;TZID=Asia/Shanghai:20260913T203000
SUMMARY:【写笔记】自己写，不许过AI 写笔记 W1
DESCRIPTION:【写笔记】W1《这周最卡住我的那件事》\n【字
 数】300字，是上限不是下限。压缩本身就是训练\n【写
 给谁】一个完全不懂的外行，比如你同事\n【铁律】自
 己写，一个字不许过 AI。这是整个计划里唯一不能外包
 的东西\n【判定】写不出来 = 没懂，回去重看。不看文
 笔，只看外行能不能懂\n【头号毛病】用术语解释术语
 （拿"注意力权重"解释"注意力机制"）—— 这是没懂最
 明显的信号\n【存哪】计划目录的「笔记」文件夹，命
 名 W1-这周最卡住我的那件事.md\n【今晚21:17】我会自动
 读你的笔记给评语，写进进度记录\n【这周题目自选】
 写你卡得最久的那个点，以及最后怎么想通的\n【为什
 么写卡点比写知识点好】卡点是你自己的，知识点是别
 人的
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:写笔记 W1
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：写笔记 W1
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-012-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20260914T183000
DTEND;TZID=Asia/Shanghai:20260914T185500
SUMMARY:【25分钟】进门先别坐下 Word2Vec：词怎么变成向量
DESCRIPTION:【论文】Efficient Estimation of Word Representations in V
 ector Space\n【作者】Tomas Mikolov 等（Google），2013\n【哪找
 】arXiv 搜标题即可\n【配套】B站「跟李沐学AI」→ 论文
 精读系列，有逐段中文讲解，先看视频再看原文会顺很
 多\n【今天读到哪】看中文解读或李沐视频就够，原文
 可不读\n【核心问题】计算机不认字，只认数。那"苹果
 "这个词该变成哪串数字？\n【著名的那个例子】向量("
 国王") - 向量("男人") + 向量("女人") ≈ 向量("女王")\n【
 看完你该能回答】\n1. 为什么"意思相近的词，向量也相
 近"这件事能自动学出来？\n2. 它靠什么信号学？（提示
 ：一个词的意思，由它周围经常出现哪些词决定）\n【
 这是整条线的起点】没有"词变向量"，后面全都不成立
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:Word2Vec：词怎么变成向量
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：Word2Vec：词怎么变成向量
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-013-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20260915T183000
DTEND;TZID=Asia/Shanghai:20260915T185500
SUMMARY:【25分钟】进门先别坐下 《你的第一本哲学书》
 第5-6章
DESCRIPTION:【书】《你的第一本哲学书》Thomas Nagel\n【今
 天读】第4章 语词的意义 + 第5章 自由意志\n【自由意志
 那章是全书最锋利的一章】\n如果你的每个决定都是大
 脑里的物理过程，而物理过程遵循因果律，\n那"你本可
 以做另一个选择"这句话还成立吗？\n【和你在学的东西
 的暗线】你正在训练一个用梯度下降做决定的模型。\n
 它的"选择"是被权重决定的。那你的呢？\n【读完带走
 一个问题】如果自由意志不存在，"责任"这个概念还剩
 下什么？\n【不用得出结论】能把问题想清楚，比急着
 站队有价值得多
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:《你的第一本哲学书》第5-6章
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：《你的第一本哲学书》第5-6章
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-014-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20260916T183000
DTEND;TZID=Asia/Shanghai:20260916T185500
SUMMARY:【25分钟】进门先别坐下 Seq2Seq + Bahdanau 注意力
DESCRIPTION:【论文一】Sequence to Sequence Learning with Neural Netw
 orks\n　　　　Sutskever / Vinyals / Le（Google），2014\n【论文
 二】Neural Machine Translation by Jointly Learning to Align and Transl
 ate\n　　　　Bahdanau / Cho / Bengio，2014\n【哪找】arXiv 搜
 标题\n【配套】B站「跟李沐学AI」→ 论文精读系列，有
 逐段中文讲解，先看视频再看原文会顺很多\n【今天的
 核心问题，只有一个】\nSeq2Seq 把整个句子压进一个固
 定长度的向量，再解码出译文。\n句子一长，这个向量
 就装不下了 —— 这就是那个瓶颈。\nBahdanau 的解法：**
 别压了，解码每个词的时候，回头去看原句的所有词，
 按需取用。**\n这就是注意力\n【为什么必须读这两篇】
 读完你才知道：\n注意力不是天才灵感，是被一个具体
 的工程瓶颈硬逼出来的\n【看完你该能回答】\n1. 固定
 长度向量为什么是瓶颈？\n2. "对齐"（align）在翻译里是
 什么意思？\n3. 注意力和"对齐"是什么关系？
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:Seq2Seq + Bahdanau 注意力
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：Seq2Seq + Bahdanau 注意力
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-015-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20260917T183000
DTEND;TZID=Asia/Shanghai:20260917T185500
SUMMARY:【25分钟】进门先别坐下 《你的第一本哲学书》
 读完
DESCRIPTION:【书】《你的第一本哲学书》Thomas Nagel\n【今
 天读完】第6章 对与错 + 第7章 正义 + 第8章 死亡 + 第9
 章 生活的意义\n【篇幅】约25页，四章都很短\n【最后
 一章值得慢读】Nagel 谈"生活有没有意义"时，没有给鸡
 汤，\n他的处理方式是：把这个问题拆开，看它到底在
 问什么\n【读完做一件事】合上书，回想哪个问题最让
 你不舒服。那个就是对你最有用的问题\n【这本书的价
 值】它不给你观点，它给你"怎么把一个模糊的困惑变
 成一个清晰的问题"\n—— 这恰好也是你要写的300字笔
 记在训练的能力\n【下一本】《这才是心理学》，W3 开
 始
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:《你的第一本哲学书》读完
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：《你的第一本哲学书》读完
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-016-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20260918T183000
DTEND;TZID=Asia/Shanghai:20260918T185500
SUMMARY:【25分钟】进门先别坐下 弹性日
DESCRIPTION:【弹性日】\n这周落下的，今天补上。没落下
 就休息，或者看排好的片。\n【设计说明】这不是补课
 日，是缓冲带。落下就落下，不设追债机制——\n"补课
 "是学习计划崩溃的头号杀手，它会把一天的漏变成整
 周的崩。
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:弹性日
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：弹性日
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-017-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20260919T090000
DTEND;TZID=Asia/Shanghai:20260919T120000
SUMMARY:【项目半天】 S2上：自己实现单头 self-attention
DESCRIPTION:【项目】手写GPT · S2 上｜今天3-4小时\n【今天
 做完】不看视频，自己写出单头 self-attention\n【为什么
 不看视频】这是整个计划里最关键的一次"挣扎"。\nKarpa
 thy 已经讲过一遍了，现在闭卷做。做不出来再回去看
 ，但先自己撞两小时\n【你要自己想明白的三件事】\n1.
  Q、K、V 分别从哪来？（提示：都是输入乘一个可学的
 矩阵）\n2. 为什么要除以 sqrt(head_size)？不除会怎样？\n3
 . 那个上三角 mask 是干嘛的？去掉会发生什么？\n【最
 容易卡的地方】矩阵维度。建议每写一行就 print 一下 s
 hape\n【卡住了怎么办】卡住是正常的，卡住才是在学。
 先自己想20分钟。\n真过不去了，回视频里 50:00-1:10:00 
 那段\n【铁律】不许让 AI 写实现。问报错可以，问"帮
 我写"不行\n【验收】能跑、维度对、loss 比 bigram 低\n【
 收工】git commit
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:S2上：自己实现单头 self-attention
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：S2上：自己实现单头 self-attention
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-018-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20260920T200000
DTEND;TZID=Asia/Shanghai:20260920T203000
SUMMARY:【写笔记】自己写，不许过AI 写笔记 W2
DESCRIPTION:【写笔记】W2《注意力机制解决了什么问题》\n
 【字数】300字，是上限不是下限。压缩本身就是训练\n
 【写给谁】一个完全不懂的外行，比如你同事\n【铁律
 】自己写，一个字不许过 AI。这是整个计划里唯一不能
 外包的东西\n【判定】写不出来 = 没懂，回去重看。不
 看文笔，只看外行能不能懂\n【头号毛病】用术语解释
 术语（拿"注意力权重"解释"注意力机制"）—— 这是没
 懂最明显的信号\n【存哪】计划目录的「笔记」文件夹
 ，命名 W2-注意力机制解决了什么问题.md\n【今晚21:17】
 我会自动读你的笔记给评语，写进进度记录\n【这篇的
 关键】要讲清"在它之前人们卡在哪"。\n只讲注意力怎
 么算 = 没懂；讲清它为什么必须被发明出来 = 懂了
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:写笔记 W2
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：写笔记 W2
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-019-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20260921T183000
DTEND;TZID=Asia/Shanghai:20260921T185500
SUMMARY:【25分钟】进门先别坐下 Attention Is All You Need 第一
 遍
DESCRIPTION:【论文】Attention Is All You Need —— Transformer 原
 始论文\n【作者】Vaswani 等8人（Google Brain / Google Research
 ），2017\n【哪找】arXiv 搜标题，或 arxiv.org/abs/1706.03762\n
 【配套】B站「跟李沐学AI」→ 论文精读系列，有逐段
 中文讲解，先看视频再看原文会顺很多\n【今天只读第
 一遍】10分钟法：标题、摘要、结论、所有图。**不要
 读正文**\n【重点看 Figure 1】那张 Transformer 结构图。\n
 这周结束时，你要能指着这张图的每一块说出它干嘛的
 \n【为什么现在读它会顺】你已经知道了：注意力是被 
 Seq2Seq 的瓶颈逼出来的（W2）、\nQ/K/V 长什么样（3B1B 第6
 章）、代码怎么写（上周六）。\n这篇论文对你不再是
 天书，是"把已知的东西正式说一遍"\n【标题的含义】"
 注意力就是你所需要的全部"——\n潜台词是：把 RNN、CN
 N 全扔了，只留注意力，效果反而更好。当年这是很狂
 的说法\n【读不懂正文是设计好的】第一遍就不该读正
 文
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:Attention Is All You Need 第一遍
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：Attention Is All You Need 第一遍
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-020-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20260922T183000
DTEND;TZID=Asia/Shanghai:20260922T185500
SUMMARY:【25分钟】进门先别坐下 《这才是心理学》第1-2
 章
DESCRIPTION:【书】《这才是心理学》\n【原名】How to Think S
 traight About Psychology\n【作者】Keith E. Stanovich，多伦多大
 学\n【别被书名骗了】这不是心理学入门，这是**最好
 的批判性思维教材**。\n心理学只是它的例子库\n【今天
 读】第1章（心理学是什么）+ 第2章（可证伪性）\n【第
 2章是全书地基】一个理论如果怎么都能解释、永远不
 会被推翻，\n那它不是很强，而是**没有内容**\n【读完
 你会得到一把刀】以后看到任何说法，先问一句：\n"什
 么样的事实出现，能证明这句话是错的？"答不上来的
 ，基本是废话\n【和你在读的论文的关系】W7 你会读到 
 Scaling Laws 被 Chinchilla 推翻的过程。\n那就是可证伪性的
 活标本
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:《这才是心理学》第1-2章
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：《这才是心理学》第1-2章
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-021-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20260923T183000
DTEND;TZID=Asia/Shanghai:20260923T185500
SUMMARY:【25分钟】进门先别坐下 Attention Is All You Need 第二
 遍
DESCRIPTION:【论文】Attention Is All You Need（Vaswani 等，2017）
 \n【今天读第二遍】读正文，**跳过所有公式推导**，重
 点看图和实验设置\n【配套】B站「跟李沐学AI」→ 论文
 精读系列，有逐段中文讲解，先看视频再看原文会顺很
 多\n【按这个顺序读】\n3.1 编码器和解码器结构 → 3.2 
 注意力（这节最重要）→ 3.3 前馈层 →\n3.5 位置编码（
 为什么需要它？因为注意力本身不知道词的先后顺序）
 \n【看完你该能回答】\n1. 编码器和解码器各有几层？
 每层里有什么？\n2. "多头"的多个头，各自看的是不一
 样的东西吗？\n3. 没有位置编码会怎样？（提示：句子
 会变成一袋词）\n4. 为什么它比 RNN 快？（提示：RNN 必
 须一个词一个词算，它可以全部并行）\n【今天的目标
 】让 Figure 1 那张图从"一堆方块"变成"我知道每块在干
 嘛"\n【读不懂公式很正常】第三遍才读公式，而且第三
 遍不是必须的
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:Attention Is All You Need 第二遍
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：Attention Is All You Need 第二遍
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-022-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20260924T183000
DTEND;TZID=Asia/Shanghai:20260924T185500
SUMMARY:【25分钟】进门先别坐下 《这才是心理学》第3-4
 章
DESCRIPTION:【书】《这才是心理学》Keith Stanovich\n【今天
 读】第3章 操作主义与本质主义 + 第4章 见证叙述与个
 案研究\n【第4章最实用】"我有个朋友吃了这个就好了"
 ——\n这类见证叙述为什么在证据等级里几乎为零？\n
 【你会立刻用上】以后看到任何"某某用了之后效果显
 著"的说法，\n你会自动想到：那些用了没效果的人去哪
 了？（幸存者偏差）\n【第3章教你一件事】问"什么是
 智力"没用，问"用什么可测量的东西来定义智力"才有用
 。\n把模糊概念变成可操作的定义 —— 这是科学思维
 的核心动作\n【和你写笔记的关系】你那300字如果全是
 模糊大词，就是本质主义式的空转。\n写具体、写可检
 验的，才是操作主义式的
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:《这才是心理学》第3-4章
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：《这才是心理学》第3-4章
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-023-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20260925T183000
DTEND;TZID=Asia/Shanghai:20260925T185500
SUMMARY:【25分钟】进门先别坐下 弹性日 / 看《降临》
DESCRIPTION:【弹性日】落下的今天补。没落下就看片\n【
 片】降临 Arrival（2016）\n【导演】Denis Villeneuve｜116分钟
 ｜改编自姜峯楠《你一生的故事》\n【为什么是这部】
 它讲的是语言学家怎么破译外星语言，\n但真正的题目
 是：**你使用的语言，会不会反过来塑造你能想到什么
 ？**\n（这叫萨丕尔-沃尔夫假说）\n【和你学的东西是
 同一个问题的两端】\n你在学的是"怎么让机器处理语言
 "；这部片问的是"语言对使用者做了什么"\n【看的时候
 留意】主角学会那门语言之后，她对时间的体验发生了
 什么变化？\n【看完想一个问题】如果你只会用一种语
 言思考，有哪些念头是你天生想不到的？\n【提醒】这
 片子的时间线是故意打乱的，第一遍看不懂结构很正常
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:弹性日 / 看《降临》
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：弹性日 / 看《降临》
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-024-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20260926T090000
DTEND;TZID=Asia/Shanghai:20260926T120000
SUMMARY:【项目半天】 S2下：单头 attention 调通
DESCRIPTION:【项目】手写GPT · S2 下｜今天3-4小时\n【今天
 做完】上周没调通的地方全部搞定，模型能训练、loss 
 稳定下降\n【如果上周已经通了】那今天做这三件事：\
 n1. 把 attention 的中间结果打出来看：那个权重矩阵到底
 长什么样？\n2. 手动改一下 mask，看看去掉上三角会发
 生什么（模型会"作弊"看见未来）\n3. 试试不除 sqrt(head_
 size)，观察 loss 怎么变\n【为什么要做这三件事】这叫**
 消融实验**——把一个零件拿掉，看会坏成什么样。\n
 这是理解一个系统最快的方式，也是你后面读可解释性
 论文时的核心思维方式\n【今天的收获应该是】你能说
 出注意力里每一步"如果不这么做会怎样"\n【铁律】自
 己动手，不许让 AI 代写\n【收工】git commit
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:S2下：单头 attention 调通
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：S2下：单头 attention 调通
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-025-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20260927T200000
DTEND;TZID=Asia/Shanghai:20260927T203000
SUMMARY:【写笔记】自己写，不许过AI 写笔记 W3
DESCRIPTION:【写笔记】W3《Transformer 凭什么取代了 RNN》\n
 【字数】300字，是上限不是下限。压缩本身就是训练\n
 【写给谁】一个完全不懂的外行，比如你同事\n【铁律
 】自己写，一个字不许过 AI。这是整个计划里唯一不能
 外包的东西\n【判定】写不出来 = 没懂，回去重看。不
 看文笔，只看外行能不能懂\n【头号毛病】用术语解释
 术语（拿"注意力权重"解释"注意力机制"）—— 这是没
 懂最明显的信号\n【存哪】计划目录的「笔记」文件夹
 ，命名 W3-Transformer 凭什么取代了 RNN.md\n【今晚21:17】我
 会自动读你的笔记给评语，写进进度记录\n【这篇要讲
 清两件事】\n1. RNN 的结构性缺陷是什么（提示：必须串
 行 + 长距离信息会衰减）\n2. Transformer 用什么换掉了它
 ，代价是什么（提示：并行换来了平方级的计算量）\n
 【写出"代价"是加分项】只讲好处不讲代价，说明还没
 真懂
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:写笔记 W3
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：写笔记 W3
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-026-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20260928T183000
DTEND;TZID=Asia/Shanghai:20260928T185500
SUMMARY:【25分钟】进门先别坐下 多头注意力：为什么要
 多个头
DESCRIPTION:【材料】Attention Is All You Need 第3.2.2节 + 回看 3B
 1B 第6章对应片段\n【今天的唯一问题】一个注意力头已
 经能算了，为什么要搞8个、16个？\n【标准答案】不同
 的头能学会关注不同类型的关系。\n比如有的头盯语法
 上的主谓关系，有的头盯代词指代谁，有的头盯远距离
 的呼应\n【但更重要的是这个追问】这是设计出来的，
 还是自己长出来的？\n—— 是自己长出来的。没有人告
 诉每个头该关注什么，是训练过程分工分出来的\n【这
 个追问指向 W10-W11】机制可解释性研究干的就是：\n事
 后拆开模型，看每个头到底自己学会了什么。你 11 月
 会读到 induction head，\n那是人类第一次在模型里明确指
 认出一个"功能器官"\n【看完你该能回答】多头的"多"，
 多在哪？拼接之后怎么变回原来的维度？
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:多头注意力：为什么要多个头
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：多头注意力：为什么要多个头
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-027-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20260929T183000
DTEND;TZID=Asia/Shanghai:20260929T185500
SUMMARY:【25分钟】进门先别坐下 《这才是心理学》第5-6
 章
DESCRIPTION:【书】《这才是心理学》Keith Stanovich\n【今天
 读】第5章 相关与因果 + 第6章 让一切置于控制之下（
 实验设计）\n【第5章是全书使用频率最高的一章】\n"经
 常运动的人更健康" —— 是运动导致健康，还是健康的
 人才有力气运动，\n还是有第三个因素（比如收入）同
 时导致了两者？\n【学会一个词：混淆变量】以后你看
 任何数据结论，先找它\n【第6章讲怎么破】随机分组的
 实验，为什么能斩断混淆变量？\n【立刻能用在哪】\n·
  看财经新闻里的"某指标上涨导致股市上涨"\n· 看你自
 己的工作：某个设计参数和结果之间，是相关还是因果
 ？\n· 看 AI 论文：模型效果好，真是那个新模块的功劳
 吗？（这就是为什么要做消融实验）
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:《这才是心理学》第5-6章
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：《这才是心理学》第5-6章
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-028-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20260930T183000
DTEND;TZID=Asia/Shanghai:20260930T185500
SUMMARY:【25分钟】进门先别坐下 残差连接 与 LayerNorm
DESCRIPTION:【材料】找中文解读即可，不用读原论文\n【
 今天搞懂两个零件，它们都不起眼但缺了就跑不起来】
 \n【残差连接 Residual Connection】\n把输入直接加到输出上
 ：output = f(x) + x\n解决什么：网络一深，梯度传回去就
 衰减没了（梯度消失）。\n加一条"高速公路"让梯度能
 直接跳回去\n一个比喻：不是让每层重新画一张画，而
 是让每层在上一张画上改一笔\n【层归一化 LayerNorm】\n
 把每层的输出拉回到相近的数值范围\n解决什么：数值
 忽大忽小，训练就不稳定\n【看完你该能回答】\n1. 为
 什么深网络会梯度消失？\n2. 残差为什么能缓解？\n3. 
 这两个东西在 Transformer 的哪个位置？（看 Figure 1 上那
 些 Add & Norm）\n【周六你要实现它们】所以今天必须搞
 懂，不能囫囵
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:残差连接 与 LayerNorm
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：残差连接 与 LayerNorm
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-029-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261003T090000
DTEND;TZID=Asia/Shanghai:20261003T120000
SUMMARY:【项目半天】 S3：多头+残差+LayerNorm 跑通
DESCRIPTION:【项目】手写GPT · S3｜今天3-4小时｜国庆假期
 ，别有负担\n【今天做完】完整的 Transformer block 跑起来
 \n【要加的四样东西】\n1. 多头注意力（把单头复制多
 份，拼接后过一个线性层）\n2. 前馈网络 FFN（就是两层
 全连接，中间夹个激活函数）\n3. 残差连接（两处：注
 意力后、FFN后）\n4. LayerNorm\n【可以回看视频了】Karpathy
  视频 1:10:00 之后那一段就在讲这些。\n但还是先自己写
 ，写完再对答案\n【最容易出错的地方】残差和 LayerNorm
  的先后顺序（Pre-LN 还是 Post-LN）。\n原论文是 Post-LN，
 现在主流是 Pre-LN。两个都试试，看 loss 差别\n【验收】
 loss 明显低于单头版本，生成的文本开始有"像英文"的
 感觉\n【假期声明】这周故意不加量。想做就做，不想
 做就彻底休息。\n唯一要求：10月4日之前把 W4 笔记写了
 \n【收工】git commit
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:S3：多头+残差+LayerNorm 跑通
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：S3：多头+残差+LayerNorm 跑通
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-030-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261004T200000
DTEND;TZID=Asia/Shanghai:20261004T203000
SUMMARY:【写笔记】自己写，不许过AI 写笔记 W4
DESCRIPTION:【写笔记】W4《一个 Transformer block 里有什么》\
 n【字数】300字，是上限不是下限。压缩本身就是训练\n
 【写给谁】一个完全不懂的外行，比如你同事\n【铁律
 】自己写，一个字不许过 AI。这是整个计划里唯一不能
 外包的东西\n【判定】写不出来 = 没懂，回去重看。不
 看文笔，只看外行能不能懂\n【头号毛病】用术语解释
 术语（拿"注意力权重"解释"注意力机制"）—— 这是没
 懂最明显的信号\n【存哪】计划目录的「笔记」文件夹
 ，命名 W4-一个 Transformer block 里有什么.md\n【今晚21:17】
 我会自动读你的笔记给评语，写进进度记录\n【这篇写
 成"零件说明书"】四个零件各是什么、各解决什么问题
 、缺了会怎样\n【假期版要求放低】写不动就写200字，
 但必须写
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:写笔记 W4
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：写笔记 W4
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-031-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261005T183000
DTEND;TZID=Asia/Shanghai:20261005T185500
SUMMARY:【25分钟】进门先别坐下 GPT-1 论文
DESCRIPTION:【论文】Improving Language Understanding by Generative Pr
 e-Training\n【作者】Alec Radford 等（OpenAI），2018\n【注意
 】这篇不在 arXiv 上，是 OpenAI 的技术报告。搜标题能找
 到 PDF\n【配套】B站「跟李沐学AI」→ 论文精读系列，
 有逐段中文讲解，先看视频再看原文会顺很多\n【这篇
 提出了什么】"预训练 + 微调"两段式：\n先用海量无标
 注文本让模型学会"预测下一个词"，\n再用少量标注数
 据针对具体任务微调\n【为什么是转折点】在它之前，
 每个任务都要从头训一个模型、都要大量标注数据。\n
 之后，一个底座模型可以派生出无数应用\n【结构上它
 做了什么】只用了 Transformer 的解码器部分，把编码器
 扔了\n【看完你该能回答】\n1. "预训练"到底在训什么？
 （提示：一个极其简单的任务——猜下一个词）\n2. 为
 什么"猜下一个词"这么简单的目标，能让模型学会那么
 多东西？\n3. 微调阶段改了什么？
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:GPT-1 论文
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：GPT-1 论文
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-032-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261006T183000
DTEND;TZID=Asia/Shanghai:20261006T185500
SUMMARY:【25分钟】进门先别坐下 《这才是心理学》第7-8
 章
DESCRIPTION:【书】《这才是心理学》Keith Stanovich\n【今天
 读】第7章 "但是这不是真实生活！"（人为性批评）+ 第
 8章 避免爱因斯坦综合症\n【第7章回应一个常见质疑】
 实验室里的研究"太人工了、不像真实生活"，\n所以没
 意义 —— 这个批评为什么大部分时候是错的？\n【第8
 章讲一件反直觉的事】科学进步很少靠一个天才的一击
 定音，\n绝大部分是靠**大量平庸的、渐进的、可复制
 的小研究**堆出来的\n【这一章对你有直接价值】你觉
 得自己的项目"浮于表面"、想做出点大东西，\n但真正
 的进展长这样：每周一小步，堆12周\n【一句话】想清
 楚这件事，能治好很多"我做的东西没意义"的焦虑
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:《这才是心理学》第7-8章
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：《这才是心理学》第7-8章
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-033-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261007T183000
DTEND;TZID=Asia/Shanghai:20261007T185500
SUMMARY:【25分钟】进门先别坐下 BERT + 与 GPT 对照
DESCRIPTION:【论文】BERT: Pre-training of Deep Bidirectional Transfor
 mers\n【作者】Jacob Devlin 等（Google），2018\n【哪找】arXiv
  搜标题，或 arxiv.org/abs/1810.04805\n【配套】B站「跟李沐
 学AI」→ 论文精读系列，有逐段中文讲解，先看视频再
 看原文会顺很多\n【BERT 走了另一条路】用 Transformer 的*
 *编码器**，双向：\n同时看左边和右边，靠"完形填空"
 （把词挖掉让模型猜）来训练\n【今天的核心问题，只
 有一个】\n2018年 BERT 效果全面碾压 GPT-1，为什么最后赢
 的是 GPT 这条路？\n【自己先想，再看提示】\n提示1：
 双向的代价是什么？（挖空训练的模型，天生不会"往
 下写"）\n提示2：什么样的能力能随规模无限增长？\n提
 示3：一个只会填空的模型，能变成聊天助手吗？\n【这
 是本计划里最好的一道思考题】\n它不是技术细节题，
 是"什么样的技术路线有未来"的判断题。\n你在工作里
 做技术选型时，用的是同一种思维
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:BERT + 与 GPT 对照
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：BERT + 与 GPT 对照
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-034-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261008T183000
DTEND;TZID=Asia/Shanghai:20261008T185500
SUMMARY:【25分钟】进门先别坐下 《这才是心理学》第9-10
 章
DESCRIPTION:【书】《这才是心理学》Keith Stanovich\n【今天
 读】第9章 打破"唯一原因"的迷思（多重原因）+ 第10章 
 人类认知的阿喀琉斯之踵：概率推理\n【第10章是全书
 最难也最值钱的一章】\n人脑天生不会算概率。基础比
 率忽视、赌徒谬误、对小样本过度自信——\n这些不是
 笨，是硬件缺陷，人人都有\n【一个经典例子】某病发
 病率万分之一，检测准确率99%。\n你测出阳性，实际患
 病概率是多少？\n（直觉说99%，正确答案约1%。想不通
 就是这一章要治的）\n【和 AI 的关系】大模型本质上就
 是一台概率机器——\n它输出的每个词都是在算"下一个
 词最可能是什么"。\n你对概率的直觉越准，对模型行为
 的理解就越准
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:《这才是心理学》第9-10章
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：《这才是心理学》第9-10章
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-035-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261009T183000
DTEND;TZID=Asia/Shanghai:20261009T185500
SUMMARY:【25分钟】进门先别坐下 弹性日 / 纪录片《监视
 资本主义》
DESCRIPTION:【弹性日】落下的今天补\n【片】监视资本主
 义：智能陷阱 The Social Dilemma（2020）\n【类型】纪录片
 ｜94分钟｜Netflix\n【为什么给你排这部】它请的是 Facebo
 ok、Google、Twitter、Pinterest 的\n前产品经理和工程师，让
 他们讲**自己当年是怎么设计出让人停不下来的产品的*
 *\n【这不是道德说教，是工程细节】\n无限下拉、变量
 奖励、推送时机、"你的朋友也在看"——\n每一个都是
 被 A/B 测试优化过成千上万次的\n【看完你该明白一件
 事】\n你刷抖音停不下来，不是因为你自控力差。\n是
 因为地球上最聪明的一批工程师，花了十年时间、用海
 量数据，\n专门优化"如何让你停不下来"这个目标函数
 。\n这是一场不对等的战争\n【所以本方案的设计是】
 不跟它硬拼意志力，只管顺序：\n先做25分钟，然后随
 便刷。因为"启动"这一下必须发生在你资源还没耗尽的
 时候
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:弹性日 / 纪录片《监视资本主义》
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：弹性日 / 纪录片《监视资本主义》
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-036-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261010T090000
DTEND;TZID=Asia/Shanghai:20261010T120000
SUMMARY:【项目半天】 完整 Transformer 收尾
DESCRIPTION:【项目】手写GPT｜今天3-4小时\n【今天做完】
 把整个模型串起来，训练出能生成莎士比亚文风文本的
  GPT\n【要做的】\n1. 堆叠多个 Transformer block（比如6层）
 \n2. 加 dropout\n3. 调好超参：学习率、batch size、block size
 、embedding 维度\n4. 完整训练一轮，把 loss 曲线画出来\n
 【一个里程碑】跑完这一步，你就完成了 Karpathy 那个
 视频的全部内容。\n你有了一个自己从零敲出来的、能
 工作的 GPT\n【生成的文本会像什么】不会有意义，但会
 有莎士比亚的"形状"：\n人名大写、对话格式、分行—
 —它学会了形式，还没学会内容\n【停下来想一件事】
 它明明只是在"猜下一个字符"，\n为什么会学出格式、
 拼写、甚至人名？\n【收工】git commit + 把生成的样例存
 下来，以后回看很有意思
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:完整 Transformer 收尾
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：完整 Transformer 收尾
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-037-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261011T200000
DTEND;TZID=Asia/Shanghai:20261011T203000
SUMMARY:【写笔记】自己写，不许过AI 写笔记 W5
DESCRIPTION:【写笔记】W5《GPT 和 BERT 走了两条什么路》\n
 【字数】300字，是上限不是下限。压缩本身就是训练\n
 【写给谁】一个完全不懂的外行，比如你同事\n【铁律
 】自己写，一个字不许过 AI。这是整个计划里唯一不能
 外包的东西\n【判定】写不出来 = 没懂，回去重看。不
 看文笔，只看外行能不能懂\n【头号毛病】用术语解释
 术语（拿"注意力权重"解释"注意力机制"）—— 这是没
 懂最明显的信号\n【存哪】计划目录的「笔记」文件夹
 ，命名 W5-GPT 和 BERT 走了两条什么路.md\n【今晚21:17】我
 会自动读你的笔记给评语，写进进度记录\n【这篇的关
 键】不要只写"一个单向一个双向"。\n要写清：这个选
 择带来了什么能力、放弃了什么能力、为什么这个取舍
 在后来变得决定性\n【能写出"取舍"的，就是想明白了
 】
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:写笔记 W5
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：写笔记 W5
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-038-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261012T183000
DTEND;TZID=Asia/Shanghai:20261012T185500
SUMMARY:【25分钟】进门先别坐下 GPT-2 论文
DESCRIPTION:【论文】Language Models are Unsupervised Multitask Learne
 rs\n【作者】Alec Radford 等（OpenAI），2019\n【哪找】搜标
 题，OpenAI 官网有 PDF\n【配套】B站「跟李沐学AI」→ 论
 文精读系列，有逐段中文讲解，先看视频再看原文会顺
 很多\n【这篇的惊人主张】不用微调，模型也能做各种
 任务——只要模型够大、数据够杂\n【为什么叫"无监督
 多任务"】\n它没有专门学"翻译"这个任务。但训练数据
 里恰好有"这句英文的意思是……"这种文本，\n于是它
 顺带就学会了翻译\n【这个洞见很深】所有任务都可以
 写成文本。\n既然模型学会了续写文本，那它就顺带学
 会了所有能用文本表达的任务\n【看完你该能回答】\n1.
  "zero-shot"是什么意思？和"微调"差在哪？\n2. GPT-2 相比 G
 PT-1 主要变了什么？（提示：主要就是变大了、数据变
 多变杂了）\n3. 为什么 OpenAI 当年说这个模型"太危险不
 能全部开源"？
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:GPT-2 论文
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：GPT-2 论文
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-039-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261013T183000
DTEND;TZID=Asia/Shanghai:20261013T185500
SUMMARY:【25分钟】进门先别坐下 《这才是心理学》读完
DESCRIPTION:【书】《这才是心理学》Keith Stanovich\n【今天
 读完】第11章 偶然性在心理学中的作用 + 第12章 不招人
 待见的心理学\n【第11章讲一件难受的事】\n很多结果就
 是随机的。人脑却拼命想在随机里找规律——\n看到连
 续三次涨就觉得有趋势，看到巧合就觉得有意义\n【这
 一章能救你两种钱】\n一是股票（你有在关注），二是
 对自己人生的过度归因\n【第12章解释一个现象】为什
 么心理学的严肃研究总被伪心理学盖过？\n因为真研究
 给的答案又慢又不确定，伪科学给的答案又快又爽\n【
 读完这本书，回头做一件事】\n翻回第2章可证伪性，用
 它检查一下你最近相信的三个说法。\n能想出"什么事实
 会推翻它"的，留下；想不出的，打个问号\n【这本书是
 本计划里性价比最高的一本】它给的是刀，不是知识
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:《这才是心理学》读完
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：《这才是心理学》读完
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-040-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261014T183000
DTEND;TZID=Asia/Shanghai:20261014T185500
SUMMARY:【25分钟】进门先别坐下 GPT-3 论文
DESCRIPTION:【论文】Language Models are Few-Shot Learners\n【作者
 】Tom Brown 等（OpenAI），2020｜175B 参数\n【哪找】arXiv 搜
 标题，或 arxiv.org/abs/2005.14165\n【这篇很长，别全读】只
 读：摘要 + 第3节（结果）+ Figure 1.2 和 Figure 3.x 那几张
 曲线图\n【配套】B站「跟李沐学AI」→ 论文精读系列，
 有逐段中文讲解，先看视频再看原文会顺很多\n【核心
 发现】模型大到一定程度，出现了"few-shot"能力：\n在提
 示词里给它几个例子，它当场就学会了新任务，不用改
 一个参数\n【这就是你现在天天在用的东西】\n你给 Clau
 de 写提示词、举几个例子让它照做 —— 那个能力就是
 从这里来的\n【看完你该能回答】\n1. zero-shot / one-shot / 
 few-shot 分别是什么？\n2. 模型越大，few-shot 的优势越明
 显还是越小？（看那些曲线）\n3. "涌现"这个词在这里
 指什么？\n【一个值得存疑的点】"涌现"到底是真的突
 变，还是我们的度量方式造成的错觉？\n这个争议后来
 很大。保持怀疑，这正是你在练的东西
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:GPT-3 论文
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：GPT-3 论文
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-041-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261015T183000
DTEND;TZID=Asia/Shanghai:20261015T185500
SUMMARY:【25分钟】进门先别坐下 复习：GPT 三代差别
DESCRIPTION:【今天不读新东西，做一次压缩】\n【任务】
 用三句话写清 GPT-1、GPT-2、GPT-3 的差别，写进你的笔记\
 n【要求】每句话必须包含"它比上一代多了什么能力"，
 \n不能只说"参数更多了"\n【提示：这条线的内在逻辑】
 \nGPT-1：证明"预训练+微调"可行\nGPT-2：发现不微调也行
 ，只要够大\nGPT-3：发现给几个例子就能学新任务\n——
  一条越来越不需要人工干预的路\n【为什么专门花一天
 做这个】\n压缩是最好的检验。你读了三篇论文，如果
 压不成三句话，说明还是散的\n【顺带想一个问题】按
 这条趋势外推，下一步该是什么？\n（提示：连例子都
 不用给，直接说人话就行 —— 那就是下周的 InstructGPT
 ）
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:复习：GPT 三代差别
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：复习：GPT 三代差别
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-042-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261016T183000
DTEND;TZID=Asia/Shanghai:20261016T185500
SUMMARY:【25分钟】进门先别坐下 弹性日
DESCRIPTION:【弹性日】\n这周落下的，今天补上。没落下
 就休息，或者看排好的片。\n【设计说明】这不是补课
 日，是缓冲带。落下就落下，不设追债机制——\n"补课
 "是学习计划崩溃的头号杀手，它会把一天的漏变成整
 周的崩。
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:弹性日
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：弹性日
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-043-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261017T090000
DTEND;TZID=Asia/Shanghai:20261017T120000
SUMMARY:【项目半天】 S4上：中文语料 + tokenizer
DESCRIPTION:【项目】手写GPT · S4 上｜今天3-4小时\n【今天
 做完】把模型从英文换到中文\n【为什么中文更难】\n
 英文字符级只有几十个符号；中文常用字就有三四千个
 。\n词表一大，embedding 层和输出层都会暴涨\n【今天要
 做的】\n1. 准备语料：可以喂你的 Obsidian 笔记，或者水
 利规范文本\n2. 做 tokenizer：先用最笨的"按字切"，跑通
 再说\n3. 处理词表大小的问题：只保留高频字，剩下的
 映射成 UNK\n【一个真实的工程感受】\n你会第一次体会
 到"数据处理占了80%的时间"这句话\n【进阶（有余力再
 做）】了解一下 BPE（字节对编码）是怎么回事——\n真
 正的大模型都用它，它介于"按字切"和"按词切"之间\n【
 铁律】自己写。数据处理这块最容易图省事让 AI 代劳
 ，但这块恰恰最长功力\n【收工】git commit
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:S4上：中文语料 + tokenizer
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：S4上：中文语料 + tokenizer
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-044-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261018T200000
DTEND;TZID=Asia/Shanghai:20261018T203000
SUMMARY:【写笔记】自己写，不许过AI 写笔记 W6
DESCRIPTION:【写笔记】W6《为什么模型变大就突然会说话
 了》\n【字数】300字，是上限不是下限。压缩本身就是
 训练\n【写给谁】一个完全不懂的外行，比如你同事\n
 【铁律】自己写，一个字不许过 AI。这是整个计划里唯
 一不能外包的东西\n【判定】写不出来 = 没懂，回去重
 看。不看文笔，只看外行能不能懂\n【头号毛病】用术
 语解释术语（拿"注意力权重"解释"注意力机制"）—— 
 这是没懂最明显的信号\n【存哪】计划目录的「笔记」
 文件夹，命名 W6-为什么模型变大就突然会说话了.md\n【
 今晚21:17】我会自动读你的笔记给评语，写进进度记录\
 n【这篇的难点】"涌现"很容易写成玄学。\n试着不用"涌
 现"这个词，把这件事讲一遍。讲得出来才是懂了
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:写笔记 W6
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：写笔记 W6
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-045-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261019T183000
DTEND;TZID=Asia/Shanghai:20261019T185500
SUMMARY:【25分钟】进门先别坐下 Scaling Laws
DESCRIPTION:【论文】Scaling Laws for Neural Language Models\n【作
 者】Jared Kaplan 等（OpenAI），2020\n【哪找】arXiv 搜标题
 ，或 arxiv.org/abs/2001.08361\n【配套】B站「跟李沐学AI」→
  论文精读系列，有逐段中文讲解，先看视频再看原文
 会顺很多\n【这篇发现了什么】模型性能和三个量（参
 数量、数据量、算力）之间\n存在光滑的幂律关系 ——
  也就是说，**性能是可以预测的**\n【为什么这篇改变
 了整个行业】\n在它之前，"把模型做大"是赌博；在它
 之后，是可以做预算的工程。\n这是后来敢投几十亿美
 金训大模型的理论依据\n【看那几张对数坐标的直线图
 】\n横轴算力、纵轴损失，在双对数坐标下是一条直线 
 —— 这种规律性非常罕见\n【看完你该能回答】\n1. 幂
 律关系是什么意思？为什么在对数坐标下是直线？\n2. 
 这篇建议：算力有限时，钱该花在把模型做大，还是把
 数据加多？\n3. 它是怎么得出这个建议的？\n【记住第2
 问的答案，后天会被推翻】
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:Scaling Laws
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：Scaling Laws
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-046-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261020T183000
DTEND;TZID=Asia/Shanghai:20261020T185500
SUMMARY:【25分钟】进门先别坐下 《倦怠社会》前半
DESCRIPTION:【书】《倦怠社会》\n【原名】Müdigkeitsgesellsch
 aft\n【作者】韩炳哲 Byung-Chul Han，德国哲学家，韩裔\n
 【篇幅】全书约100页，今天读前半\n【这本书写的就是
 你的处境】\n他的核心论点：现代社会已经从"规训社会
 "变成了"功绩社会"。\n过去是别人不许你做什么；现在
 是你自己逼自己"你可以做到更多"。\n剥削者和被剥削
 者变成了同一个人\n【所以会出现这个循环】\n一边焦
 虑"我在荒废时间"，一边刷抖音刷到深夜。\n两件事不
 是矛盾的，是同一个机制的两面：自我要求越紧，越需
 要逃逸\n【读的时候别急着代入】先看他怎么论证，再
 想适不适用于你\n【提醒】他给的解法可能和你以为的
 相反 —— 不是"更自律"，\n而是重新获得"无所事事"的
 能力。后半会讲
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:《倦怠社会》前半
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：《倦怠社会》前半
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-047-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261021T183000
DTEND;TZID=Asia/Shanghai:20261021T185500
SUMMARY:【25分钟】进门先别坐下 Chinchilla：打脸上一篇
DESCRIPTION:【论文】Training Compute-Optimal Large Language Models（
 业内叫 Chinchilla）\n【作者】Jordan Hoffmann 等（DeepMind）
 ，2022\n【哪找】arXiv 搜标题，或 arxiv.org/abs/2203.15556\n【
 配套】B站「跟李沐学AI」→ 论文精读系列，有逐段中
 文讲解，先看视频再看原文会顺很多\n【它推翻了什么
 】Kaplan 那篇说"算力有限就把模型做大"。\nChinchilla 说
 ：**错了，是数据给少了。**\n同样的算力，用一半参数
 、两倍数据，效果更好\n【证据】他们训了一个70B的 Chi
 nchilla，打败了 280B 的 Gopher\n【这是本计划最好的一堂
 科学方法课，慢慢看它是怎么翻案的】\n不是"我有新想
 法"，而是：\n1. 指出前人实验设计里的一个具体缺陷（
 学习率调度没随训练长度调整）\n2. 重做了400多次训练
 ，覆盖更大的参数范围\n3. 用三种独立方法得出同一个
 结论\n【今天的重点不是结论，是这个过程】\n一个被
 整个行业信了两年的定律，是怎么被推翻的？\n需要什
 么样的证据强度？作者是怎么排除"我只是运气好"这种
 可能的？\n【和你周二读的书对照】这就是可证伪性的
 活标本
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:Chinchilla：打脸上一篇
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：Chinchilla：打脸上一篇
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-048-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261022T183000
DTEND;TZID=Asia/Shanghai:20261022T185500
SUMMARY:【25分钟】进门先别坐下 《倦怠社会》读完
DESCRIPTION:【书】《倦怠社会》韩炳哲｜今天读完后半\n
 【后半的核心】他区分了两种"倦怠"\n一种是耗竭式的
 ：把人榨干，让人只想瘫着（就是你现在刷抖音那个状
 态）\n另一种他称为"根本性的倦怠"：放松的、开放的
 、能让人重新看见世界的那种疲倦\n【他的解法反直觉
 】不是更努力、更自律、更高效。\n是重新获得**深度
 无聊**的能力 —— 那种什么也不做、任由注意力散开
 的状态。\n他认为创造力恰恰长在那里\n【和本方案的
 关系，说清楚】\n这个12周计划本身是"功绩社会"式的产
 物——排期、验收、打卡。\n韩炳哲会说这正是问题的
 一部分。\n所以本方案才只要一周5-7小时，才有弹性日
 ，才规定"断了不补"。\n不是为了少学，是为了不让计
 划本身变成新的自我剥削\n【今天读完想一件事】你上
 一次什么都不做地发呆，是什么时候？
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:《倦怠社会》读完
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：《倦怠社会》读完
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-049-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261023T183000
DTEND;TZID=Asia/Shanghai:20261023T185500
SUMMARY:【25分钟】进门先别坐下 弹性日 / 塞涅卡《论生
 命之短暂》
DESCRIPTION:【弹性日】落下的今天补\n【书】《论生命之
 短暂》\n【作者】塞涅卡 Seneca，古罗马斯多葛派哲学家
 ，公元1世纪\n【篇幅】极短，一晚上读完\n【它的第一
 句话就够狠】\n人们对财产极其吝啬，可一旦涉及时间
 ，却挥霍得像它不值钱一样\n【两千年前写的，讲的就
 是你在刷抖音】\n他描述的那些人：忙碌但不知道在忙
 什么、总说"等我退休了就……"、\n把生命耗在别人的
 事情上 —— 一个字都不用改\n【他的核心区分】\n"活
 得久"和"活了很久"是两回事。\n大多数人不是生命太短
 ，是浪费得太多\n【和韩炳哲对照读很有意思】\n塞涅
 卡说要主动支配时间；韩炳哲说过度支配时间本身就是
 病。\n两个人隔了两千年，谁更对？\n—— 这种"两个都
 有道理但互相冲突"的处境，才是真正的思考发生的地
 方
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:弹性日 / 塞涅卡《论生命之短暂》
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：弹性日 / 塞涅卡《论生命之短暂》
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-050-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261024T090000
DTEND;TZID=Asia/Shanghai:20261024T120000
SUMMARY:【项目半天】 S4下：中文模型训起来
DESCRIPTION:【项目】手写GPT · S4 下｜今天3-4小时\n【今天
 做完】中文模型完整训练，能生成像样的中文片段\n【
 要处理的几个坑】\n1. 中文词表大 → embedding 层参数暴
 涨，可能要减小模型其他部分\n2. 语料如果是你的笔记
 ，量可能太小 → 会严重过拟合，要看验证集 loss\n3. 中
 文没有空格分词，生成结果的可读性判断标准和英文不
 一样\n【今天该有的体感】\n你会发现"数据量不够"是个
 硬约束 —— 这正好呼应你周三读的 Chinchilla：\n参数和
 数据要配比，不是越大越好\n【把这件事记下来】你自
 己撞上的这个问题，和 DeepMind 那篇论文说的是同一件
 事。\n能把亲身经历和论文结论对上，这是最结实的理
 解\n【收工】把生成样例存下来，git commit
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:S4下：中文模型训起来
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：S4下：中文模型训起来
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-051-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261025T200000
DTEND;TZID=Asia/Shanghai:20261025T203000
SUMMARY:【写笔记】自己写，不许过AI 写笔记 W7
DESCRIPTION:【写笔记】W7《一个定律是怎么被推翻的》\n【
 字数】300字，是上限不是下限。压缩本身就是训练\n【
 写给谁】一个完全不懂的外行，比如你同事\n【铁律】
 自己写，一个字不许过 AI。这是整个计划里唯一不能外
 包的东西\n【判定】写不出来 = 没懂，回去重看。不看
 文笔，只看外行能不能懂\n【头号毛病】用术语解释术
 语（拿"注意力权重"解释"注意力机制"）—— 这是没懂
 最明显的信号\n【存哪】计划目录的「笔记」文件夹，
 命名 W7-一个定律是怎么被推翻的.md\n【今晚21:17】我会
 自动读你的笔记给评语，写进进度记录\n【这篇我会重
 点验收】\n【别写成"Chinchilla 说数据要更多"】那是结论
 ，不是理解\n【要写的是过程】Kaplan 当年错在哪个具体
 的实验细节上？\nDeepMind 用什么证据强度才敢翻案？换
 你，你会信谁？\n【这篇写好了，比读十篇论文有用】
 它训练的是"怎么判断一个结论可不可信"，\n这个能力
 你在工作里、在看财经新闻时，天天用得上
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:写笔记 W7
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：写笔记 W7
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-052-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261026T183000
DTEND;TZID=Asia/Shanghai:20261026T185500
SUMMARY:【25分钟】进门先别坐下 InstructGPT：RLHF
DESCRIPTION:【论文】Training language models to follow instructions w
 ith human feedback\n【作者】Long Ouyang 等（OpenAI），2022\n【
 哪找】arXiv 搜标题，或 arxiv.org/abs/2203.02155\n【配套】B
 站「跟李沐学AI」→ 论文精读系列，有逐段中文讲解，
 先看视频再看原文会顺很多\n【这是理解 ChatGPT 为何诞
 生的关键一篇】\nGPT-3 会补全文字，但不会办事。你问
 它问题，它可能给你续写出更多问题。\n这篇把"会补全
 的模型"变成了"会听话的助手"\n【RLHF 三步，记住这个
 流程】\n1. 找人写示范答案，监督微调（SFT）\n2. 让模
 型生成多个答案，找人排序，训练一个"奖励模型"来模
 仿人的偏好\n3. 用强化学习，让模型去最大化这个奖励
 模型给的分\n【最反直觉的一个结果】\n1.3B 参数的 Instr
 uctGPT，人类评价上打败了 175B 的 GPT-3。\n**对齐带来的
 提升，比参数量翻100倍还大**\n【看完你该能回答】\n1. 
 为什么不直接找人标更多数据做监督微调，还要绕一圈
 搞强化学习？\n2. 奖励模型是什么？它为什么必要？\n3.
  这套方法有什么隐患？（提示：模型会不会学会"讨好"
 而不是"正确"？）
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:InstructGPT：RLHF
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：InstructGPT：RLHF
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-053-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261027T183000
DTEND;TZID=Asia/Shanghai:20261027T185500
SUMMARY:【25分钟】进门先别坐下 《科学究竟是什么》第1-
 2章
DESCRIPTION:【书】《科学究竟是什么》\n【原名】What Is Thi
 s Thing Called Science?\n【作者】A. F. Chalmers\n【这是科学哲
 学最好的入门教材】中译本流畅，不需要任何预备知识
 \n【今天读】第1章 科学是从经验事实推导出来的知识
 ？+ 第2章 观察依赖理论\n【第1章拆掉一个常识】"科学
 就是从观察归纳出规律"——这话有个致命漏洞：\n你看
 见一万只白天鹅，也推不出"所有天鹅都是白的"。\n这
 叫归纳问题，休谟提出的，至今没有公认的解决\n【第2
 章更颠覆】观察本身就是带理论的。\n两个人看同一张 
 X 光片，医生看见病灶，你看见一片灰\n【和你在学的
 东西的关系】\n你读论文时看到的"实验结果支持了这个
 结论"，\n其实每一步都嵌着理论假设。这本书教你把那
 些假设挖出来
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:《科学究竟是什么》第1-2章
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：《科学究竟是什么》第1-2章
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-054-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261028T183000
DTEND;TZID=Asia/Shanghai:20261028T185500
SUMMARY:【25分钟】进门先别坐下 Chain-of-Thought
DESCRIPTION:【论文】Chain-of-Thought Prompting Elicits Reasoning in L
 arge Language Models\n【作者】Jason Wei 等（Google），2022\n【
 哪找】arXiv 搜标题，或 arxiv.org/abs/2201.11903\n【这篇发现
 了一件很怪的事】\n在提示词里加一句"让我们一步步思
 考"，或者给一个带推理步骤的例子，\n模型的数学和逻
 辑题正确率大幅提升 —— 模型没变，只是提示变了\n
 【为什么这很怪】\n如果模型"会"做这道题，为什么不
 加这句话就做不对？\n如果它"不会"，为什么加一句话
 就会了？\n【一个可能的解释】\n模型是一个字一个字
 往外吐的。让它直接说答案，\n等于要求它在一步之内
 算完；让它写出中间步骤，\n等于给了它更多"计算的空
 间"。中间步骤既是给你看的，也是它自己的草稿纸\n【
 和你的关系很直接】你天天写提示词。这篇是提示词工
 程的理论基础\n【想一个问题】这说明模型的"推理能力
 "到底是它本来就有、还是被提示激发的？\n这个问题至
 今有争议
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:Chain-of-Thought
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：Chain-of-Thought
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-055-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261029T183000
DTEND;TZID=Asia/Shanghai:20261029T185500
SUMMARY:【25分钟】进门先别坐下 《科学究竟是什么》第3-
 4章
DESCRIPTION:【书】《科学究竟是什么》Chalmers\n【今天读】
 第3-4章：证伪主义\n【波普尔的核心主张】\n科学的标
 志不是"能被证实"，而是"能被证伪"。\n一个理论如果禁
 止了某些事情发生，它才有内容；\n如果它怎么都能解
 释，它就是空的\n【举个例子说明这有多锋利】\n"爱因
 斯坦预言光线经过太阳会偏折1.7角秒"——如果测出来
 不是，理论就完了。\n这是高风险预言，所以有价值。\
 n而"一切都是命运的安排"永远不会错，所以毫无价值\n
 【今天顺手做一件事】\n用这把刀检查一下你手上的东
 西：\n你做的水文模型，什么样的结果会证明它是错的
 ？\n你信的某个投资逻辑，什么情况出现会推翻它？\n
 答不上来的，说明那不是知识，是信念\n【和 W7 对照】
 Chinchilla 推翻 Scaling Laws，就是证伪主义的教科书案例
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:《科学究竟是什么》第3-4章
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：《科学究竟是什么》第3-4章
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-056-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261030T183000
DTEND;TZID=Asia/Shanghai:20261030T185500
SUMMARY:【25分钟】进门先别坐下 弹性日 / 看《生之欲》
DESCRIPTION:【弹性日】落下的今天补\n【片】生之欲 生き
 る（1952）\n【导演】黑泽明｜143分钟｜黑白\n【剧情】
 一个在市政府盖了三十年图章、活得像具尸体的科长，
 \n查出胃癌只剩几个月，开始想"我这辈子到底干了什么
 "\n【为什么给你排这部】\n主角是个公务员，做的是没
 人看的文书工作，\n在一个论资排辈、多做多错的系统
 里待了三十年。\n这不是隐喻，这就是很多人的处境\n
 【但这部片不是丧片】\n他最后做成了一件很小的事。
 片子用了一种很特别的结构去讲那件事——\n先给你结
 果，再让别人在葬礼上七嘴八舌地拼凑他是怎么做到的
 \n【看的时候留意】葬礼那场戏里，那些同事怎么解释
 他的转变？\n他们的解释和你看到的真相差多远？\n【
 和你的关系】不是让你辞职。是让你看清：\n在一个不
 由你决定的处境里，人还能支配什么
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:弹性日 / 看《生之欲》
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：弹性日 / 看《生之欲》
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-057-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261031T090000
DTEND;TZID=Asia/Shanghai:20261031T120000
SUMMARY:【项目半天】 训练调优
DESCRIPTION:【项目】手写GPT｜今天3-4小时\n【今天不加新
 功能，专门做调优】\n【要做的实验，每做一个记一次
 结果】\n1. 学习率：调大10倍、调小10倍，看 loss 曲线各
 是什么形状\n2. 模型深度：6层 vs 3层 vs 12层，在你的数
 据量下哪个最好？\n3. 训练集/验证集 loss 分叉的那个点
 在哪？（那就是开始过拟合的时刻）\n4. dropout 调整，
 看对过拟合的抑制效果\n【为什么专门花一天做这个】\
 n读100篇论文，不如亲手看一次 loss 曲线怎么因为学习
 率太大而炸掉。\n这种体感是读不来的\n【记录方式】
 做个简单的表格，把每次实验的参数和结果记下来。\n
 这就是最朴素的实验记录，和论文里的消融实验是同一
 件事\n【今天该有的收获】\n你会真正理解 Chinchilla 那
 篇在说什么 ——\n因为你自己撞上了"参数和数据不匹
 配"这堵墙\n【收工】git commit，把实验表格一起提交
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:训练调优
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：训练调优
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-058-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261101T200000
DTEND;TZID=Asia/Shanghai:20261101T203000
SUMMARY:【写笔记】自己写，不许过AI 写笔记 W8
DESCRIPTION:【写笔记】W8《RLHF 是怎么把模型驯服的》\n【
 字数】300字，是上限不是下限。压缩本身就是训练\n【
 写给谁】一个完全不懂的外行，比如你同事\n【铁律】
 自己写，一个字不许过 AI。这是整个计划里唯一不能外
 包的东西\n【判定】写不出来 = 没懂，回去重看。不看
 文笔，只看外行能不能懂\n【头号毛病】用术语解释术
 语（拿"注意力权重"解释"注意力机制"）—— 这是没懂
 最明显的信号\n【存哪】计划目录的「笔记」文件夹，
 命名 W8-RLHF 是怎么把模型驯服的.md\n【今晚21:17】我会
 自动读你的笔记给评语，写进进度记录\n【这篇要讲清
 一个链条】\n为什么"会补全"不等于"会办事"→ 为什么
 监督微调还不够 →\n奖励模型解决了什么 → 代价是什
 么\n【加分项】写出你对它隐患的判断：模型会不会学
 会讨好而不是正确？
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:写笔记 W8
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：写笔记 W8
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-059-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261102T183000
DTEND;TZID=Asia/Shanghai:20261102T185500
SUMMARY:【25分钟】进门先别坐下 Constitutional AI
DESCRIPTION:【论文】Constitutional AI: Harmlessness from AI Feedback\
 n【作者】Yuntao Bai 等（Anthropic），2022\n【哪找】arXiv 搜
 标题；Anthropic 官网也有\n【这是你天天在用的 Claude 的
 底层方法，读起来会很有代入感】\n【它解决 RLHF 的什
 么问题】\nRLHF 要大量人工标注，成本高，而且标注员
 要反复看有害内容。\nConstitutional AI 的办法：写一套书
 面原则（"宪法"），\n让模型按这套原则自己批评自己
 的回答、自己改，再拿这些数据训练\n【两个阶段】\n1.
  监督阶段：模型自我批评、自我修改\n2. 强化阶段：用
  AI 的偏好（而非人的）来训练奖励模型，叫 RLAIF\n【看
 完你该能回答】\n1. 用 AI 反馈代替人类反馈，风险在哪
 ？（提示：错误会不会自我放大？）\n2. "宪法"里写的
 原则，最终由谁决定？\n3. 这和 RLHF 是替代关系还是互
 补关系？\n【一个值得琢磨的点】把价值观写成明文条
 款，好处是可审查、可讨论。\n这在治理上的意义，可
 能比技术上更大
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:Constitutional AI
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：Constitutional AI
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-060-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261103T183000
DTEND;TZID=Asia/Shanghai:20261103T185500
SUMMARY:【25分钟】进门先别坐下 《科学究竟是什么》第5-
 6章
DESCRIPTION:【书】《科学究竟是什么》Chalmers\n【今天读】
 第5-6章：证伪主义的局限\n【今天读的是"波普尔也不完
 全对"】\n证伪主义听起来干净利落，但真实的科学史不
 长那样：\n一个理论遇到反例，科学家通常不会立刻抛
 弃它，\n而是先怀疑仪器、怀疑辅助假设、加个修正条
 款\n【这不一定是耍赖】\n天王星轨道和牛顿力学不符
 时，有人没有抛弃牛顿，\n而是猜"外面还有一颗没发现
 的行星"—— 结果真的发现了海王星\n【所以问题变成
 了】\n什么时候"修补理论"是正当的科学操作，什么时
 候是死不认账？\n—— 这个界线没有机械的判据，需要
 判断力\n【这一点对你很重要】\n你会发现：连"科学方
 法"本身都不是一套可以照抄的流程。\n真正起作用的是
 判断力，而判断力只能靠大量接触真实案例养出来\n【
 所以这个计划才让你读论文原文，而不是读科普】
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:《科学究竟是什么》第5-6章
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：《科学究竟是什么》第5-6章
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-061-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261104T183000
DTEND;TZID=Asia/Shanghai:20261104T185500
SUMMARY:【25分钟】进门先别坐下 LoRA
DESCRIPTION:【论文】LoRA: Low-Rank Adaptation of Large Language Model
 s\n【作者】Edward Hu 等（Microsoft），2021\n【哪找】arXiv 
 搜标题，或 arxiv.org/abs/2106.09685\n【解决什么问题】\n微
 调一个大模型要更新全部参数，175B 的模型你根本存不
 下、也训不起\n【它的办法】冻结原模型，只在旁边加
 一对很小的矩阵，只训练这对小矩阵。\n可训练参数能
 降到原来的万分之几，效果却接近全量微调\n【为什么
 能行（核心直觉）】\n微调时权重的"改变量"其实是低
 秩的 ——\n你不需要一个满秩的巨大矩阵来表达这个改
 变，两个瘦长矩阵相乘就够了\n【这篇对你有直接的实
 用价值】\n你的 3070Ti 有 8G 显存，全量微调任何像样的
 模型都不可能，\n但配合量化做 LoRA 是可行的。这是你
 本地能跑起来的路\n【看完你该能回答】\n1. "低秩"是什
 么意思？（提示：一个矩阵的信息其实没那么"满"）\n2.
  推理时 LoRA 会不会拖慢速度？（提示：可以合并回原
 权重）\n3. 秩 r 取多大合适？太小太大分别有什么问题
 ？
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:LoRA
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：LoRA
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-062-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261105T183000
DTEND;TZID=Asia/Shanghai:20261105T185500
SUMMARY:【25分钟】进门先别坐下 《科学究竟是什么》第7-
 8章
DESCRIPTION:【书】《科学究竟是什么》Chalmers\n【今天读】
 第7-8章：库恩与范式\n【库恩的核心概念：范式】\n科
 学不是一点点线性积累的。大部分时候是"常规科学"—
 —\n在一个公认的框架内解谜题；\n偶尔会发生"科学革
 命"——整个框架被换掉，\n新旧两代人甚至无法用同一
 套语言讨论问题\n【经典例子】从地心说到日心说、从
 牛顿到爱因斯坦\n【和你正在学的东西对照，这个对照
 非常有意思】\n从 RNN 到 Transformer 算不算一次范式转移
 ？\n从"每个任务训一个模型"到"一个大模型干所有事"呢
 ？\n从"提示工程"到"智能体"呢？\n【库恩不好读，但这
 两章 Chalmers 讲得很清楚】\n【一个警惕】"范式转移"这
 个词现在被滥用得很厉害，\n什么小改进都叫范式转移
 。读完你会知道它原本的门槛有多高
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:《科学究竟是什么》第7-8章
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：《科学究竟是什么》第7-8章
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-063-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261106T183000
DTEND;TZID=Asia/Shanghai:20261106T185500
SUMMARY:【25分钟】进门先别坐下 弹性日 / 《银翼杀手2049
 》
DESCRIPTION:【弹性日】落下的今天补\n【片】银翼杀手 2049
  Blade Runner 2049（2017）\n【导演】Denis Villeneuve｜164分钟
 ｜很长，可以分两晚看\n【注意】这是1982年《银翼杀手
 》的续集，但不看前作也能看懂\n【它问的问题】\n如
 果你的记忆是被人植入的，那这段记忆还算你的吗？\n
 如果"我"由记忆构成，而记忆是假的，"我"还剩什么？\n
 【和 W1 你读的 Nagel 直接接上】\nNagel 问"你怎么知道别
 人有心灵"；这部片问"你怎么知道你自己有"\n【和你学
 的 AI 也接得上】\n大模型的"记忆"是训练数据。如果它
 说"我记得……"，\n那和一个被植入记忆的复制人有什
 么本质区别？\n【看的时候留意】主角 K 的转变发生在
 哪一刻？\n他是因为发现自己特别而改变，还是因为发
 现自己不特别？\n—— 那才是全片最好的地方
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:弹性日 / 《银翼杀手2049》
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：弹性日 / 《银翼杀手2049》
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-064-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261107T090000
DTEND;TZID=Asia/Shanghai:20261107T120000
SUMMARY:【项目半天】 S5上：注意力可视化网页
DESCRIPTION:【项目】手写GPT · S5 上｜今天3-4小时\n【今天
 开始做那个网页】\n【做什么】输入一句话，把你自己
 训练的模型里每个注意力头在关注什么画出来\n【最直
 观的做法】热力图：横轴和纵轴都是句子里的词，\n颜
 色深浅表示"这个词有多关注那个词"\n【技术路线（挑
 简单的）】\n方案A：Python 出图（matplotlib 热力图）+ 简
 单的前端展示\n方案B：后端把注意力权重导成 JSON，前
 端画\n先做能跑的，别一上来就追求好看\n【为什么这
 个网页值得做】\n它是**学习的副产品，自带验收功能**
 ——\n做不出来说明你对注意力的理解还是虚的。\n而
 且它逼你把机制想通，因为你要把它画给别人看\n【回
 想一下】这正是9月5日那天我让你在纸上手画的那张图
 。\n两个月后，你要把它变成能跑的东西\n【收工】git c
 ommit
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:S5上：注意力可视化网页
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：S5上：注意力可视化网页
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-065-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261108T200000
DTEND;TZID=Asia/Shanghai:20261108T203000
SUMMARY:【写笔记】自己写，不许过AI 写笔记 W9
DESCRIPTION:【写笔记】W9《宪法式AI 和 RLHF 有什么不一样
 》\n【字数】300字，是上限不是下限。压缩本身就是训
 练\n【写给谁】一个完全不懂的外行，比如你同事\n【
 铁律】自己写，一个字不许过 AI。这是整个计划里唯一
 不能外包的东西\n【判定】写不出来 = 没懂，回去重看
 。不看文笔，只看外行能不能懂\n【头号毛病】用术语
 解释术语（拿"注意力权重"解释"注意力机制"）—— 这
 是没懂最明显的信号\n【存哪】计划目录的「笔记」文
 件夹，命名 W9-宪法式AI 和 RLHF 有什么不一样.md\n【今晚
 21:17】我会自动读你的笔记给评语，写进进度记录\n【
 这篇要写出你的判断，不只是复述】\n用 AI 的反馈代替
 人的反馈，你觉得靠谱吗？风险在哪？\n【加分项】把
 这个问题和你这周读的库恩范式联系起来
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:写笔记 W9
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：写笔记 W9
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-066-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261109T183000
DTEND;TZID=Asia/Shanghai:20261109T185500
SUMMARY:【25分钟】进门先别坐下 Toy Models of Superposition 前
 半
DESCRIPTION:【论文】Toy Models of Superposition\n【作者】Nelson E
 lhage 等（Anthropic），2022\n【哪找】transformer-circuits.pub 
 —— 网页版，图是交互式的，手机上也好读\n【为什么
 这一层最值得读】\n它本质上是**在一个黑箱里做科学
 推断**：提假说、设实验、发现反例、修正模型。\n这
 是活的科学方法论教材，比任何一本讲逻辑的书都硬。
 \n你说想练思维逻辑，这里能直接练到\n【今天读前半
 ，搞懂这个核心问题】\n一个模型只有几百个神经元，
 却似乎能表示几千几万个概念。怎么做到的？\n【答案
 叫"叠加"（superposition）】\n一个神经元不对应一个概念
 ，而是多个概念叠在同一批神经元上，\n靠"大部分概念
 不同时出现"这个特性来避免互相干扰\n【一个比喻】\n
 就像一个小房间要住很多人，但大家上班时间错开，\n
 所以看起来住得下。代价是偶尔会撞上（干扰）\n【看
 完你该能回答】\n1. 什么叫"特征"？和"神经元"是一回事
 吗？\n2. 稀疏性为什么是叠加能成立的前提？
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:Toy Models of Superposition 前半
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：Toy Models of Superposition 前半
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-067-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261110T183000
DTEND;TZID=Asia/Shanghai:20261110T185500
SUMMARY:【25分钟】进门先别坐下 《科学究竟是什么》第9-
 10章
DESCRIPTION:【书】《科学究竟是什么》Chalmers\n【今天读】
 第9-10章：拉卡托斯的研究纲领 / 费耶阿本德\n【拉卡托
 斯想调和波普尔和库恩】\n他提出"研究纲领"：一个理
 论有"硬核"（不容修改）和"保护带"（可以调整）。\n判
 断一个纲领是进步的还是退化的，看它的修改是能做出
 新预言，\n还是只能事后打补丁\n【这个判据非常实用
 】\n你以后判断任何理论、任何方法论、任何投资逻辑
 ，\n都可以问：它最近一次做出的、事后被证实的新预
 言是什么？\n一直只能解释过去、从不预言未来的，就
 是退化的\n【费耶阿本德走到了另一个极端】\n他说科
 学根本没有统一的方法，"怎么都行"。\n这个观点很多
 人不同意，但他的论证值得看——\n他举了大量科学史
 案例说明"科学家其实经常违反教科书里的科学方法"\n
 【今天读完想一件事】你自己判断一个说法可不可信，
 用的是哪套标准？
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:《科学究竟是什么》第9-10章
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：《科学究竟是什么》第9-10章
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-068-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261111T183000
DTEND;TZID=Asia/Shanghai:20261111T185500
SUMMARY:【25分钟】进门先别坐下 Toy Models of Superposition 后
 半
DESCRIPTION:【论文】Toy Models of Superposition（Anthropic）｜tran
 sformer-circuits.pub\n【今天读后半，重点看实验设计】\n【
 他们怎么研究这件事的】\n不去直接解剖大模型（太复
 杂），而是造一个极小的"玩具模型"，\n在能完全控制
 的条件下复现同样的现象，然后一个变量一个变量地试
 \n【这个方法论值得你专门学一下】\n研究一个复杂系
 统时，先造一个你能完全理解的小系统，\n在小系统里
 搞清机制，再回头看大系统 —— 这是物理学的经典套
 路\n【今天要留意的几个发现】\n1. 稀疏性越高，模型
 越倾向于用叠加（房间越错峰，越能多住人）\n2. 特征
 会自组织成几何结构（五边形、四面体这些）——这个
 发现相当惊人\n3. 有"相变"：某个条件跨过阈值，模型
 的策略会突然整个换掉\n【看完想一件事】\n这些结构
 没有人设计过，是训练自己长出来的。\n那么"理解一个
 模型"到底意味着什么？\n【顺带】3B1B 第7章 How might LLMs
  store facts 讲的是同一族问题，有余力可以看
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:Toy Models of Superposition 后半
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：Toy Models of Superposition 后半
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-069-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261112T183000
DTEND;TZID=Asia/Shanghai:20261112T185500
SUMMARY:【25分钟】进门先别坐下 《科学究竟是什么》收
 尾
DESCRIPTION:【书】《科学究竟是什么》Chalmers｜今天读完\n
 【最后几章讲什么】新实验主义、科学实在论与反实在
 论之争\n【核心争论一句话】\n科学理论说的电子、夸
 克这些东西，是真实存在的，\n还是只是"能算对结果"
 的有用工具？\n【这个争论和你学 AI 直接相关】\n你昨
 天读的"特征"、"叠加"、"induction head"——\n这些是模型
 里真实存在的结构，还是研究者为了方便解释而强加的
 框架？\n【读完这本书，你该带走什么】\n不是一套现
 成的科学方法，而是一种警惕：\n任何"显然如此"的说
 法背后，都有一堆没说出口的假设。\n把那些假设挖出
 来，就是思维能力\n【回看一下】从波普尔（可证伪）
 到库恩（范式）到拉卡托斯（研究纲领）\n到费耶阿本
 德（怎么都行）—— 这条线本身就是一次"理论被不断
 修正"的示范\n【下一本】《学会提问》，下周开始，是
 一本纯工具书
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:《科学究竟是什么》收尾
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：《科学究竟是什么》收尾
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-070-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261113T183000
DTEND;TZID=Asia/Shanghai:20261113T185500
SUMMARY:【25分钟】进门先别坐下 弹性日
DESCRIPTION:【弹性日】\n这周落下的，今天补上。没落下
 就休息，或者看排好的片。\n【设计说明】这不是补课
 日，是缓冲带。落下就落下，不设追债机制——\n"补课
 "是学习计划崩溃的头号杀手，它会把一天的漏变成整
 周的崩。
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:弹性日
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：弹性日
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-071-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261114T090000
DTEND;TZID=Asia/Shanghai:20261114T120000
SUMMARY:【项目半天】 S5下：网页部署上线
DESCRIPTION:【项目】手写GPT · S5 下｜今天3-4小时\n【今天
 做完】注意力可视化网页做完并部署\n【部署走你已有
 的流程】Cloudflare Pages + wrangler，和你部署这个日历是同
 一套\n【今天要收的尾】\n1. 界面：能输入句子、能选
 择看第几层第几个头\n2. 至少一个"看得出名堂"的例子
 ——\n   找一句话，它的某个头明显在做某种特定的事
 （比如盯住标点、或盯住重复的词）\n3. README：写清这
 是什么、怎么用、模型是怎么训的\n【这个网页的意义
 】\n它是这12周唯一的对外产出，也是最好的验收：\n你
 能把注意力机制画给别人看，说明你真的懂了\n【和当
 初的判断呼应】\n9月2号我跟你说过：别做学习打卡网
 页，那是拖延的高级形式。\n该做的是这个 —— 学习
 的副产品，做不出来就说明前面没学明白\n【收工】git 
 commit + 打 tag
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:S5下：网页部署上线
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：S5下：网页部署上线
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-072-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261115T200000
DTEND;TZID=Asia/Shanghai:20261115T203000
SUMMARY:【写笔记】自己写，不许过AI 写笔记 W10
DESCRIPTION:【写笔记】W10《模型内部为什么是叠加的》\n
 【字数】300字，是上限不是下限。压缩本身就是训练\n
 【写给谁】一个完全不懂的外行，比如你同事\n【铁律
 】自己写，一个字不许过 AI。这是整个计划里唯一不能
 外包的东西\n【判定】写不出来 = 没懂，回去重看。不
 看文笔，只看外行能不能懂\n【头号毛病】用术语解释
 术语（拿"注意力权重"解释"注意力机制"）—— 这是没
 懂最明显的信号\n【存哪】计划目录的「笔记」文件夹
 ，命名 W10-模型内部为什么是叠加的.md\n【今晚21:17】我
 会自动读你的笔记给评语，写进进度记录\n【这篇的难
 点】要讲清"为什么不能一个神经元一个概念"。\n用你
 自己的比喻讲，别用论文里那个\n【加分项】写出这个
 发现让你对"理解一个模型"这件事改变了什么看法
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:写笔记 W10
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：写笔记 W10
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-073-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261116T183000
DTEND;TZID=Asia/Shanghai:20261116T185500
SUMMARY:【25分钟】进门先别坐下 Induction Heads 前半
DESCRIPTION:【论文】In-context Learning and Induction Heads\n【作
 者】Catherine Olsson 等（Anthropic），2022\n【哪找】transforme
 r-circuits.pub，网页版\n【这是本计划里我最推荐精读的
 一篇】\n它是人类第一次在模型内部明确指认出一个"功
 能器官"，\n并且完整地展示了发现它的全过程\n【inducti
 on head 是什么】\n一个专门做"模式复制"的注意力头。看
 到 A→B 出现过，\n再遇到 A 时，它就把 B 顶上来。\n听
 起来简单，但它可能是模型 in-context learning 能力的主要
 来源\n【今天读前半，重点看这个】\n他们观察到训练
 过程中 loss 曲线有一个小小的"凸起"——\n那个点上模
 型突然获得了某种能力。\n整篇论文就是在追问：那一
 刻到底发生了什么？\n【这个追问的方式，本身就是最
 好的示范】\n不是"我猜是这样"，而是"我观察到一个异
 常，我要找出它的原因"\n
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:Induction Heads 前半
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：Induction Heads 前半
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-074-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261117T183000
DTEND;TZID=Asia/Shanghai:20261117T185500
SUMMARY:【25分钟】进门先别坐下 《学会提问》第1-4章
DESCRIPTION:【书】《学会提问》\n【原名】Asking the Right Que
 stions: A Guide to Critical Thinking\n【作者】M. Neil Browne / Stuar
 t M. Keeley\n【这是一本纯工具书】不讲理论，直接给你
 拆解论证的操作步骤\n【今天读】第1-4章\n【你会学到
 的拆解框架】任何一段话，拆成这几块：\n1. 论题是什
 么？（他在回答什么问题）\n2. 结论是什么？（他要你
 相信什么）\n3. 理由是什么？（他凭什么这么说）\n4. 
 哪些词是歧义的？（很多争论其实是在用同一个词说不
 同的事）\n【今天做一次练习】\n找一篇你最近看过的
 公众号文章或者新闻，\n用这四步拆一遍。你会发现很
 多文章拆完之后，"理由"那一栏是空的\n【和你读论文
 的关系】论文其实是论证结构最规整的文本。\n你已经
 读了两个月论文，现在回头学拆解框架，会觉得特别顺
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:《学会提问》第1-4章
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：《学会提问》第1-4章
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-075-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261118T183000
DTEND;TZID=Asia/Shanghai:20261118T185500
SUMMARY:【25分钟】进门先别坐下 Induction Heads 后半
DESCRIPTION:【论文】In-context Learning and Induction Heads（Anthrop
 ic）\n【今天读后半。重点不是结论，是推理链条】\n【
 把他们的论证过程拆出来，这是今天真正的任务】\n他
 们要证明"induction head 是 in-context learning 的来源"，\n用
 了六条独立证据（论文里叫 argument 1-6），从不同角度
 逼近同一个结论\n【留意这几件事】\n1. 相关性证据（
 两者同时出现）→ 他们自己指出这不够\n2. 于是做干预
 实验（把 head 敲掉，看能力是否消失）\n3. 在小模型上
 能严格证明，在大模型上只能给出间接证据 ——\n   他
 们**明确承认了这个局限**，没有含糊过去\n【第3点特
 别值得学】\n一篇好论文会清楚地说"我这部分证据比较
 弱"。\n这种坦白不是示弱，是让读者能准确判断该信到
 什么程度\n【和你读过的书连起来】\n这就是波普尔说
 的高风险预言、拉卡托斯说的进步性纲领的实际样子\n
 【今天你练的是】怎么评估一个证据链的强度
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:Induction Heads 后半
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：Induction Heads 后半
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-076-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261119T183000
DTEND;TZID=Asia/Shanghai:20261119T185500
SUMMARY:【25分钟】进门先别坐下 《学会提问》第5-8章
DESCRIPTION:【书】《学会提问》Browne & Keeley\n【今天读】
 第5-8章\n【会学到的东西】\n· 价值观假设和描述性假
 设（那些没说出口但必须成立的前提）\n· 常见的论证
 谬误（人身攻击、滑坡、稻草人、诉诸权威……）\n· 
 证据的类型和各自的可靠度\n【谬误那一章建议慢读】\
 n不是为了背名字，是为了在别人（和自己）用的时候
 能立刻察觉\n【一个提醒，也是这本书最容易被用坏的
 地方】\n学会挑谬误之后，很多人会变成"抬杠机器"—
 —\n到处找别人的漏洞，但自己不产出任何东西。\n这
 本书真正的用法是**先用在自己身上**：\n我的这个判断
 ，隐含假设是什么？我凭什么这么确定？\n【回看这12
 周】你写的11篇笔记，就是在做这件事
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:《学会提问》第5-8章
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：《学会提问》第5-8章
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-077-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261120T183000
DTEND;TZID=Asia/Shanghai:20261120T185500
SUMMARY:【25分钟】进门先别坐下 弹性日 / 看《罗生门》
DESCRIPTION:【弹性日】落下的今天补\n【片】罗生门（1950
 ）\n【导演】黑泽明｜88分钟｜黑白｜改编自芥川龙之
 介\n【结构】一桩命案，四个当事人各讲一遍，四个版
 本都自洽，互相矛盾\n【它问的问题】\n不是"谁在说谎"
 ——而是：如果每个人都真诚地相信自己的版本，\n那"
 真相"这个东西还存在于哪里？\n【和你这一周学的东西
 直接对上】\n周一周三你读的是研究者怎么在黑箱里逼
 近真相；\n这部片问的是：当所有证据都来自不可靠的
 叙述者时，还能逼近吗？\n【和你读的 Chalmers 也对上】
 "观察依赖理论"——\n四个人看的是同一件事，但每个
 人带着不同的框架去看，就看见了不同的事\n【看的时
 候留意】樵夫的版本是最后给的，也最像"真相"。\n但
 黑泽明有没有给你理由相信他？\n—— 没有。这是全片
 最狠的地方
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:弹性日 / 看《罗生门》
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：弹性日 / 看《罗生门》
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-078-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261121T090000
DTEND;TZID=Asia/Shanghai:20261121T120000
SUMMARY:【项目半天】 项目收尾
DESCRIPTION:【项目】手写GPT｜今天3-4小时｜收尾周\n【今
 天做完三件事】\n1. README 写清楚：这是什么、怎么跑、
 模型结构、训练数据、效果如何\n   —— 写给三个月后
 已经忘光了的你自己看\n2. 代码整理：删掉调试残留、
 把散在各处的超参集中到一个配置里、\n   补上关键位
 置的注释\n3. git 打 tag，比如 v1.0\n【为什么整理代码算
 学习】\n你会在整理的过程中发现"这段我当时是怎么写
 出来的？"——\n那些地方就是你当时靠感觉蒙过去的。
 现在是补上的时候\n【README 里加一节"我踩过的坑"】\n
 把两个月里卡住你最久的三个问题写下来，以及最后怎
 么解决的。\n这一节以后对你最有价值\n【今天该有的
 感觉】\n两个月前你连 attention 是什么都说不清。\n现在
 你有一个自己从零敲出来的、能跑的、能可视化的 GPT\n
 【收工】git commit + tag
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:项目收尾
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：项目收尾
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-079-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261122T200000
DTEND;TZID=Asia/Shanghai:20261122T203000
SUMMARY:【写笔记】自己写，不许过AI 写笔记 W11
DESCRIPTION:【写笔记】W11《什么是 induction head》\n【字数
 】300字，是上限不是下限。压缩本身就是训练\n【写给
 谁】一个完全不懂的外行，比如你同事\n【铁律】自己
 写，一个字不许过 AI。这是整个计划里唯一不能外包的
 东西\n【判定】写不出来 = 没懂，回去重看。不看文笔
 ，只看外行能不能懂\n【头号毛病】用术语解释术语（
 拿"注意力权重"解释"注意力机制"）—— 这是没懂最明
 显的信号\n【存哪】计划目录的「笔记」文件夹，命名 
 W11-什么是 induction head.md\n【今晚21:17】我会自动读你的
 笔记给评语，写进进度记录\n【这篇的挑战】要讲给外
 行听。\n"模式复制"这个概念其实很好讲，试着用一个
 日常生活的例子\n【加分项】写一句他们是怎么发现它
 的 —— 从 loss 曲线上那个凸起开始
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:写笔记 W11
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：写笔记 W11
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-080-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261123T183000
DTEND;TZID=Asia/Shanghai:20261123T185500
SUMMARY:【25分钟】进门先别坐下 Scaling Monosemanticity 选读
DESCRIPTION:【论文】Scaling Monosemanticity: Extracting Interpretable
  Features from Claude 3 Sonnet\n【作者】Adly Templeton 等（Anthrop
 ic），2024\n【哪找】transformer-circuits.pub\n【今天不用精
 读，看图和例子就行】\n【它做到了什么】\n把 W10 你读
 的"叠加"问题在真实的大模型上解开了——\n用稀疏自
 编码器，从 Claude 3 Sonnet 里提取出了数千万个可解释的
 特征\n【最有名的那个实验：金门大桥特征】\n他们找
 到了一个专门对应"金门大桥"的特征，\n然后把它的激
 活值人为调到极高。\n结果模型开始在任何话题里都提
 金门大桥，甚至说自己就是金门大桥\n【为什么这个实
 验重要】\n它不只是"看见"了一个特征，还证明了**因果
 关系**：\n调它，模型行为就变。这比单纯的相关性强
 得多\n—— 你 W8 读的 Stanovich 第5章讲的就是这个区别\n
 【今天顺带做一件事】\n回想 9 月你看的第一集 3B1B：
 那时"神经网络"对你还是个黑箱。\n现在你知道人们是
 怎么把它一点点撬开的
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:Scaling Monosemanticity 选读
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：Scaling Monosemanticity 选读
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-081-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261124T183000
DTEND;TZID=Asia/Shanghai:20261124T185500
SUMMARY:【25分钟】进门先别坐下 《学会提问》收尾
DESCRIPTION:【书】《学会提问》Browne & Keeley｜今天读完\n
 【最后几章】统计数据怎么骗人、有什么重要信息被省
 略了、可能有哪些其他结论\n【"被省略的信息"这一章
 最实用】\n任何说服性的文字都是有选择的。\n问一句"
 他没说什么？"往往比分析他说的更有用\n【统计那章你
 会立刻用上】\n平均数还是中位数？百分比的分母是什
 么？绝对值还是相对值？\n（"风险降低50%"听起来很厉
 害，但如果是从万分之二降到万分之一呢？）\n【读完
 这本书，回头看一件事】\n这本书教的四步拆解 —— 
 论题、结论、理由、假设 ——\n其实就是你这12周写的
 每一篇300字笔记在做的事：\n把一团模糊的印象，压成
 一个有结构的表达\n【明天的任务】回看你自己写的全
 部笔记
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:《学会提问》收尾
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：《学会提问》收尾
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-082-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261125T183000
DTEND;TZID=Asia/Shanghai:20261125T185500
SUMMARY:【25分钟】进门先别坐下 回看自己写的12篇笔记
DESCRIPTION:【今天不读新东西】\n【任务】把你从 W0 到 W11
  写的所有笔记，按顺序读一遍\n【读的时候只做一件事
 】\n在每篇上标一个记号：\n✓ = 现在读还是觉得讲清
 楚了\n? = 现在读发现当时其实没懂\n！= 现在能讲得比
 当时好很多\n【为什么这个动作重要】\n它是唯一能让
 你**看见自己变化**的方式。\n学习最大的问题是进步无
 感——每天都觉得没长进，\n但把三个月前的自己摆出
 来对比，才知道走了多远\n【留意那些标 ? 的】\n那是
 你的真实盲区。不用现在补，记下来就行\n【留意那些
 标 ！的】\n那说明后面的知识回头改变了你对前面的理
 解 ——\n这叫理解的重构，是真懂了的标志\n【周六和
 周日】总复盘 + 定第二季做什么
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:回看自己写的12篇笔记
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：回看自己写的12篇笔记
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-083-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261128T090000
DTEND;TZID=Asia/Shanghai:20261128T120000
SUMMARY:【项目半天】 总复盘：把项目讲一遍
DESCRIPTION:【项目】手写GPT｜总复盘｜今天3-4小时\n【今
 天做一件有点傻但极其有效的事：出声讲一遍】\n关掉
 电脑，对着空气（或者家人、或者手机录音）把这个项
 目从头讲一遍：\n1. 一个 GPT 是怎么把一句话变成下一
 个词的？\n2. 注意力在里面干什么？为什么需要它？\n3.
  训练的时候到底在优化什么？\n4. 我这两个月最卡的三
 个地方是什么，最后怎么通的？\n【为什么必须出声讲
 】\n在脑子里"觉得懂了"和"能连贯说出来"之间，差着一
 整个理解。\n讲不顺的地方，就是没懂的地方 —— 这
 个测试骗不了人\n【建议真的录音】\n录下来自己听一
 遍，你会清楚地听见哪几句是在含糊其辞\n【这就是9月
 2号定下的那条判定标准】\n"关掉代码，能不能把核心
 机制讲给一个外行听懂"\n—— 今天是这条标准的最终
 考试\n【讲不顺也没关系】把讲不顺的点记下来，那是
 第二季的起点
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:总复盘：把项目讲一遍
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：总复盘：把项目讲一遍
TRIGGER:-PT10M
END:VALARM
END:VEVENT
BEGIN:VEVENT
UID:plan12w-084-gyh@local
DTSTAMP:20260902T090000Z
DTSTART;TZID=Asia/Shanghai:20261129T200000
DTEND;TZID=Asia/Shanghai:20261129T203000
SUMMARY:【写笔记】自己写，不许过AI W12 总结 + 定第二季
DESCRIPTION:【最后一篇笔记】W12《这12周我到底学到了什
 么》\n【这篇不限300字】想写多少写多少\n【建议写这
 几块】\n1. 三个月前的我和现在的我，具体差在哪（举
 例子，别写感受）\n2. 这套方法哪部分对我有效，哪部
 分是形式主义\n3. 我发现自己真正感兴趣的是什么（这
 一条最重要）\n【还要做一件事：和我一起定第二季】\
 n可能的方向：\n· 往深走：机制可解释性，自己动手做
 稀疏自编码器\n· 往宽走：强化学习、多模态、智能体\
 n· 往实用走：给你的水文工作做一个真正有用的AI工具
 \n· 往思想走：哲学线单独加深，读原著而不是导论\n·
  或者停一停 —— 韩炳哲那本书说的，休息本身是正当
 的\n【今晚21:17 我会做最后一次验收】\n把12周的轨迹拉
 出来看一遍，告诉你哪里进步最大、哪里一直在原地\n
 【最后一句】\n你在9月2号那天问"怎么有效快速提升"。
 \n三个月过去了，你会发现"快速"这个词从一开始就是
 错的方向
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:W12 总结 + 定第二季
TRIGGER:PT0M
END:VALARM
BEGIN:VALARM
ACTION:DISPLAY
DESCRIPTION:10分钟后：W12 总结 + 定第二季
TRIGGER:-PT10M
END:VALARM
END:VEVENT
END:VCALENDAR
