书稿一节,讲信息素养如何反过来决定学习成绩。7 分钟,与今天三篇教育文正好构成「问题」与「解法」的两头。
信息流主题
2023 年 12 月,小树考剑桥五级第三级 FCE,考试时不到 8 岁半。成绩几天前出来:总分 168,通过,毫无悬念。
五个单项的分布很有意思:阅读、口语、写作很高,听力"实在太难",语法"没学过",但单项也都通过了。 
这个成绩换算过来的坐标是:相当于雅思 6~6.5 分,达到研究生水平,词汇量大概 1 万,阅读蓝思值大概 1000L,达到了出国留学、到外国大学读书的语言要求。 
作者对剑桥五级的定位:国际通行的、权威的、科学的英语能力综合考试;同时也是盲目鸡娃(作者称"瞎鸡",即不理解学习和教育原理)的重灾区。从 1996 年引入国内至今,还没有这样的记录。
真正的关键不是分数,是"怎么来的"——三个"没有":
没有上过英语培训班,纯靠阅读;
全部应试动作只有:平时阅读积累,考前做几套真题,考前两个月开始背单词(每天 20~30 分钟,到考前只背完进度的 60%)。
作者从这个实例里只取一个启示:阅读,海量阅读,高质量阅读。
背后的原理表述:只要搞定学习的信息输入问题,儿童大脑作为一个神经的学习机器、一个强大的神经网络,它的输出可以非常惊人——不止满足素质教育的目标,应试成绩和考试分数更不在话下。
双语启蒙、儿童学习环境、阅读习惯这部分,作者注明由 savage 在《内驱式学习》中讲透,此处只从信息输入角度总结。
作者按前文梳理的"个人信息流构成",把孩子的输入逐类过了一遍。
阅读素养是信息素养的主体,至少占 80% 的份额——因为最主要的信息输入就是通过阅读获得的。 
作者提供了一个三维度框架来理解阅读素养:
阅读的目的:以获取信息为目的的阅读(非虚构)/以文学体验为目的的阅读(虚构)。儿童从绘本、故事引入,早期虚构占大头,但获取信息为目的的阅读比重会越来越大,于是阅读越来越趋近于学习本身。8 岁的小树至少 2/3 的阅读是科学主题的非虚构阅读,成年人比重更高。
作者的切入问题:GPT 模型的强大智能是如何诞生的?靠名师讲课?靠校外培训?靠应试教育?归根结底,靠的是阅读,海量的高质量的阅读。 
预训练(Pretraining):学习互联网上的海量文本,达到万亿 token 级别,内容包括基本上全部的人类书籍、数百万维基词条以及部分高质量网页。可以理解为 GPT 通过海量高质量阅读(书本 + 互联网)获得了强大智能。
关键细节:没有人教 GPT"阅读技巧",它只做一件事——预测下一个 token;这和人类阅读一模一样,边读边在脑子里预测下一个字词。通过这种方式,阅读者在自己的大脑网络里针对人类知识建立了强大的、通用的知识表征,形成智能的基础。
监督微调(Supervised finetuning):相当于对 GPT 进行课堂教育,也包括只有东亚国家流行的校外培训。这个阶段有正确答案,不是基于阅读的自学,内容少而精,只占整个训练过程的百分之几。人类类比:监督微调就类似【教育的教】,尤其是 K12 教育。
奖励建模(Reward modeling):相当于学习者的"三观"建设,针对一个问题提供多种答案、不同答案对应不同奖励。人类类比:奖励建模就类似【教育的育】。
强化学习(RLHF):类似人类基于外部反馈调整自己的学习行为。
全部结论压在一个比例上:预训练的占比高达 95% 以上。懂一点大脑学习原理,就能明白为什么课堂教育、教培在大脑智能发展中其实不起决定性作用。
context:作者回应"信息跟学习有什么关系"这一质疑时的第一原理。原文表述是"人类学习的唯一来源,是大脑加工处理信息。GIGO,垃圾进,垃圾出,只有信息质量提高了,学习才有可能好",它把"信息质量"从一个抽象话题变成了学习效果的前置变量。
费曼一下:大脑是台加工机器,它只能加工你喂给它的东西。喂进去的是短视频和二手鸡汤,磨出来的就不可能是深刻的理解——不是你不够努力,是原料不行。所以想让"输出"变好,先别急着换方法,先换原料。
context:作者把结论分成两个尺度陈述:"宏观层面讲,信息流质量决定生命质量。具体层面讲,信息输入决定学习效果。"前者是这套方法论的价值主张,后者是本节要用案例验证的可操作命题。
费曼一下:你每天读什么、看什么、和谁聊什么,长期累积就是你这个人。把它缩小到孩子的学习上,就变成一句更好检验的话:他读什么,决定他学成什么样。
context:作者在前文梳理的分类框架,本节用它做复盘工具,逐项检查小树的输入:书籍、杂志、互联网阅读、视频内容、碎片内容、交流讨论。年龄决定了各类的开闭——碎片内容"孩子不能看",互联网阅读"要等足够大"。
费曼一下:把一个人每天接收信息的渠道列成清单,像查账一样一项一项过。查完你会发现,所谓"培养孩子",很大程度上就是决定这张清单上哪几项开着、哪几项关着、各占多大比重。
context:本节的战略层概念,定义为"个人在识别信息需求、有效获取、评价、加工处理和传播信息方面的能力"。作者特别强调它"不仅仅是找到符合自己需求的高质量信息的技能,更包括培养消费高质量信息的习惯",并给出判据句:"所有学习者只分两种,一种是具备信息素养的学习者,一种是其他。"
费曼一下:在信息过剩的年代,会不会找好东西、愿不愿意长期只吃好东西,是两种不同的本事,后者更难。信息素养同时包含这两样:既是技能,也是胃口。
context:被界定为信息素养的主体,"至少占 80% 的份额",因为最主要的信息输入是通过阅读获得的。作者随后给出目的、媒介、过程三个维度的理解框架。
费曼一下:如果说信息素养是"会不会吃",阅读素养就是其中占八成的那道主菜。抓住阅读,你就抓住了信息素养的大部分;抓不住阅读,其余的都是零头。
context:阅读素养框架的第一个维度——以获取信息为目的的阅读(非虚构)与以文学体验为目的的阅读(虚构)。作者观察到儿童从绘本、故事引入,早期虚构占大头,但信息型阅读比重会越来越大,于是"阅读越来越趋近于学习本身";8 岁的小树至少 2/3 是科学主题的非虚构阅读。
费曼一下:小时候读书是为了好玩,长大后读书越来越是为了搞明白事情。这条曲线一旦走通,读书和学习就不再是两件需要分别安排的事,而是同一件事。
context:阅读素养框架的第二个维度,把阅读分为互联网阅读(电子书、网页文章、公众号、新媒体)与传统的纸质阅读。论据是"宇宙中的一切都是 atoms 和 bits 构成的"、软件吞噬一切,因此"驾驭互联网阅读的能力是不可或缺的"。
费曼一下:抱怨"现在没人读书了"没有意义,因为字并没有变少,只是从纸上搬到了屏幕上。真正要练的不是回到纸书,而是在屏幕上也能读得进去、读得深。
context:作者对"交流讨论"这一信息输入类别的定性。好的家庭聊天应该是一个"idea lab":聊知识主题、有信息含量、与孩子世界相关的话题,"本质上就是相互费曼";对立面是无信息含量的、复读机式的贫乏聊天,"是一种家庭版的'回音室'"。前提条件是家庭平时有阅读习惯与海量知识类输入。
费曼一下:一家人每天都在说话,区别只在于说的是新东西还是老话重复。前者每天都在往每个人脑子里加东西,后者只是把同样的几句话在屋里来回弹。而决定你家是哪一种的,其实是全家平时读了多少书。
context:本节的核心类比。GPT 的预训练在万亿 token 的人类书籍与网页上"只做一件事:预测下一个 token",作者指出这"和人类的阅读一模一样:边阅读,边在脑子里预测下一个字词",由此建立"强大的、通用的知识表征"。人类侧的对应物是学校教育之外的课外阅读,占比高达 95% 以上。
费曼一下:机器智能是靠读出来的,没人给它上过补习班。它读的时候在干什么?不停猜下一个词——你读一句话时脑子里也在猜。既然同一个动作能把机器读出智能,你就没有理由把课外阅读当成"正事之外的消遣"。
context:作者把 GPT 训练的后三段逐一对应到人类教育:监督微调"类似【教育的教】",尤其是 K12 与东亚特有的校外培训,特点是有正确答案、少而精、只占训练过程的百分之几;奖励建模"类似【教育的育】",是三观建设;强化学习则类似基于外部反馈调整学习行为。
费曼一下:课堂和培训不是没用,而是位置不对——它是"精加工",不是"进料"。你可以在最后几个小时把方法讲透、把错题纠正,但你没法用它替代之前几千小时的阅读。
context:作者对教培出成绩现象的解释:"很多学校和教培机构'出成绩',实际上不一定是'教'出来的,而是'筛'出来的:筛出来的是那种家庭重视教育、在预训练环节已经很优秀的孩子。"小树 FCE 的十来个小时微调、作者自己练 3 篇文章学会财经翻译,都是这个模型的佐证。
费曼一下:一家机构宣传"我们培养出了多少高分",你要先问一句:这些孩子进来之前是什么样的?很多时候机构做的是把已经跑在前面的人挑出来,然后收下他们本来就会拿到的成绩。
context:作者对知识付费的质量分层。书籍作为二三手信息要经历专业严格的评审流程,而知识付费"信息质量都没有人去验证",因此大多属于 45678 手信息;例外是 2.5 手信息——既忠实成体系地整合了领域内的二三手信息,又包含分享者本人第一手的实践与总结。判据是有没有上万小时的领域积累。
费曼一下:信息每转一手就掉一层质量。看一个课程值不值,别看讲师多会讲,看他讲的东西是自己趟出来的,还是从别人的书里抄来又抄了一遍。
context:解释知识付费为何普遍无效的机制层原因。内容必须短平快(20 分钟以内甚至 8 分钟以内)、上来就给结论、只提供傻瓜式操作指南、承诺立竿见影的效果——这种形式"作用于人的动物脑,满足人相信捷径、思想懒惰的魔法思维"。
费曼一下:所有承诺"三步搞定""听完就会"的东西,卖的都不是知识,是那种"我马上就要变强"的错觉。真学习一定伴随着难受和慢,一旦某个东西让你毫不费力还很爽,多半它没在你脑子里留下什么。
context:贯穿全书的框架,本节处于其"输入环节"。作者指出知识付费的另一个问题是"这些输入大概率还没有走完学习闭环"——必须从输入走到输出,中间经过理解信息、构建个人知识体系、内化知识;走完闭环才能应用个人知识去解释世界、解决问题。本节结束后进入笔记编码环节。
费曼一下:听过不等于懂了,懂了不等于能用。信息要在你脑子里走完一整圈——读进来、想明白、接进已有的知识、再讲出来或用出来——才算变成你的。停在"读过"那一步的,都还是别人的东西。
graph TD
C1["信息输入决定学习效果"]
C2["GIGO 垃圾进垃圾出"]
C3["信息素养"]
C4["阅读素养 占八成"]
C5["个人信息流构成"]
C6["阅读的目的 非虚构与虚构"]
C7["阅读的媒介 屏读与纸书"]
C8["家庭 idea lab"]
C9["家庭版回音室"]
C10["预训练类比课外阅读"]
C11["监督微调类比课堂与教培"]
C12["教育其实是筛选"]
C13["知识付费是低质量替代"]
C14["45678 手信息"]
C15["魔法思维"]
C16["学习闭环"]
C17["小树 FCE 案例"]
C2 -->|支撑| C1
C1 -->|层级| C3
C3 -->|主体| C4
C5 -->|构成| C3
C6 -->|维度| C4
C7 -->|维度| C4
C5 -->|包含| C8
C8 ---|对立| C9
C10 -->|类比| C4
C11 -->|对比| C10
C10 -->|因果| C12
C11 -->|支撑| C12
C13 -->|替代| C4
C14 -->|支撑| C13
C15 -->|因果| C13
C13 ---|张力| C16
C17 -->|例证| C1
C4 -->|支撑| C17
C16 -->|层级| C1
一个八岁半的孩子考出相当于雅思六分半的成绩,最容易被讨论的是"怎么做到的",最值得讨论的却是"没做什么"。没上培训班,没有海外经历,没学过语法——三个"没有"把常规解释变量一个个划掉之后,剩下的只有一件事:读了很多书,读的都是好书。这不是育儿经,这是一次控制变量做得相当干净的实验。
真正有意思的地方在于,同一个结论从一个完全不同的方向也被验证了一遍。这些年最强的智能不是被教出来的,是被读出来的。预训练阶段吞下几乎全部人类书籍和万亿量级的文本,做的事情简单到近乎笨拙:预测下一个词。没有人教过它阅读技巧,也没有人给它划过重点。而后面那些有标准答案的、由人精心准备的环节——相当于课堂教育和补习班的部分——加起来占比不到百分之几。孩子的大脑和这套系统当然不是一回事,但两边都指向同一个不舒服的事实:决定上限的是前面那个漫长、无人监督、看起来不出成绩的阅读阶段。
这就解释了一个长期被误读的现象。学校和机构展示的成绩,很多时候不是教出来的,而是筛出来的:筛的是那些家庭重视阅读、在"预训练"环节已经跑在前面的孩子。给这样的苗子做十几个小时的微调,讲讲方法,练三四次,剩下的就水到渠成。反过来,没有那个阶段的积累,砸多少钱进课堂也建不起知识的联结——那些花几十万补课、分数反而掉了几十分的家庭,撞上的正是这条原理。
成年人版本的同一个坑叫知识付费。它的问题不在于收费,而在于它是输入环节对阅读的低质量替代:内容要短平快,上来就给结论,还要立竿见影,恰好喂饱了人相信捷径、思想懒惰的那一面。更糟的是手数——书籍好歹经过专业评审,而没有上万小时积累的分享者,讲的多半是拼凑来的四五六七八手信息。加上这些输入通常停在"听过",从没走完从输入到理解、到内化、到输出的整个闭环。
所以那句判断可以说得很硬:学习者只分两种,一种用阅读来学习,另一种是其他。它对孩子成立,对成年人同样成立。你不必先相信阅读有多高尚,只需要承认一件事——大脑的唯一原料是信息,垃圾进,垃圾出。