Shello 是怎么教的

学得牢的东西,都是自己下功夫学来的。你得自己把道理想通,趁还没忘光的时候回头复习,还得老老实实面对自己还有什么不会。大多数学习应用的设计正好相反:马上给你答案、替你写好摘要、给你一个哄你开心的分数。Shello 就是围绕那三件更难的事来设计的。这一页要说的,就是为什么。

学习路径

依次完成三个步骤

  1. 导师照着真实的课本教,先问,再讲

    所以,一节课从一个问题开始,问的是你自己也能读到的那一章;这样开场,背后的证据强得少见。研究者比较各种教学方法时,用的是同一把尺子,叫效应量。用这把尺子量,真人一对一辅导是 d ≈ 0.79:这是已知最大的效应之一,却比大家常引用的那个数字小。一步一步带着学生走的辅导软件,量出来跟真人导师差不多。

    2025 年有一项随机对照试验。学生跟着一个把好的教学方法内置在设计里的 AI 导师学,比在主动学习课堂上学,用时更少,学得更多。功劳在设计。这也是 Shello 押的注:教学的功夫在系统怎么搭建,从来不在模型有多聪明。至于打开一个模型随便聊,这项试验并没有测。

  2. 学过的东西,接下来会按遗忘的节奏安排复习

    当时听懂,不等于一个月后还记得。研究证实有两种学习方法效果显著:自我测试,以及拉长测试间隔。Shello 的闪卡结合了这两点,因此每个概念都会在你即将遗忘时,以问题的形式再次出现。但同一研究也指出另一面:间隔练习会让你记住反复练的内容,无论对错。因此,闪卡上的任何内容,都必须先与出处章节核对无误,才会被收录。

  3. 我们唯一不迁就你的地方:对你会不会,说实话

    掌握度地图记的是你会什么、还不会什么;这份记录哪怕不中听,也必须诚实。高估自己会多少的人,学得少、记得也少,这是量得出来的:他们听不进反馈,也会跳过本来能补上这一课的功夫。所以地图只按你的作答来显示:哪个概念弱,就显示它弱。其他一切,节奏、模式、想学多深,都由你决定;我们也绝不会拿内疚感来左右你。

实际案例

教学始于给出答案之前

导师会先等你阐述推理过程,再结合章节内容进行检验和修正。提问不是教学前的前奏,而是教学的起点。

将一个远大于其他数值的数加入一个小数据集。在计算前,你认为它会对平均数产生什么影响?为什么?

业内的两个误传,我们不跟着说

  1. 第一个误传,是谈辅导效果时大家常引用的那个数字。布卢姆(Bloom)那个著名的“两个标准差”,说一对一辅导能把学生拉高两个标准差,按它最强的那种说法,其实是以讹传讹。经文献综述得出的数字是 d ≈ 0.79;误传里的数字,约是它的 2.5 倍。我们以这个老实的数字为基础。

  2. 第二个误传,是关于人怎么学习。写摘要、划重点、反复重读,在研究里被评为效用最低的几种方法,而大多数学习应用替你自动做的,偏偏就是这几样。所以 Shello 没有“一键总结”按钮。这本书要你自己把学到的东西串起来,从不替你代劳。

证据都在这里

上面说的都是简短版。下面是完整的核查记录:每一个决定、我们的假设,以及结论。表里的“Supported”(有研究支持),是指有已发表的研究支持这个选择;“Practice standard”(业内的通行做法),是指没有对照研究、或对照研究用不上时,有业内惯例支持它。这份核查文档跟我们的代码放在一起。每次构建网站时,这张表都从它重新生成,因此不可能悄悄过时。

展开完整的证据核查
决定我们的假设结论
以对话辅导为核心模式对话式辅导优于纯内容呈现有研究支持 — 但须按下文对“两个标准差”效应进行修正
带阶梯提示和让步机制的苏格拉底方法(FR-M.3、P1)用引导式提问,绝不让学习者毫无引导地摸索;学习者让步时提供答案有研究支持 — 研究强调必须有引导,正好符合我们的设计
基于 FSRS 的间隔重复按计划进行检索练习优于重新学习得到强力支持 — 这是目前已知成效最高的两种学习技巧
记忆模型:强度、随阅读时间衰减、半衰期(D-048)每项记忆的回忆率按指数衰减;新证据会改变记忆强度有研究支持 — Duolingo 也独立地从数据中推导出同一种模型
P2:促使学习者自主整合,绝不代劳不自动生成摘要;笔记和高亮作为评估学习的载体有研究支持 — 支持力度超出我们原先的预期
P3:如实呈现掌握程度即使反馈令人不悦,也要保持准确有研究支持 — 过度自信会导致可衡量的学习成效下降
P1:学习模式由用户选择让学习者自主,绝不用内疚感推动他们有研究支持(自我决定理论)— 对新手的限制,我们已经纳入设计
学习者自行设定熟悉/掌握/精通目标(D-059)学习目标由学习者在同一客观尺度上自行设定有研究支持(SOLO 分类法、校准研究)
有名字、用对话语气的导师角色(FR-M.16)导师有名字、礼貌、说话自然,并明确说明自己是软件有研究支持(个性化和礼貌效应)— 说明软件身份是伦理要求,不是效果手段
概念图谱,以及跨书本、跨模式的掌握度(D-029、D-059)知识成分不取决于它在哪里被教授有研究支持(KLI 框架)
书本、闪卡、导师各司其职;书中不设练习(P2、§0)不同学习过程需要不同工具有研究支持(KLI 的三类学习过程)
反复练习前先核实内容(R3)绝不让间隔重复把错误练熟可由研究推论支持 — 让 FSRS 有效的记忆机制,同样会让错误变得牢固
触发危机干预时立即退出教学,不将其作为教学回合(FR-M.19)学习者披露危机时,立即退出教学框架并指引其寻求人工帮助业内通行做法 — 依据危机应对规范,而非随机对照试验;我们会如实说明
受限制的领域(D-039)不提供针对个人的医疗、法律、财务或心理健康建议业内通行做法 — 依据专业边界规范;这不是一个实证研究问题
重视长期记忆,不以互动量为指标(D-046、非目标)衡量学习与用户回访,绝不以使用次数衡量原则上有研究支持 — “互动不等于学习”正是这个领域自身的批评
按结构检索,不使用嵌入向量(D-007)用可导航的章节索引,而不是相似度搜索工程判断 — 有研究支持用来源材料减少幻觉;具体机制仍须由我们在 D.4 验证
按记忆保留时间发送提醒(D-065)依据记忆状态通知,绝不靠连续打卡有研究支持 — 复习接近最佳时点,间隔学习才有效;不施加内疚感也符合自我决定理论
闪卡标准:通过连续再学习才算掌握(D-065)牢固掌握=在多次有间隔的学习中成功回忆有研究支持 — Rawson 与 Dunlosky 的研究,包括专门针对统计学课程的研究
闪卡标准:用常见误解制作有竞争力的选择题干扰项,并强制提供反馈(D-065)把陷阱变成干扰项,再用反馈消除其诱导作用有研究支持 — Little 与 Bjork 关于竞争性选项的研究,以及 Butler/Roediger 一系关于反馈消除诱饵影响的研究
版本目标:可读性区间只作为警告级指标(D-065)公式提供参考,最终由人判断有研究支持,同时保留该领域自身的限制 — Flesch-Kincaid 明确不是简化程度指标;衔接性指标表现更好;人工审核仍是标准
用模拟学习者衡量结果,并与只阅读内容的对照组配对比较(D-072)在真实学习者出现前,可以衡量教学是否带来迁移,但只能作为比较工程判断,并明确标示 — 比较设计本身合理,也与长期记忆研究中的辅导组对阅读组相呼应;尚未证实的是,角色扮演学习者的进步能否预测真人的进步。它只是 0.20 测量的快速预演,绝不代替真人测量
设有“没有效果”分支的停止规则(D-073)调校过程必须能够得出“这套教学循环没有教学效果”的结论业内通行做法 — 预注册和停止规则是标准实验纪律,正因为看完数据才选门槛,门槛就会迎合数据;这不是关于学习效果的实证主张
课堂采用阅读界面,而非聊天界面(D-086)课程像书本一样排版,且书本一键可达,可让对话紧扣原文,也让导师的回复更易读设计假设,并明确标示 — 没有对照研究比较文档式与气泡式导师对话对学习的影响;Mayer 的分段原则(由学习者控制节奏的内容块)与两者都兼容,ICAP 讨论的是学习者的活动,而非版面。已有依据是它与 P4 及阅读器分层设计(D-056)一致。它会以假设形式上线,并设有淘汰标准:首批用户 30 秒理解测试,同时记录版面切换;若结论改变,只需更换样式,不涉及架构
按能力类型记录证据:识别、回忆、解释、应用、迁移是证据记录的维度,而不是分数的维度(D-133)不同题型显示的是不同的知识,所以只有先记下题型,一个数字才能如实把它们归纳起来有研究支持 — KLI 框架把这些视为不同的知识成分,研究中迁移也经常与记忆保留脱钩;我们在上面另加一条诚实原则:一项能力要等证据足够,才会显示出来
把掌握程度当作一项经过校准的预测,再用日后的结果检验(D-133)强度和把握度合起来,估算的是学习者此刻在没有提示下答对的概率;而计算掌握度那组常数是否正确,就看这个估算能否对得上 30 天后的结果有研究支持 — 用日后表现检验校准,是知识追踪领域的标准效度检验;预测看得见的行为,也化解了“掌握程度是在衡量一种看不见的东西”这个质疑;数据少到不足以分组时,这套工具必须如实说明数据不足,而不是照样给出一张校准表
按学习者逐一记录误解,用词取自固定清单(D-133)学习者相信了什么错的说法,比只看分数更能指引教学;而针对已记下的那个想法去反驳,效果最好有研究支持 — 反驳式文本和误解诊断这两支研究,已经撑起 D-057 的“陷阱”单元和 D-065 的竞争性干扰项,而两者都预设了正是这样一份记录;仍待我们证明的是,一份固定清单能涵盖多少误解
按证据挑选教学手法,最终由程序结构拍板(D-133)根据学习者已经表现出来的情况挑选下一步教法,胜过每次都照同一道阶梯走下去;前提是这个选择可以核查,而且绝不推翻学习者自己的选择原则上有研究支持 — 自适应教学的综述研究支持按证据调整教法,范例效应和专长逆转效应就是最典型的例子;调整的准则在看到数据之前就写好,而 P1 不受影响,因为系统改变的是怎么教,绝不是学习者选了什么
诊断式起点建议,仅供参考(D-133)用十分钟完成一次自适应的已有知识评估,就能为掌握度地图打好底,也让第一节课更贴切,而选择权仍在学习者手上有研究支持 — 已有知识是学习成效最强的预测因素之一,而“只建议、不代为决定”与自我决定理论一致,正如 D-065 的路线规则;至于沿着前置概念图逐层往下走的固定做法,属工程判断:舍弃少许精确度,换来可核查,也换来低阶模型也负担得起的成本

选择值得学习的内容