Shello 是怎樣教的

學得牢的東西,都是自己下功夫學來的。你得自己把道理想通,趁還沒忘光時回頭複習,還得老實面對自己還有什麼不會。大多數學習應用程式的設計正好相反:馬上給你答案、替你寫好摘要、給你一個哄你開心的分數。Shello 就是圍繞那三件比較難的事來設計的。這一頁要說的,就是為什麼。

學習路徑

三件事,依序發生

  1. 導師根據真實的書本來教,先問,再講

    所以一堂課從一個問題開始,問的是你自己也讀得到的那一章;而支持這樣開場的證據,強得少見。研究者比較各種教學方法時,用的是同一把尺,叫效應量。用這把尺量,真人一對一輔導是 d ≈ 0.79:這是已知最大的效應之一,卻比大家常引用的那個數字小。一步一步帶著學生走的輔導軟體,量出來跟真人導師差不多。

    2025 年有一項隨機對照試驗。學生跟著一個把好的教學方法內建在設計裡的 AI 導師學,比在主動學習課堂上學,用的時間更少,學到的更多。功勞在設計。這也是 Shello 押的注:教學的功夫在系統怎麼搭建,從來不在模型有多聰明。至於打開一個模型隨便聊,這項試驗並沒有測。

  2. 學過的東西,接著會按遺忘的節奏安排複習

    當下懂了,不等於一個月後還記得。研究裡有兩種讀書方法明顯勝過其他:自己考自己,以及把這些測驗分散開來,隔一段時間再考一次。Shello 的記憶卡兩樣都做,所以每個概念會在你差不多要忘記的時候,變成一個問題回到你面前。同一批研究也提醒了另一面:間隔練習會讓你反覆練的東西記牢,不管是對是錯。所以任何內容都要先對照它出自的那一章核對過,才會做成卡片。

  3. 我們唯一不遷就你的地方:誠實面對你會不會

    掌握度地圖記的是你目前會與不會的地方;這份紀錄就算不中聽,也必須誠實。高估自己會多少的人,學得少、也記得少,這是量得出來的:他們聽不進回饋,也會跳過本來能補上這一課的功夫。所以地圖只照你的作答來顯示:哪個概念弱,就顯示它弱。其他一切,節奏、模式、想學多深,都由你決定;我們也絕不會拿內疚感來左右你。

看看實際怎麼學

一堂課在答案出現之前就開始了

導師會先等你說出推理,再根據章節查驗並修正。這個問題不是教學開始前的拖延;教學正是從這裡開始。

把一個遠高於其他數值的數加入一組小型資料。在計算之前,你預期它會怎麼影響平均數——為什麼?

行內流傳的兩個迷思,我們不跟著講

  1. 第一個迷思,是談輔導效果時大家常引用的那個數字。布魯姆(Bloom)那句有名的「兩個標準差」,說一對一輔導能把學生拉高兩個標準差,照它最強的那種說法,其實是以訛傳訛。經文獻回顧得出的數字是 d ≈ 0.79;迷思裡的數字,約是它的 2.5 倍。我們以這個老實的數字為基礎。

  2. 第二個迷思,是關於人怎麼讀書。寫摘要、畫重點、反覆重讀,在研究裡被評為效用最低的幾種方法,而大多數學習應用程式替你自動做的,偏偏就是這幾樣。所以 Shello 沒有「自動摘要」按鈕。這本書要你自己把學到的東西串起來,從不替你代勞。

證據都在這裡

上面說的都是簡短版。下面是完整的查核結果:每一個決定、我們的假設,以及結論。表裡的「Supported」(有研究支持),是指有已發表的研究支持這個選擇;「Practice standard」(行內慣常的做法),是指沒有對照研究、或對照研究用不上時,有專業慣例支持它。這份查核文件跟我們的程式碼放在一起。這張表每次網站建置時都從它重新產生,因此不可能悄悄過時。

展開完整證據查核
決定我們的假設結論
以對話輔導為核心方式對話式導師勝過單純提供內容有研究支持 — 但須按下文修正「兩個標準差」的說法
設有階梯提示和讓步機制的蘇格拉底方法(FR-M.3、P1)採用引導式提問,絕不讓學習者在毫無引導下摸索;學習者讓步時提供答案有研究支持 — 研究強調必須有引導,正好符合我們的設計
透過 FSRS 進行間隔重複按計畫進行提取練習,勝過重複閱讀獲得強力支持 — 這是目前已知效用最高的兩種學習技巧
記憶模型:強度、隨閱讀時間衰減、半衰期(D-048)每項記憶的回想率按指數衰減;新證據會改變記憶強度有研究支持 — Duolingo 也獨立地從資料推導出同一種模型
P2:促使學習者自行整合,絕不代替他們整合不自動產生摘要;筆記和標示是評量學習的介面有研究支持 — 支持力度比我們原先知道的更強
P3:如實呈現掌握程度即使不中聽,也要給予準確回饋有研究支持 — 過度自信會造成可測量的學習不足
P1:學習模式由使用者選擇讓學習者自主,絕不用內疚感推動他們有研究支持(自我決定理論)— 對初學者的限制,我們已納入設計
學習者自行設定熟悉/能用/精通目標(D-059)學習目標由學習者在同一個真實的尺度上設定有研究支持(SOLO 分類法、校準研究)
有名字、以對話語氣交流的導師角色(FR-M.16)導師有名字、有禮、說話自然,並清楚說明自己是軟體有研究支持(個人化和禮貌效應)— 說明軟體身分是倫理要求,不是成效手段
概念圖譜,以及跨書本、跨模式的掌握度(D-029、D-059)知識成分不取決於它在哪裡教授有研究支持(KLI 架構)
書本、記憶卡、導師各司其職;書中不設練習(P2、§0)不同學習過程需要不同工具有研究支持(KLI 的三類學習過程)
反覆練習前先核實內容(R3)絕不讓間隔重複把錯誤練熟可由研究推論支持 — 讓 FSRS 有效的記憶機制,同樣會讓錯誤變得牢固
遇到痛苦或危機就退出教學,不把它當成教學回合(FR-M.19)學習者透露危機時,立即退出教學架構,並指引他們尋求人類協助業界通行做法 — 依據危機應對規範,而非隨機對照試驗;我們會如實說明
受限制的領域(D-039)不提供針對個人的醫療、法律、財務或心理健康建議業界通行做法 — 依據專業界線規範;這不是一個實證研究問題
重視長期記憶,不以互動量為指標(D-046、非目標)測量學習與回訪,絕不以使用次數衡量原則上有研究支持 — 「互動不等於學習」正是這個領域本身的批評
按結構檢索,不使用嵌入向量(D-007)採用可瀏覽的章節索引,而非相似度搜尋工程判斷 — 有研究支持以來源材料減少幻覺;具體機制仍須由我們在 D.4 驗證
按記憶保留時間傳送提醒(D-065)依據記憶狀態通知,絕不靠連續打卡有研究支持 — 複習接近最佳時點,間隔學習才有效;不施加內疚感也符合自我決定理論
記憶卡標準:經過連續再學習才算掌握(D-065)牢固掌握=在多次有間隔的學習中成功回想有研究支持 — Rawson 與 Dunlosky 的研究,包括專門針對統計學課程的研究
記憶卡標準:以常見誤解製作有競爭力的選擇題干擾項,並強制提供回饋(D-065)把陷阱變成干擾項,再以回饋消除其誘導作用有研究支持 — Little 與 Bjork 關於競爭性選項的研究,以及 Butler/Roediger 一系關於回饋消除誘餌影響的研究
版本目標:可讀性區間只作警告級指標(D-065)公式提供參考,最終由人判斷有研究支持,同時保留該領域本身的限制 — Flesch-Kincaid 明確不是簡化程度指標;連貫性指標表現更好;人工審核仍是標準
以模擬學習者測量結果,並與只閱讀內容的對照組配對比較(D-072)在真實學習者出現前,可以測量教學是否帶來遷移,但只能作為比較工程判斷,並清楚標示 — 比較設計本身合理,也與長期記憶研究中的輔導組對閱讀組相呼應;尚未證實的是,角色扮演學習者的進步能否預測真人的進步。它只是 0.20 測量的快速預演,絕不取代真人測量
設有「沒有效果」分支的停止規則(D-073)調校過程必須能夠得出「這套教學循環沒有教學效果」的結論業界通行做法 — 預先註冊和停止規則是標準實驗紀律,正因為看過資料才選門檻,門檻便會迎合資料;這不是關於學習成效的實證主張
課堂採用閱讀介面,而非聊天介面(D-086)課程像書本一樣排版,書本又能一鍵開啟,可讓對話緊扣原文,也讓導師的話更容易閱讀設計假設,並清楚標示 — 沒有對照研究比較文件式與對話泡泡式導師對話對學習的影響;Mayer 的分段原則(由學習者控制節奏的內容區塊)與兩者都相容,ICAP 討論的是學習者的活動,而非版面。已有根據是它與 P4 及閱讀器分層設計(D-056)一致。它會以假設形式推出,並設淘汰標準:讓首批使用者進行 30 秒理解測試,同時記錄版面切換;如果結論改變,只須更換樣式,不牽涉架構
按能力類型記錄證據:辨識、回想、解釋、應用、遷移是證據紀錄的維度,而不是分數的維度(D-133)不同題型顯示的是不同的知識,所以唯有先記下題型,一個數字才能如實反映它們有研究支持 — KLI 框架把這些視為不同的知識成分,研究中遷移也經常與記憶保留脫鉤;我們在上面另加一條誠實原則:一項能力要等證據足夠,才會顯示出來
把掌握程度當作一項經過校準的預測,再用日後的結果檢驗(D-133)強度和把握度合起來,估算的是學習者此刻在沒有提示下答對的機率;而計算掌握度那組常數是否正確,就看這個估算能否對得上 30 天後的結果有研究支持 — 用日後表現檢驗校準,是知識追蹤領域的標準效度檢驗;預測看得見的行為,也化解了「掌握程度是在測量一種看不見的東西」這個質疑;資料少到不足以分組時,這套工具必須如實說明資料不足,而不是照樣給出一張校準表
逐位學習者記錄誤解,用詞取自固定詞彙清單(D-133)學習者持有的錯誤觀念,比只看分數更能指引教學;而針對已記下的那個想法去反駁,效果最好有研究支持 — 反駁式文本和誤解診斷這兩支研究,已經撐起 D-057 的「陷阱」單元和 D-065 的競爭性誘答項,而兩者都以這份紀錄為前提;仍待我們證明的是,一份固定清單能涵蓋多少誤解
按證據挑選教學手法,最終由系統結構決定(D-133)根據學習者已經表現出來的情況挑選下一步教法,勝過每次都按同一階梯引導;前提是這個選擇可以查核,而且絕不推翻學習者自己的選擇原則上有研究支持 — 適性教學的綜述研究支持按證據調整教法,範例效應和專家反轉效應就是最典型的例子;調整的準則在看到資料之前就寫好,而 P1 不受影響,因為系統改變的是怎麼教,絕不是學習者選了什麼
提供診斷式起點建議,僅供參考(D-133)用十分鐘做一次適性先備知識評估,就能為掌握度地圖打好底、也讓第一堂課更貼切,而選擇權仍在學習者手上有研究支持 — 先備知識是學習成效最強的預測因素之一,而「只建議、不代為決定」與自我決定理論一致,正如 D-065 的路線規則;至於沿著前置概念圖逐層往下走的固定做法,屬工程判斷:捨棄少許精確度,換來可查核,也換來低階模型也負擔得起的成本

選一件值得學的事