Shello 是怎樣教的
學得牢的東西,都是自己下功夫學來的。你得自己把道理想通,趁還沒忘光時回頭複習,還得老實面對自己還有什麼不會。大多數學習應用程式的設計正好相反:馬上給你答案、替你寫好摘要、給你一個哄你開心的分數。Shello 就是圍繞那三件比較難的事來設計的。這一頁要說的,就是為什麼。
學習路徑
三件事,依序發生
導師根據真實的書本來教,先問,再講
所以一堂課從一個問題開始,問的是你自己也讀得到的那一章;而支持這樣開場的證據,強得少見。研究者比較各種教學方法時,用的是同一把尺,叫效應量。用這把尺量,真人一對一輔導是 d ≈ 0.79:這是已知最大的效應之一,卻比大家常引用的那個數字小。一步一步帶著學生走的輔導軟體,量出來跟真人導師差不多。
2025 年有一項隨機對照試驗。學生跟著一個把好的教學方法內建在設計裡的 AI 導師學,比在主動學習課堂上學,用的時間更少,學到的更多。功勞在設計。這也是 Shello 押的注:教學的功夫在系統怎麼搭建,從來不在模型有多聰明。至於打開一個模型隨便聊,這項試驗並沒有測。
學過的東西,接著會按遺忘的節奏安排複習
當下懂了,不等於一個月後還記得。研究裡有兩種讀書方法明顯勝過其他:自己考自己,以及把這些測驗分散開來,隔一段時間再考一次。Shello 的記憶卡兩樣都做,所以每個概念會在你差不多要忘記的時候,變成一個問題回到你面前。同一批研究也提醒了另一面:間隔練習會讓你反覆練的東西記牢,不管是對是錯。所以任何內容都要先對照它出自的那一章核對過,才會做成卡片。
我們唯一不遷就你的地方:誠實面對你會不會
掌握度地圖記的是你目前會與不會的地方;這份紀錄就算不中聽,也必須誠實。高估自己會多少的人,學得少、也記得少,這是量得出來的:他們聽不進回饋,也會跳過本來能補上這一課的功夫。所以地圖只照你的作答來顯示:哪個概念弱,就顯示它弱。其他一切,節奏、模式、想學多深,都由你決定;我們也絕不會拿內疚感來左右你。
看看實際怎麼學
一堂課在答案出現之前就開始了
導師會先等你說出推理,再根據章節查驗並修正。這個問題不是教學開始前的拖延;教學正是從這裡開始。
把一個遠高於其他數值的數加入一組小型資料。在計算之前,你預期它會怎麼影響平均數——為什麼?
行內流傳的兩個迷思,我們不跟著講
第一個迷思,是談輔導效果時大家常引用的那個數字。布魯姆(Bloom)那句有名的「兩個標準差」,說一對一輔導能把學生拉高兩個標準差,照它最強的那種說法,其實是以訛傳訛。經文獻回顧得出的數字是 d ≈ 0.79;迷思裡的數字,約是它的 2.5 倍。我們以這個老實的數字為基礎。
第二個迷思,是關於人怎麼讀書。寫摘要、畫重點、反覆重讀,在研究裡被評為效用最低的幾種方法,而大多數學習應用程式替你自動做的,偏偏就是這幾樣。所以 Shello 沒有「自動摘要」按鈕。這本書要你自己把學到的東西串起來,從不替你代勞。
證據都在這裡
上面說的都是簡短版。下面是完整的查核結果:每一個決定、我們的假設,以及結論。表裡的「Supported」(有研究支持),是指有已發表的研究支持這個選擇;「Practice standard」(行內慣常的做法),是指沒有對照研究、或對照研究用不上時,有專業慣例支持它。這份查核文件跟我們的程式碼放在一起。這張表每次網站建置時都從它重新產生,因此不可能悄悄過時。
展開完整證據查核
| 決定 | 我們的假設 | 結論 |
|---|---|---|
| 以對話輔導為核心方式 | 對話式導師勝過單純提供內容 | 有研究支持 — 但須按下文修正「兩個標準差」的說法 |
| 設有階梯提示和讓步機制的蘇格拉底方法(FR-M.3、P1) | 採用引導式提問,絕不讓學習者在毫無引導下摸索;學習者讓步時提供答案 | 有研究支持 — 研究強調必須有引導,正好符合我們的設計 |
| 透過 FSRS 進行間隔重複 | 按計畫進行提取練習,勝過重複閱讀 | 獲得強力支持 — 這是目前已知效用最高的兩種學習技巧 |
| 記憶模型:強度、隨閱讀時間衰減、半衰期(D-048) | 每項記憶的回想率按指數衰減;新證據會改變記憶強度 | 有研究支持 — Duolingo 也獨立地從資料推導出同一種模型 |
| P2:促使學習者自行整合,絕不代替他們整合 | 不自動產生摘要;筆記和標示是評量學習的介面 | 有研究支持 — 支持力度比我們原先知道的更強 |
| P3:如實呈現掌握程度 | 即使不中聽,也要給予準確回饋 | 有研究支持 — 過度自信會造成可測量的學習不足 |
| P1:學習模式由使用者選擇 | 讓學習者自主,絕不用內疚感推動他們 | 有研究支持(自我決定理論)— 對初學者的限制,我們已納入設計 |
| 學習者自行設定熟悉/能用/精通目標(D-059) | 學習目標由學習者在同一個真實的尺度上設定 | 有研究支持(SOLO 分類法、校準研究) |
| 有名字、以對話語氣交流的導師角色(FR-M.16) | 導師有名字、有禮、說話自然,並清楚說明自己是軟體 | 有研究支持(個人化和禮貌效應)— 說明軟體身分是倫理要求,不是成效手段 |
| 概念圖譜,以及跨書本、跨模式的掌握度(D-029、D-059) | 知識成分不取決於它在哪裡教授 | 有研究支持(KLI 架構) |
| 書本、記憶卡、導師各司其職;書中不設練習(P2、§0) | 不同學習過程需要不同工具 | 有研究支持(KLI 的三類學習過程) |
| 反覆練習前先核實內容(R3) | 絕不讓間隔重複把錯誤練熟 | 可由研究推論支持 — 讓 FSRS 有效的記憶機制,同樣會讓錯誤變得牢固 |
| 遇到痛苦或危機就退出教學,不把它當成教學回合(FR-M.19) | 學習者透露危機時,立即退出教學架構,並指引他們尋求人類協助 | 業界通行做法 — 依據危機應對規範,而非隨機對照試驗;我們會如實說明 |
| 受限制的領域(D-039) | 不提供針對個人的醫療、法律、財務或心理健康建議 | 業界通行做法 — 依據專業界線規範;這不是一個實證研究問題 |
| 重視長期記憶,不以互動量為指標(D-046、非目標) | 測量學習與回訪,絕不以使用次數衡量 | 原則上有研究支持 — 「互動不等於學習」正是這個領域本身的批評 |
| 按結構檢索,不使用嵌入向量(D-007) | 採用可瀏覽的章節索引,而非相似度搜尋 | 工程判斷 — 有研究支持以來源材料減少幻覺;具體機制仍須由我們在 D.4 驗證 |
| 按記憶保留時間傳送提醒(D-065) | 依據記憶狀態通知,絕不靠連續打卡 | 有研究支持 — 複習接近最佳時點,間隔學習才有效;不施加內疚感也符合自我決定理論 |
| 記憶卡標準:經過連續再學習才算掌握(D-065) | 牢固掌握=在多次有間隔的學習中成功回想 | 有研究支持 — Rawson 與 Dunlosky 的研究,包括專門針對統計學課程的研究 |
| 記憶卡標準:以常見誤解製作有競爭力的選擇題干擾項,並強制提供回饋(D-065) | 把陷阱變成干擾項,再以回饋消除其誘導作用 | 有研究支持 — Little 與 Bjork 關於競爭性選項的研究,以及 Butler/Roediger 一系關於回饋消除誘餌影響的研究 |
| 版本目標:可讀性區間只作警告級指標(D-065) | 公式提供參考,最終由人判斷 | 有研究支持,同時保留該領域本身的限制 — Flesch-Kincaid 明確不是簡化程度指標;連貫性指標表現更好;人工審核仍是標準 |
| 以模擬學習者測量結果,並與只閱讀內容的對照組配對比較(D-072) | 在真實學習者出現前,可以測量教學是否帶來遷移,但只能作為比較 | 工程判斷,並清楚標示 — 比較設計本身合理,也與長期記憶研究中的輔導組對閱讀組相呼應;尚未證實的是,角色扮演學習者的進步能否預測真人的進步。它只是 0.20 測量的快速預演,絕不取代真人測量 |
| 設有「沒有效果」分支的停止規則(D-073) | 調校過程必須能夠得出「這套教學循環沒有教學效果」的結論 | 業界通行做法 — 預先註冊和停止規則是標準實驗紀律,正因為看過資料才選門檻,門檻便會迎合資料;這不是關於學習成效的實證主張 |
| 課堂採用閱讀介面,而非聊天介面(D-086) | 課程像書本一樣排版,書本又能一鍵開啟,可讓對話緊扣原文,也讓導師的話更容易閱讀 | 設計假設,並清楚標示 — 沒有對照研究比較文件式與對話泡泡式導師對話對學習的影響;Mayer 的分段原則(由學習者控制節奏的內容區塊)與兩者都相容,ICAP 討論的是學習者的活動,而非版面。已有根據是它與 P4 及閱讀器分層設計(D-056)一致。它會以假設形式推出,並設淘汰標準:讓首批使用者進行 30 秒理解測試,同時記錄版面切換;如果結論改變,只須更換樣式,不牽涉架構 |
| 按能力類型記錄證據:辨識、回想、解釋、應用、遷移是證據紀錄的維度,而不是分數的維度(D-133) | 不同題型顯示的是不同的知識,所以唯有先記下題型,一個數字才能如實反映它們 | 有研究支持 — KLI 框架把這些視為不同的知識成分,研究中遷移也經常與記憶保留脫鉤;我們在上面另加一條誠實原則:一項能力要等證據足夠,才會顯示出來 |
| 把掌握程度當作一項經過校準的預測,再用日後的結果檢驗(D-133) | 強度和把握度合起來,估算的是學習者此刻在沒有提示下答對的機率;而計算掌握度那組常數是否正確,就看這個估算能否對得上 30 天後的結果 | 有研究支持 — 用日後表現檢驗校準,是知識追蹤領域的標準效度檢驗;預測看得見的行為,也化解了「掌握程度是在測量一種看不見的東西」這個質疑;資料少到不足以分組時,這套工具必須如實說明資料不足,而不是照樣給出一張校準表 |
| 逐位學習者記錄誤解,用詞取自固定詞彙清單(D-133) | 學習者持有的錯誤觀念,比只看分數更能指引教學;而針對已記下的那個想法去反駁,效果最好 | 有研究支持 — 反駁式文本和誤解診斷這兩支研究,已經撐起 D-057 的「陷阱」單元和 D-065 的競爭性誘答項,而兩者都以這份紀錄為前提;仍待我們證明的是,一份固定清單能涵蓋多少誤解 |
| 按證據挑選教學手法,最終由系統結構決定(D-133) | 根據學習者已經表現出來的情況挑選下一步教法,勝過每次都按同一階梯引導;前提是這個選擇可以查核,而且絕不推翻學習者自己的選擇 | 原則上有研究支持 — 適性教學的綜述研究支持按證據調整教法,範例效應和專家反轉效應就是最典型的例子;調整的準則在看到資料之前就寫好,而 P1 不受影響,因為系統改變的是怎麼教,絕不是學習者選了什麼 |
| 提供診斷式起點建議,僅供參考(D-133) | 用十分鐘做一次適性先備知識評估,就能為掌握度地圖打好底、也讓第一堂課更貼切,而選擇權仍在學習者手上 | 有研究支持 — 先備知識是學習成效最強的預測因素之一,而「只建議、不代為決定」與自我決定理論一致,正如 D-065 的路線規則;至於沿著前置概念圖逐層往下走的固定做法,屬工程判斷:捨棄少許精確度,換來可查核,也換來低階模型也負擔得起的成本 |