H
Howardism
Plate IIAI Economics & Labor機器翻譯 · machine-translated過時翻譯 · stale translationENHOWARDISM

生成式 AI 的實驗性學習影響

PublishedJuly 16, 2026FiledConceptDomainAI Economics & LaborTagsGovernanceWorkforceEducationHuman CapitalHuman AI CollaborationEmpiricalReading11 minSourceAI-synthesised

Contractor & Reyes(arXiv 2607.08849):一項由隨機分派、監考的實驗,讓 211 名大學生使用現成 AI,發現立即測驗分數提高 +0.27 SD,其中約 76% 在一週後的無輔助測驗中仍然保留;而且只有在移除 AI 後,作文品質才會提升——但持久的增益幾乎完全屬於 augmentation 使用者(將 AI 當作家教/解說者),automation 使用者(由 AI 起草文字)的短期增益則在 AI 消失後完全消失;這是與 AEI 自陳研究相對應的客觀、技能測量結果,顯示學習既能持續,也可能取決於使用模式而變得空洞

生成式 AI 實驗性學習影響插圖

資料來源#

摘要#

Zara Contractor 與 Germán Reyes(Middlebury College,arXiv 2607.08849,2026 年 7 月)進行了 AI 與學習研究文獻最缺少的一類研究:一項具備隨機對照實驗客觀、受監考、無輔助技能測量的實驗。211 名大學生學習一個不熟悉的技術主題(區塊鏈、碳捕集或 CRISPR),並在 35 分鐘的實驗室課程中撰寫分析性文章;他們被隨機分派至允許使用 AI禁止使用 AI的組別。一週後,所有人返回接受測驗,並在沒有任何 AI 或資源的情況下再次寫作。核心結果是:**使用 AI 可使立即測驗分數提高 0.27 SD;約 76% 的增益在一週後的無輔助測驗中仍然存在;作文品質只有在移除 AI 後才會提升。**但持久的部分並不均勻——幾乎完全屬於使用 AI 解釋概念(augmentation)的學生;使用 AI 起草文字(automation)的學生,短期作文增益很大,卻在 AI 消失後完全消失。這是對將思考外包,而非理解近乎受控的檢驗,也是automation–optimism link自陳研究無法提供的客觀技能測量

證據註記。empirical 且具因果性(隨機化、F 檢定平衡、double-lasso 控制、ITT + TOT/2SLS)——這是本資料庫學習叢集中最強的研究設計。但必須誠實界定範圍:研究對象是菁英文理學院的大學生(平均 GPA 3.68、SAT 1386,超過 80% 已是 AI 使用者),任務是受監考的 35 分鐘實驗室作業,使用現成的 ChatGPT (GPT-4o),只有一個主題、觀察一週。它測量的是在固定投入時間下,每單位時間的學習量(AI 改變了這一小時的使用方式,而不是時長——可能是因為實驗室提供的其他時間用途很少)。作者明確沒有主張現實世界的 AI 採用會整體提高學習量:在實驗室外,學生會自行決定讀書多久,而許多人使用 AI 是為了節省時間。這項研究能提供資訊,但無法定論職場技能萎縮。

用一段話說明研究設計#

受試者間的隨機分派在實驗室層級進行(八個時段 × 兩間平行實驗室)。第一階段:基線 5 題測驗 → 35 分鐘學習階段(閱讀、搜尋、起草約 500 字的文章;允許使用 AI 的組別可使用已登入 ChatGPT 的分頁,禁止使用 AI 的組別則使用 Google)→ 無輔助的 5 題後測。由監考人員、ChatGPT 紀錄與介面截圖確保遵從分派。第二階段(約 7 天後,所有人都無輔助):10 題測驗 + 一篇針對相同主題、提示互補的 20 分鐘作文。學習以兩種方式測量:知識測驗(事實/概念回憶)與作文(高階分析);後者由 311 名 Prolific 上的碩士/博士評分者加上一名 LLM 評分者盲評並取平均,同時納入客觀語言特徵(長度、可讀性、詞彙多樣性、文本相似度與 Pangram AI 偵測)。

第一階段很強:相較於幾乎為零的控制組,分派使 AI 使用率提高 67.3 個百分點;接受處理者中有 68% 使用 AI,88% 覺得它有幫助。從紀錄來看,最常見的用途是解釋概念(57%),其次是起草(31%),再其次是摘要(17%)。

持久的測驗分數增益集中在中段,且偏向能力較高者#

  • **立即效果:**控制組基線為 56.3%,分數提高 +6.7 個百分點,即 +0.27 SD(ITT;TOT +10.0 個百分點/+0.40 SD)。超過 Kraft(2020)747 項教育 RCT 的中位數 0.10 SD 兩倍,與結構化人類家教的 0.29 SD 相當,約等於 GPA 提高一個標準差,也約等於每名學生 8,600 美元的學校支出。
  • 保留(無輔助一週後):+5.1 個百分點 = +0.27 SD,約 76% 的立即效果仍然存在(兩者在統計上無法區分)。知識持久存在,但有部分衰減。
  • 分布形狀:增益位於分數分布的中段——兩端(0/1 分與接近滿分者)幾乎沒有變化(圖 4)。
  • 誰獲益:****較高 GPA/SAT 四分位數的增益更大(最低四分位約 0.05 SD;較高四分位為 0.19–0.40 SD)——因此AI 存取可能會擴大學習差距,這與軟體民主化所述提高底線的故事形成真正張力。
  • **感受與測量:**自評知識沒有任何處理效果(β=0.02)。學生確實學得更多,卻沒有感覺自己學得更多——這正好反映 AEI 自陳研究留下的感受與測量之間的疑慮。

高階技能只有在移除 AI 後才浮現#

第一階段中,處理組作文更長、更簡單,且被標記為 AI 生成的比例高出 12.3 個百分點(增加 96%),但整體品質只小幅且不精確地提升(+0.17 SD,p=0.25)——因為作文部分由 AI 撰寫,混合了輸出與學習。值得注意的是,沒有同質化:組內作文相似度持平,與 Brynjolfsson 等人(2025)在職場寫作中發現的趨同現象相反(開放式提示允許許多有效答案)。

清楚的解讀來自第二階段:一週後無輔助完成的作文(圖 6)中,AI 偵測效果降至 0.0 個百分點,風格差異也淡去——證明第一階段的風格變化是AI 文字進入作文,而不是持久的改變——同時品質增益浮現:寫作風格與清晰度 +0.30 SD(p=0.016),與提示的相關性 +0.26 SD(p=0.041)。學習是真實的,也提升了高階技能,而不只是事實回憶;但只有在移除 AI 這根拐杖後,它才變得可見。

augmentation 與 automation:對「外包思考,而非理解」的受控檢驗#

這篇論文最關鍵的結果。研究者根據 ChatGPT 紀錄將處理組使用者分類:49% augmentation(AI 與學生一起工作——家教、解說者)、32% automation(AI 完成工作——起草作文)、8% 混合、11% 離題。這個區分確實存在的驗證是:automation 使用者的作文有 53.6% 被標記為 AI 生成,augmentation 使用者則為 20.9%;而 automation 使用者閱讀/搜尋時間少了 17%。

第一階段作文品質第二階段作文品質(無輔助)第二階段測驗(無輔助)
Automation 使用者+0.54 SD(p=0.029)+0.02 SD——消失+0.19 SD(p=0.33,n.s.)
Augmentation 使用者+0.05 SD+0.22 SD(p=0.22)+0.29 SD(p=0.06)

Automation 在第一階段的優勢是由 AI 產生、在移除 AI 後無法存續的輸出;augmentation 的增益則在無輔助情況下持續,符合技能累積的解釋。這項實驗內的證明顯示,AI 的短期生產力提升與長期學習效果可能指向相反方向,關鍵取決於工具的使用方式——這正是 Karpathy 論點的形狀,也與 Strömberg 等人(2026)(AI 提高作業成績、降低考試成績,損失集中在外包者)、Bastani 等人(2025)(基礎 GPT-4:後續 −0.19 SD)以及 Shen & Tamkin(2026)(透過 AI 學習函式庫的工程師,在無輔助情況下得分更低)一致。統合分析(圖 5,22 個估計值的總平均為 0.18 SD)沿著這條軸整理了整個文獻:損失集中在 AI 可以替你完成練習的地方,增益則出現在 AI 扮演教練的地方。

機制#

  • 重新分配時間,而非節省時間。對總學習時間沒有影響(不同於 Noy & Zhang 2023 顯著的職場節時效果),但組成改變為寫作 −5.3 個百分點/閱讀與搜尋 +4.4 個百分點——努力從產生文字轉向吸收文字(任務執行 → 管理,類似 Copilot 使用者有一半時間花在驗證上)。
  • 愉悅感提高 13%(+0.66 分,p=0.031):AI 讓學習變得更投入,而非機械化。
  • **作弊增加,但不是主因:**規則違反合計增加 12.6 個百分點(p=0.005),但粗略估算的上限顯示,作弊最多只能解釋測驗分數增益約 2.2 個百分點(約三分之一)——這個效果主要是真實學習。

信念:經驗修正幅度,而非方向#

兩組都預期 AI 有幫助,但只有處理組正確估計了幅度。控制組學生預測自己的增益為 +25.2 個百分點——約為實際 5.1 個百分點的 5 倍;使用過 AI 的處理組學生預測 +3.8 個百分點,接近估計值。跨子群體來看,感知到的增益與實際增益一致。學生一開始也已經擁有正確的模型:69% 同時指出一種幫助與一種傷害的管道,54% 表示效果「取決於 AI 的使用方式」,而他們最常提到的兩種機制(AI 解釋/家教 40%;AI 讓工作走捷徑 42%)恰好對應 augmentation 與 automation。學生從一開始就理解這個機制;親身使用只會校準幅度——這項信念更新結果,與專業誤判文獻相呼應(Becker 等人 2025/METR:開發者預測速度提高 24%,實測降低 19%)。

它解決了什麼,以及沒有解決什麼#

對於這個族群與任務而言,它確立了現成 AI 能帶來持久且以客觀方式測量的學習增益,消除了「AI 必然侵蝕學習」的先驗信念——但結果取決於使用模式。它沒有確立:在時間由使用者自行決定的受監考實驗室之外,增益是否仍然成立;非菁英學習者是否也能獲益(增益偏向能力較高者,表示並非普遍如此);或相同的 augmentation/automation 分歧是否支配職場技能退化,因為類比證據仍然混雜(Brynjolfsson 的支援代理人學會了;Budzyń 的內視鏡醫師則技能退化)。

相關連結#

  • The Automation–Optimism Link——最主要的互補研究。AEI 調查發現,重度委派者自陳沒有學習損失;本實驗提供調查無法提供的客觀、隨機化測量——而且兩者既一致(augmentation 使用者的學習在無輔助情況下持續),也揭露調查看不見的分歧(automation 使用者的增益是空洞的,而「automation 比例」將兩種人混在一起)
  • Outsource Your Thinking, Not Your Understanding——對該論點近乎受控的檢驗:augmentation(AI 幫助你理解)建立持久技能;automation(AI 代替你思考)在移除後什麼也沒留下——Karpathy 的原則,且經過隨機化驗證
  • AI Brain Fry——兩者都為 AI 的認知影響提供了客觀、可測量的數字(該文是監督疲勞 → 錯誤增加 +11%/+39%;本文則是學習 → +0.27 SD,或 automation 使用者的空洞增益),用以對照較柔性的自陳訊號;本文的技能退化部分,就是該頁面機制在學習任務中的呈現
  • Returns to Expertise in Agentic Coding——異質性彼此呼應:增益偏向能力較高的學生,而 augmentation ≈ 使用 AI 深化理解;Anthropic 的研究發現,理解正是能放大 agent 效果的因素;兩者都表示,利益會流向帶來(或建立)理解的人
  • Exposure Taxonomy: Observed, Theoretical, Reported, Anticipated——信念部分:如同已報告/預期的 exposure,學生對 AI 效果的感知在方向上正確,但在親身使用修正之前,對幅度的估計並不準確
  • Printing Press Software Democratization——張力所在:民主化預測 AI 會提高底線,但此處的增益集中在能力較高的四分位數,暗示 AI 可能擴大而非縮小學習差距
  • Configurable Human Participation——系統端的鏡像,同週發表:HAS-Bench 的 agency 量表沿用相同的 augmentation 對 automation 軸線(A1–A2 偏向 automation,A3–A5 偏向 augmentation),兩者都得到相同形狀的結果——AI 與人類協作的價值取決於其模式與時機,而非數量(該研究中,A4 更多 agency 反而破壞 A3 能解決的任務;本文中,automation 模式的使用產生了隨工具消失而消失的空洞增益)

開放問題#

  • 實驗室固定了投入時間;作者指出,現實世界的學習取決於學生如何重新分配省下的時間。當學生可以把 AI 釋放的一小時完全用於其他事情時,augmentation 的紅利是否仍然存在?
  • 增益偏向能力較高者(較高 GPA/SAT 四分位數)。差距擴大的訊號是無限制 AI 的持久特性,還是高天花板菁英樣本造成的結果——在這個樣本中,最低四分位數幾乎沒有成長空間?
  • augmentation/automation 的選擇受到誘因影響,具有內生性(成績膨脹與訊號動機會把學生推向 automation)。誘因或介面設計能否大規模地將組成推向 augmentation——而這是否會扭轉技能退化的那一面?
  • 相同的使用模式分歧是否支配職場技能累積(The Automation–Optimism LinkAI Brain Fry留給工作者的開放問題),還是受監考的一週學術任務與在職學習差異太大,無法轉移?

資料來源#

  • Experimental Evidence on the Learning Impact of Generative AI——Contractor & Reyes,《Experimental Evidence on the Learning Impact of Generative AI》(arXiv 2607.08849,2026-07-09),empirical。§4 立即效果、§5 保留與 augmentation/automation 異質性、§6 信念、§7 結論;圖 4–8、表 4–8。
§ end
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

Cited by 15
Related articles