資料來源#
摘要#
Agarwal、Miller、Kästner 與 Vasilescu(Carnegie Mellon、arXiv 2607.07980,2026 年 7 月)大規模綜合實務工作者的論述,提出一套解釋 coding agent 如何重塑程式碼審查的因果理論:包含 26 個構念與 67 個關係(64 個有向關係、3 個具爭議的關係),建基於 3,100 份編碼的灰色文獻文件。其組織性主張是:**審查是決定 coding agent 對軟體產生何種影響的控制點,而 AI 不會固定該影響的方向——方向由團隊決定,**取決於審查者帶來的專業能力,以及團隊如何調整審查流程。「AI 正在改變程式碼審查」因此被轉化為可證偽的命題,並配有明確命名的構念與調節變項。
這篇論文是本資料庫第一個非供應商、機制層級的 AI 影響審查動態之說明,也直接對照 Faros 的供應商遙測(見下方矛盾之處)。
證據註記。
empirical,但有一項關鍵區分。這套理論是根據實務工作者主張的內容提出的解釋性理論,再經研究者篩選——「我們沒有確認這些關係中的任何一項」。其中的構念與連線都是待測試的假設,而不是已量測的效果;應將 P1–P17 視為可證偽的主張,而非研究發現。真正量測的部分,是一項用來提供動機的GitHub 觀察性研究(涵蓋 2,860 個暴露於 agent 的公開儲存庫、250 萬個以上 PR)——是真實的遙測,但作者的重點是:在合理的分析選擇下,方向並不穩定。因此,本頁並未在品質結果上以量測超越 Faros(它完全沒有量測品質結果);它新增的是非供應商的長期遙測,以及一項嚴謹論證:沒有因果模型,就不能解讀表面趨勢。
三個調節變項(論文的核心結論)#
核心主張是,agents 並非單調地改善或損害審查;它們會對審查系統施壓,卻不固定任何單一結果,而三個調節變項決定系統最終朝哪個方向發展:
- 審查者的專業能力與取向——審查者具備的技能,以及他們是否以信任或懷疑的框架閱讀 AI 程式碼。
- 自動化審查者的能力——納入迴路的 AI 審查者實際上有多好。
- 流程調整——團隊因應情況採用的審查治理政策。
這是 Returns to Expertise in Agentic Coding 在審查側的鏡像:能放大 coding agent 效果(或抵禦其影響)的,是人類的理解力與團隊實務,而不是技術本身。
理論的形狀:驅動因素 → 審查動態 → 結果#
這套理論(圖 2)由上而下閱讀。節點形狀編碼角色,連線樣式編碼方向(實線 = 增加、虛線 = 減少、粗體 = 具爭議、方向由調節變項決定):
- 驅動因素(agent 程式碼的外生屬性,矩形):程式碼產出的數量與速度增加(「審查者吞吐量隨人數線性成長;AI 生成量則按每位開發者呈乘法成長」)、表面可信度(讀起來乾淨且符合慣用寫法)、程式碼不透明/意圖遺失(沒有任何人類形成其理由)、輸出不一致性(每次執行間的變異),以及資料與 IP 暴露風險。
- 審查動態(可調控的中間層,橢圓):懷疑、自動化審查與閘門的使用、審查治理政策、審查預算、聚焦高層次意圖、審查深度、理解債務、審查者技能與經驗、coding skill、集體擁有權、審查有效性、審查效率、審查動機。
- 結果(實務工作者關心的事項,六邊形):程式碼品質、程式碼安全性、審查吞吐量、審查延遲、可維護性、知識轉移與 mentorship。
核心是 review depth + reviewer skill——這是最繁忙的構念,表面可信度、擁有權與 coding skill 都透過它們影響吞吐量與品質。核心也會回饋自身(見下方迴路)。
關鍵機制(可證偽的命題)#
- 數量 → 較淺的審查或倦怠。 更高的審查負載會降低審查深度(P1:略讀而非閱讀——「一個 sprint 審查 200 個 AI 生成的 PR……他們是在略讀,不是在閱讀」),也會降低審查動機(P2);將相對更多時間轉向審查,還會進一步降低動機(P3:「讀幾個小時的 AI 程式碼後,我比寫兩倍時間的程式碼更疲憊」)。實務工作者害怕的終點是:審查變得「膚淺或被放棄……流於表演」。
- 表面可信度會解除審查者的戒心。 精雕細琢會降低審查者的警戒(P4:「精雕細琢可能降低審查者的戒心」;「資深者會對看似符合慣用寫法、卻藏著細微錯誤的程式碼蓋橡皮圖章」)——一個「偽裝成正確程式碼」的缺陷,因為受到較少檢視而更快通過。這是 Polish No Longer Signals Readiness 在審查層的體現。
- 懷疑是另一面。 將 AI 程式碼視為可疑——「就像一個極度自信卻只有中等能力的初級開發者,我會把每一行都當成謎題來讀」——會提高深度與有效性、降低效率(P5),並能抵消表面可信度;它受到對輸出不一致性的認知所推動(P6)。
- 不透明性以三種方式損害審查(P7):重建意圖會降低效率,缺少衡量標準即使投入全部心力也會降低有效性,而繁重乏味的工作則會降低動機。
- 自動化審查:吞吐量上升,但品質具爭議。 完全自動化會提高合併吞吐量並降低延遲(P8),但其對程式碼品質/安全性的影響確實具爭議(P9)——一方引用 CodeRabbit 抓到約 82% 植入錯誤的案例;另一方則表示它「抓得到風格問題,卻抓不到負載下競態條件那類問題」,並製造虛假的信心。
- 理解陷阱(P10/P11)。 AI 輔助審查會爬升抽象階梯(「你不再逐行閱讀,現在你是稽核者」)並提升審查者技能——但聚焦高層次意圖會累積理解債務,即使審查深度很高:「我們審查的不是食譜,而是在品嚐菜餚。」
- 治理政策(P16/P17)。 要求仔細審查的政策會提高深度(有效性上升、效率下降);它對延遲的影響具爭議,且由校準決定——只對重大變更設閘門的風險分級政策會降低延遲,對所有變更設閘門的全面政策則會提高延遲。
回饋迴路(較少被關注的人力成本)#
這篇論文在結構上的貢獻,是展示核心會回饋自身,因此今天換取吞吐量的決策,可能侵蝕明天進行良好審查的能力:
- 低審查深度會限制審查者技能的成長(P12);再加上較少的 coding 時間與收到低品質審查,會削弱審查技能所依賴的 coding skill(P13)——「你還不知道如何建造的東西,怎麼審查?」
- 審查深度會建立集體擁有權與知識轉移;自動化審查則透過降低深度,以及捷徑式繞過承載兩者的人類協作,同時削弱兩者(P14)——「當沒有任何人深入審查邏輯時,就沒有人擁有它。」
- 低深度 + 不透明性會增加理解債務,進而侵蝕可維護性、擁有權、知識轉移與未來的審查技能(P15)——「如果你正在合併自己並不完全理解的 PR,bus factor 就會升高到危險程度。」
迴路究竟轉為良性(懷疑 → 更深入的審查 → 更敏銳的審查者)或惡性(蓋橡皮圖章 → 技能萎縮 → 更淺的審查),取決於許多相互作用的決策——論文將此界定為系統動力學問題,而非單一因果問題。
觀察性研究:真實遙測,不穩定的趨勢#
這套理論源自作者無法解讀自身 GitHub 資料的困境。他們針對 Agents in the Wild corpus 中 2,860 個暴露於 agent 的儲存庫,重新抓取完整 PR 歷史(2020 年 1 月至 2026 年 2 月),發現 agent 撰寫的 PR 在某個時間點上較少獲得獨立審查(僅作者審查的比例為 40.1%,人類 PR 則為 21.5%;配對 Wilcoxon p<0.001)、合併速度快數倍(從中位數的幾分鐘至幾小時,相較於幾小時),且討論較少(50.2% 沒有審查留言,相較於 37.9%;即使按變更行數計算也較少)。這與先前的快照研究一致。
但有兩件事打破了這種輕易的解讀:
- 無審查率是趨同,而非發散。 收到任何人類審查的已合併 agent PR 比例,會從2025 年中超過 50%,降至 2026 年初約 14% 的穩定人類基準——最初不加查核地合併 agent 輸出的意願,逐漸轉為以審查人類 PR 的大致方式審查 agent PR。(這與 Yu 等人的審查者內部習慣化相反;在那項研究中,監督會隨時間弱化——因此研究甚至在監督究竟是鞏固還是侵蝕這個基本方向上也彼此不一致。)
- 方向會隨定義選擇反轉。 agent PR 的「獨立審查」究竟高於或低於人類比例,取決於你是否將呼叫 agent 的開發者算作獨立審查者(agent-as-author),或算作審查自己工作的作者(agent-as-tool)。同一份資料,卻得到相反結論。圖 5 與圖 6 會從相同資料列支持不同的標題。
教訓是(Pearl:「資料極其愚蠢」):表面軌跡能建立的是正在改變什麼,而非為什麼改變;沒有一套關於審查目的的理論,就無法解讀這些軌跡。
矛盾:本論文 vs. Faros 的 Acceleration Whiplash#
Faros 2026(vendor-claim)主張吞吐量/品質落差會隨採用程度擴大,甚至波及高成熟度組織(「即使最強的基礎也正在崩塌」;31.3% 的 PR 在沒有審查下合併,是「最迫切的發現」),也就是說,AI 的下游損害大致具有固定且惡化的方向。本論文在兩個軸線上對此提出張力:
- 隨時間的方向。 Faros 將審查不足解讀為日益嚴重的危機;本論文的非供應商 GitHub 遙測則發現,隨著組織學會審查 agent 程式碼,agent 無審查率會向下趨近人類基準。雙方都要保留但書:族群不同(此處是開源 GitHub,Faros 則主要是企業遙測)、指標不同(按日曆時間的涵蓋率 vs 採用深度的橫斷面),而且本研究是觀察性的,沒有不採用者對照組。
- 方向是否固定? Faros 的框架是決定論式的(「成熟度無法保護你」);本論文的整體論題則是:AI 不會固定方向——決定方向的是團隊的專業能力與流程,這更接近 DORA 的「強大基礎能保護你」,而非 Faros。但它沒有量測成熟度效果;它只是以論述為基礎,主張這些調節變項確實存在。
權衡來看:兩者在品質結果上都沒有勝過對方(本論文完全沒有量測;Faros 的結果是真實的,但遙測由供應商選取)。持久的要點是:(a) 非供應商證據顯示,至少在開源環境中,agent 程式碼的審查不足是早期採用的暫時階段,而不是持續擴大的落差;以及 (b) 一項論證充分的主張:Faros 的固定方向框架跳過了決定結果的調節變項。完整調和結果——「發散」消解為四個不可比軸線(數量差 vs 份額水準、企業 vs 開源、採用深度橫斷面 vs 日曆趨勢、所有 PR vs agent PR),只留下數量預測仍真正具爭議——已整理於 The Under-Review Divergence: Faros's Widening Crisis vs. CMU's Convergence。
相關連結#
- Acceleration Whiplash — 直接對照:Faros 的供應商遙測表示落差擴大且成熟度無法提供保護;這套非供應商理論則表示方向由團隊設定,而無審查率會趨同(見上方矛盾)
- Telemetry vs. Survey Measurement — 強化方法論爭論:這正是 OQ 要求的非供應商遙測,但其重點是,沒有因果模型時,遙測的方向並不穩定——遙測在延遲上勝過問卷,卻無法單獨裁決
- AI as Primary Author — 提供本理論的驅動因素:數量/速度、表面可信度與程式碼不透明性(意圖遺失)正是 Faros 所見的作者身分轉移,只是被視為審查的輸入;「呼叫 agent 的人類是獨立審查者,還是作者?」這個歧義,是「接受代表什麼」在審查側的對應問題
- Verification as the New Bottleneck — 控制點主張本身就是以機制圖呈現的瓶頸論題;它回答「自動化審查應推到多遠?」——吞吐量/延遲是肯定的(P8),品質/安全性具爭議(P9),延遲方向則由政策校準設定(P17)
- Returns to Expertise in Agentic Coding — 審查側的鏡像:審查者專業能力 + 取向是設定方向的三個調節變項之首;專業能力在此處會放大效果(並提供保護),正如它在另一篇文章的撰寫鍵盤前所做的一樣
- Outsource Your Thinking, Not Your Understanding — 理解債務是 Karpathy 的「你不能外包理解」被量化為審查構念;「品嚐菜餚,而非閱讀食譜」就是侵蝕機制
- Agentic Technical Debt — 理解債務是架構漂移的認知雙胞胎;兩者都會以 agentic-coding 的速度透過強化迴路累積
- Polish No Longer Signals Readiness — 審查層的表面可信度:精雕細琢會解除審查者的防禦(P4),因此看起來像 production 的 diff 所傳達的訊息少於表面所示
- AI Brain Fry — 審查負載 → 疲勞 → 蓋橡皮圖章(P2/P3)是監督疲勞機制;此處的來源是實務工作者論述,而非受控實驗
- Loop Engineering — 「將人類審查納入 agent 自身的迴路/由第二個 sub-agent 檢查第一個」是論文列舉的立場之一;製作者/檢查者分工,就是作為審查動態構念的自動化審查
- LLM-Assisted Grey-Literature Theory Building — 產生這套理論的方法(也是論文的次要貢獻)
開放問題#
- 67 個關係中的每一個都是假設,而非研究發現——論文明確呼籲進行因果估計量研究(控制其他構念),以確認、反轉或刪除每條連線。P1–P17 中哪些能通過量測?
- 當 agentic 撰寫從 PR 的 <1% 走向兩位數百分比時,無審查的趨同是否仍成立?還是早期採用的紀律會像 Faros 預測的那樣,在數量壓力下瓦解?
- 論文自身提出的問題是:哪些決策、在什麼條件下,會將系統推向良性迴路,而非惡性迴路?——它暗示了系統動力學的槓桿點分析,卻沒有真正執行。
- 三條具爭議的連線(自動化審查 → 品質/安全性,P9;治理 → 延遲,P17;以及另一條)之所以具爭議,正是因為其方向由調節變項設定——究竟哪些調節門檻會使它們反轉?
資料來源#
- 3100 Opinions on Code Review in an AI World: Building Causal Theory from Practitioner Discourse — Agarwal、Miller、Kästner 與 Vasilescu(CMU、arXiv 2607.07980,2026-07-08),
empirical。§IV(理論、構念與 P1–P17)、§II-B 與附錄 1(提供動機的觀察性研究、研究發現不穩定性)、§VI(討論:控制點、三個調節變項、系統動力學框架)、§VII(結論)
Cited by 30
- The Under-Review Divergence: Faros's Widening Crisis vs. CMU's Convergence×6
The volume test hasn't happened. Faros's dataset has agentic authoring at <1% of PRs and warns that…
- Security Debt of Agent-Generated Code×5
Two reasons to hold both numbers together rather than merge them. They are different populations —…
- Is Human Review of AI-Authored Code Still a Real Control, or Already Rubber-Stamping?×4
The construct instability is measured, not hypothetical: on GitHub, agent PRs are most often…
- Risk-Tiered Auto-Approval×4
It is the deployed form of the construct CMU's review theory names in P17: a risk-tiered governance…
- Acceleration Whiplash×3
Review As The Control Point — the non-vendor foil. Faros (vendor-claim) argues the gap widens with…
- Agent Review Comment Resolution×3
Read the direction carefully — it is the opposite of every other review page in this vault. Review…
- Open Questions Backlog×3
Review As The Control Point: Every one of the 67 relationships is a hypothesis, not a finding — the…
- Telemetry vs. Survey Measurement×3
Is there a non-vendor telemetry dataset large enough to adjudicate the maturity-protection question…
- AI as Primary Author×2
The 60% figure aggregates very different tools and modes (autocomplete acceptance vs. agent-applied…
- When Knowledge Layers Disagree: Context Files vs Memory, and Conflicting Sources at Compile Time×2
Both answers rest on one principle the corpus establishes independently at the security layer and…
- Dynamic Workflows: An Algebra for Agents×2
Human review moved up a level. He did not review a million lines. "I reviewed the original Rust…
- Efficiency Debt of AI-Generated Code×2
Two things follow. First, this is a production-scale null against the simplest reading of Review As…
- Instruction Compounding×2
Review As The Control Point — the review instance in its own domain: an instruction meant to raise…
- LLM-Assisted Grey-Literature Theory Building×2
The "method paper in disguise" inside Agarwal, Miller, Kästner & Vasilescu (CMU, arXiv 2607.07980)…
- Same-Model Review Blindness×2
Two consequences. First, a review agent's recall is partly a property of its post-training and its…
- Verification as the New Bottleneck×2
Review As The Control Point — the mechanism map under this thesis: review is where a coding agent's…
- Agent-Generated Test Quality
Review As The Control Point — a process-adaptation prescription with a measurement behind it, which…
- Agentic Technical Debt
Review As The Control Point — comprehension debt is this architectural debt's cognitive twin in the…
- AI Brain Fry
Review As The Control Point — the same fatigue mechanism sourced from practitioner discourse rather…
- Community Smells Under AI Adoption
Review As The Control Point — the mechanism one respondent names for sustained interaction ("as…
- Jarred Sumner
Review moves up an altitude. He did not read a million lines. He reviewed whether the adversarial…
- Large-Scale Test-Time Compute
Per-task-class allocation, in practice. Code-review accuracy "holds at lower effort settings, which…
- Loop Engineering
Review As The Control Point — "fold human review into the agent's own loop / a second sub-agent…
- AI Coding Practice
Review As The Control Point — Agarwal et al. (CMU, arXiv 2607.07980): a…
- Optimizer–Evaluator Decoupling
Review As The Control Point — what decoupling does to the human's job at volume: the reviewable…
- Outsource Your Thinking, Not Your Understanding
Review As The Control Point — "you can't outsource understanding" measured as a review construct:…
- Polish No Longer Signals Readiness
Review As The Control Point — the same severed signal at the code-review layer: surface…
- Post-Acceptance Edit Behavior
Review As The Control Point — the repair layer upstream of everything that theory models. Volume,…
- Returns to Expertise in Agentic Coding
Review As The Control Point — the same claim on the review side: reviewer expertise + disposition…
- The Tragedy of the Cognitive Commons
Review As The Control Point — the control-point argument depends on reviewers who can substantively…
Related articles
- Verification as the New Bottleneck
Fiona Fung: coding is no longer the bottleneck — verification, review, maintenance are; shift-left; TDD loses its tax;…
- Acceleration Whiplash
Faros 2026: AI floods a human-paced SDLC with output it can't absorb — throughput up (tasks +34%, epics +66%), quality…
- Security Debt of Agent-Generated Code
Sakib, Banik & Jadliwala (UTSA, arXiv 2607.12428): LLM-as-judge + manual coding over 16,112 high-risk file changes in 4…
- Open Questions Backlog
_456 actionable open questions across 205 pages · 107 predictions · 9 notes · 147 in progress · 69 watching (entities),…
- Telemetry vs. Survey Measurement
Perception lags reality: survey-based research (DORA) misses damage system telemetry catches — plus the family effect (…
