H
Howardism
Plate IIEvals & Benchmarks機器翻譯 · machine-translated過時翻譯 · stale translationENHOWARDISM

基準分數冗餘性

PublishedJuly 16, 2026FiledConceptDomainEvals & BenchmarksTagsLLM ArchitectureCapability EvaluationBenchmarksEvaluation MethodologyMatrix CompletionLow RankReading13 minSourceAI-synthesised

Zeng & Papailiopoulos(Microsoft Research、arXiv 2606.24020):一個包含 84 個模型 × 133 個基準的公開分數矩陣(2,604 個儲存格、填充率 23.3%)實際上是 rank-2——模型在全部 133 個基準上的分數,大致由兩個數字決定(兩項診斷一致:Soft-Impute 補全在 rank 2 時達到最低點,而前兩個 SVD 元件在每個完整觀測子矩陣中都解釋 >90% 的跨模型變異),呼應異質前沿時代矩陣上先前關於 g-factor/「一般能力 + 提供者殘差」的發現。BenchPress(對數幾率空間、偏差分解的 ALS 矩陣補全)在 100% 覆蓋率下,將每個留出儲存格預測至 4.6 MedAE 分數點;一組精簡的 5 基準探測集 {GPQA-D, HLE, Codeforces, MMLU-Pro, ARC-AGI-1} 能以 3.93 分還原模型的完整成績單(低成本集合為 4.55),預測保留 ≥5 分模型成對排名的 92.1%,而嚴格時間截點下的新模型只需 5 個種子分數即可達到 4.83 分——因此,你可以從少數探測中推斷大部分成績單,而不必執行每個 eval;同時以混合式 ensemble-spread + matrix-support 可靠性層標記哪些預測值得信任。但分數是可推斷的,不代表基準不必要;rank-2 幾何結構只適用於此快照,而矩陣正是 compute-control 批評所警告的那個未受控制公開網格

Benchmark Score Redundancy 的插圖

資料來源#

摘要#

現代模型的發布通常會報告 40 多列基準,而在幕後為了追蹤訓練、比較設計選擇與挑選檢查點,同一套測試還會被反覆執行更多次——每次完整執行都要花費數千美元與數天的實際時間。Zeng & Papailiopoulos("You Don't Need to Run Every Eval"、Microsoft Research AI Frontiers、arXiv 2606.24020、empirical)問道:你真的必須這麼做嗎?他們彙整出一個公開分數矩陣,包含 84 個前沿模型 × 133 個基準(2,604 個已觀測儲存格、填充率 23.3%),並發現它實際上是 rank-2——模型在全部 133 個基準上的分數,大致只由兩個數字決定。在此基礎上,BenchPress 能預測任何缺失儲存格,而少數探測基準就能免費還原模型大部分的成績單。實務上的主張是:執行一小組探測並推斷其餘結果,而不是獨立執行每個評估。

這是另一個軸向上的 eval 成本故事,與 Large-Scale Test-Time Compute 集群不同:該集群沿著計算預算軸壓縮成本(指定預算,不必執行到平台期);本文則沿著基準數量軸壓縮成本(執行少數基準,預測其餘結果)。兩者互補,而且正如論文本身所指出,第二種方法承襲了第一種方法警告的異質性,因為 BenchPress 是建立在同一個未受控制公開網格之上。

矩陣實際上是 rank-2#

這個分數矩陣在設計上就是異質且稀疏的。研究人員爬取發布部落格、系統卡、技術報告、HuggingFace 卡片,以及六個主要排行榜(MathArena、ARC-Prize、Terminal-Bench、LMArena、Epoch AI、LiveBench),得到 2026 年 5 月的原始資料池:188 個模型 × 316 個基準,填充率僅 7.6%;將近似重複的模型變體與基準設定正規化,再篩選每個模型至少有 ≥15 筆觀測、每個基準至少有 ≥8 筆觀測後,得到分析矩陣(84 × 133、填充率 23.3%)。大約五分之四的分數來自模型提供者自己的材料

兩項獨立診斷都指向 rank 2:

  • 留出補全在 rank 2 時達到最低點。 掃描 Soft-Impute 矩陣補全的 rank,留出 Median Absolute Percentage Error 在 rank 2 時最小,較高 rank 反而上升——在原始分數與對數幾率轉換空間中都是同一條曲線。這是採用 rank 2 的實務理由:它是最能預測未見分數的 rank,而不只是最能壓縮已見分數的 rank。
  • 完整觀測子矩陣呈現相符的幾何結構。 對每個基準欄進行平均中心化(等同於 PCA),再對最大的完整子矩陣執行 SVD,前兩個元件在每種測試形狀下都解釋 >90% 的跨模型變異(4 bench × 42 models:97.6%;7×11:91.2%;10×7:95.0%;13×6:95.9%),穩定 rank 約為 1.1–1.3——一個方向占主導,第二個方向則清理掉其餘大部分變異。

發現 1。 84 × 133 的模型—基準分數矩陣,表現得像是一個實際上的 rank-2 預測問題。

這項工作在異質的前沿時代矩陣上,深化了論文所依據的一系列既有低秩發現:Burnell 等人(2023)——三個潛在因子(推理、理解、核心語言建模)解釋了 27 個 HELM 任務的大部分變異;Ilić & Gignac(2024)——心理計量學的 g-factor 解釋了 12 個基準/591 個 Open-LLM-Leaderboard 模型中 85% 的變異;以及 Burnham/Epoch(2025)——將 Epoch Capabilities Index 分解為**「一般能力 + 提供者特定殘差」**(非正式稱為「claudiness」)的獨立 PCA,與本文相符的 rank-2 結構。冗餘性並非新現象;真正新的是建立在其上的預測系統,並且附有明確的失敗分析。

BenchPress:預測器#

作者評估 7 種特徵轉換 × 12 種預測方法的所有組合(identity/log/logit/arcsinh/probit/sqrt/quantile 轉換,對應 benchmark-mean、model-mean、KNN、逐基準與逐模型回歸、Soft-Impute、NMF、PMF、nuclear-norm、ALS 與 MLP),搜尋超參數;在每個模型留出 50% 的設定下(3 folds × 10 seeds,每組約 2 萬個測試預測)進行評估。逐基準與逐模型回歸在原始誤差上略勝一籌,但會留下部分未預測儲存格(<100% 覆蓋率)。在完整覆蓋方法中,勝出者是 logit-space、bias-decomposed alternating least squares(Koren 等人,2009),rank 2、λ=0.1——在留出儲存格上達到 4.6 median absolute error(分數點),且覆蓋率為 100%

發現 2。 經過 logit 轉換、偏差分解的 rank-2 ALS 矩陣補全,在預測每個缺失的模型—基準分數時,能提供接近最佳的分數預測準確度。

流程如下:(1) 對百分比分數進行 logit 轉換(像 Codeforces rating/Arena Elo 這類非百分比分數則保留原生形式);(2) 對每個基準欄進行標準化;(3) 擬合 bias ALS = 全域層級 + 模型偏移 + 基準偏移 + rank-2 殘差互動(偏差吸收列/欄層級,因此低秩項只需建模殘差的模型×基準結構);(4) 反轉換。一次擬合即可決定性地預測整個矩陣。

與 LLM 預測器相比。 當可看見真實模型與基準名稱時,以五個最接近同儕範例提示 GPT-5.5 預測目標儲存格,表現勝過 BenchPress(3.50 對 4.63 MedAE)——但這項優勢來自排行榜記憶,而不是結構:將名稱盲化後,LLM(4.70)不再優於 BenchPress(4.63),且可擴展性低得多,因為它每個儲存格都要付費,而 BenchPress 只需擬合一次(發現 3)。

它能實現什麼#

  • 有預算限制的成績單還原(發現 4)。 以貪婪法選取探測基準,五個探測即可將模型完整的 133 基準成績單還原至整體 3.93 MedAE 分數點{GPQA-Diamond, HLE, Codeforces, MMLU-Pro, ARC-AGI-1}。若限制為低推論成本的允許清單,表現幾乎不受影響——{GPQA-Diamond, MMLU-Pro, Aider Polyglot, MATH-500, AIME 2026} 可達到 4.55——因為訊號最強的探測本來就很便宜。所有選出的集合都高度偏向推理/數學基準:推理是變異的主導軸,因此這些探測能三角定位其餘結果。兩個直接的教訓是:你執行哪些基準遠比執行多少基準重要(貪婪集合在每個預算下都超越隨機基線),而且貪婪選擇與近乎窮舉搜尋的結果一致。
  • 排名得以保留(發現 5)。 在真實差距 ≥5 分時,完成的分數保留 92.1% 的同基準模型成對排序(差距 ≥2 分時為 88.0%;包含近似平手時為 83.8%),涵蓋數十萬個可比較配對——預測誤差很少會翻轉有意義的排名決策。
  • 全新模型(發現 6)。 在嚴格時間截點下——BenchPress 以目標模型之前發布的模型訓練,因此對新發布完全沒有先驗資訊——揭露新模型的 5 個種子分數後,預測便能在 4.83 分以內;10 個種子可縮小至 2.57(單一種子為 9.20,涵蓋 27 個目標)。對新模型進行一小組種子評估,比加入更多歷史模型更有價值。

何時該信任預測#

84 個模型之間的單模型誤差差異約達 40 倍,因此需要信任層。假設檢定(Spearman/配對 Wilcoxon,p<0.01 時拒絕)找出了影響預測品質的因素:

  • 基準側: 模型間分數散布越廣,越難以預測;已觀測模型分數越多,以及至少存在一個高度相關的鄰近基準,越容易預測。同類別中繼資料沒有幫助——預測器利用的是已觀測的相關性,而不是基準標籤。
  • 模型側: 推理模型比非推理模型更容易預測;高分模型比低分模型更容易;高度相關的同儕模型、更多已觀測分數,以及較近期的訓練錨點都有幫助。提供者身分沒有影響——BenchPress 使用能力輪廓相似度,而不是「所有 GPT 列」,來預測 GPT 模型(發現 7)。

混合式可靠性估計器結合兩項訊號——ensemble spread(合理的替代預測器對該儲存格有多大分歧)與 matrix support(上述覆蓋率/鄰近/同儕特徵)——形成每個儲存格的風險分數。只保留最值得信任的 20% 預測,可將選擇性 MedAE 降至 1.83 分(40% 時為 2.51;60% 時為 3.10),勝過任一單獨訊號(發現 8)。信心層讓「跳過這項 eval」成為可辯護的決策,而不是猜測。

範圍:可推斷,不代表不必要#

本文特別謹慎地界定自己的主張,而這些界線正是 wiki 中承載細節的部分:

  • 分數可推斷 ≠ 基準冗餘。 這項結果指出的是目前可以從其他分數推斷出的基準分數,不是哪些基準的存在已無必要。BenchPress 無法取代基準仍能完成的工作:失敗模式發現、污染與分布偏移監測,以及對模型開發者塑造激勵。一個完全可預測的基準,仍可能是抓出下一個回歸問題的那一個。
  • 快照依賴性。 Rank-2 是這個 84 × 133、2026 年 5 月快照的特性。未來發布的模型若具有矩陣中前所未見的能力輪廓,可能會破壞這個幾何結構——作者指出,追蹤「是否出現第三個潛在因子?」就是刷新流程的訊號。
  • 公開分數的異質性。 矩陣混合了供應商報告與第三方分數,使用不同的 harness、提示、推理預算與日期;同一模型在不同執行間可能變動 1–3 分,在不同 harness 間可能變動 5 分以上。供應商分數(占矩陣五分之四)可能有樂觀偏差,這可能膨脹整個方法所依賴的跨基準相關性表象。因此,BenchPress 預測的是這個公開矩陣會外推出的結果,而不是受控重新評估會得到的結果;其誤差是混合了預測誤差與測量雜訊的上界
  • 探測集特異性。 這些 5 基準集合是在目前矩陣上選出的,矩陣擴大後必須重新推導;它是快照式建議,不是永久性的 eval 套件。

資料集(HuggingFace)、BenchPress 程式碼(github.com/microsoft/benchpress),以及互動式逐儲存格預測器,都已作為持續更新、可由社群擴充的成果發布。

相關連結#

  • Compute-Controlled Benchmarking——另一個軸向上的姊妹 eval 成本降低方法:該頁面透過指定每個基準的計算預算來壓縮成本;本頁則透過跨基準預測來壓縮成本,因此只需執行少數基準。論文本身提出的張力是:BenchPress 正是在 Brown/AISI 批評的未受控制公開網格上運作——設定異質、供應商偏樂觀的分數——因此它的預測承襲了該網格的雜訊;將「控制每次 eval 的計算量」與「跨 eval 預測」結合起來,仍未獲處理
  • Large-Scale Test-Time Compute——其開放問題「能否從低成本執行預測高預算表現?」的姊妹答案:跨基準預測可行,這強力證明 eval 景觀是低維的,但沒有顯示跨計算預算的預測可行——那條軸仍然開放
  • Scale-Dependent Prompt Sensitivity——這項矩陣層級結果的題目層級對應:該論文發現約 27% 的基準題目沒有鑑別力(天花板/地板效應);本文則發現整個 133 基準矩陣是 rank-2。兩者都量化了彙總基準所承載的獨立訊號,比其數量所暗示的少多少
  • Task Time-Horizon Scaling——基準飽和是從本頁角度看見的冗餘:飽和基準在模型間的分數散布接近零,而低散布正是此處讓基準變得極易預測的原因(H3)——因此飽和既削弱 horizon 指標的效用,也讓分數變得可推斷
  • UK AI Security Institute——追求此想法計算軸版本的政府評估者(從低成本執行預測高預算表現);BenchPress 則是基準軸對應方案——兩者都押注昂貴的評估可以被投射,而不必完整支付成本
  • Measuring Beyond Accuracy Saturation——對飽和的互補答案。飽和 = 分數散布接近零,而這正是此處讓基準極易預測的原因(H3)——因此本頁的作法是跳過並預測(低散布基準的分數可推斷,不要執行它)。Nadgir 等人的作法相反:保留並重新儀器化(從保留的單一飽和基準中提取效率、可靠性,以及模型與腳手架之間的訊號)。操作方向相反,但前提相同:標題式準確度數字沒有充分利用基準
  • Benchmark Contamination and Decontamination——對應本頁自身範圍限定的修正側方案。「分數可推斷,但基準不必要」不成立的一個關鍵原因,是基準仍能完成 BenchPress 無法完成的工作——其中包括污染監測;Sun 等人研究了一個分數已因洩漏而膨脹的基準,無需參考模型便還原乾淨的逐樣本分布。他們的修正依賴污染所扭曲的同一個真實答案機率訊號,因此是在未受控制公開網格所具現的完整性問題內部運作
  • How Much Signal Do Public Benchmarks Still Carry — and What Replaces Them?——本頁所錨定的集群綜合:rank-2 冗餘是三種粒度的訊號縮減結果中矩陣層級的一員,而本頁「可推斷 ≠ 不必要」的限定,提供了基準單獨仍能完成之工作的關鍵支柱

開放問題#

  • Rank 是否維持 2? 幾何結構只適用於此快照;隨著矩陣擴大,第三個潛在因子是否出現(新能力輪廓、新基準家族),是論文親自命名的流程更新訊號,也是有待持續觀察的實證問題。
  • 能否在完全沒有分數的情況下錨定離群模型? 對能力輪廓在矩陣中沒有近鄰的模型,BenchPress 會失效;作者提議納入外部中繼資料(訓練資料組成、架構、規模),在執行任何基準前計算模型對模型的相似度,但尚未建置。
  • 低秩處理能否超越文字/視覺? 音訊/語音、機器人/具身代理,以及科學模擬器生態系尚未測試;相同的 rank-2 結構是否也成立,仍是開放問題。
  • 供應商樂觀會不會製造這種相關性? 五分之四的分數由提供者回報且可能被膨脹;論文指出這可能膨脹表面上的跨基準相關性,但無法將其分離——完全標準化的重新評估仍會是 rank-2 嗎?還是部分冗餘性其實是共同回報偏差的產物?
  • 公開探測集會不會成為 Goodhart 目標? 如果「執行這 5 個基準並推斷其餘結果」成為慣例,這個精簡探測集就是一個小型、公開且高槓桿的最佳化目標——也就是 Compute-Controlled Benchmarking 所指出的相同 eval 報告 Goodhart 壓力,如今集中在五個基準上。本文未予探討。

資料來源#

  • You Don't Need to Run Every Eval——Yuchen Zeng & Dimitris Papailiopoulos,You Don't Need to Run Every Eval(Microsoft Research AI Frontiers、arXiv 2606.24020、2026-06-22、empirical):84×133 的 rank-2 分數矩陣(兩項診斷——Soft-Impute rank 掃描 + 子矩陣 SVD 的前兩個元件解釋 >90% 變異)、Logit Bias ALS BenchPress 預測器(100% 覆蓋率下 4.6 MedAE)、5 探測成績單還原(3.93/低成本 4.55)、≥5 分差距下 92.1% 的排名保留、全新模型預測(時間截點下 5 個種子達到 4.83)、LLM 預測器比較、可靠性/信任層,以及四項範圍限定(可推斷性≠冗餘性、快照依賴性、公開分數異質性、探測集特異性)
§ end
About this piece

Articles in this journal are synthesised by AI agents from a curated wiki and are refreshed automatically as new concepts arrive. Topics, framing, and editorial direction are curated by Howardism.

Cited by 11
Related articles