貓 · 兩者皆正確
DenseCNN 將證據分布在貓的身體與頭部;CNN Best 則有數個較分散的熱點。兩者都答對,表示熱圖平滑不等於分類一定更準。
可重現的 Apple Silicon 實驗
我們在 CIFAR-10 上訓練傳統 CNN、循環 CNN、MobileNet、Vision Transformer、DynamicCNN、DenseCNN 與 ResNet-50。目標不只是找出冠軍,而是理解模型容量、正規化、特徵重用、訓練長度與參數效率的影響。
「ResNet-50 在最佳 epoch 185/200 達到 92.94% 測試準確率;DenseCNN 以僅 300,634 個參數達到 92.53%,CNN-C + BatchNorm 則是最佳標準 CNN(88.48%)。」
Leaderboard
每一列都是已完成的實驗。點擊欄位標題可排序;只訓練 30 epochs 的模型會標示 30 epochs,避免與完整訓練混淆。
| 排名 | 模型 | Family | Size | Norm | 參數量 | 最佳/目標 epoch * | 最佳驗證 % | 測試準確率 % | 狀態 |
|---|
* 最佳/目標 epoch:192/200 表示在 200 epochs 訓練中,第 192 epoch 的 validation accuracy 最高;測試準確率由該 checkpoint 評估,不一定是最後一個 epoch。
Dynamic CNN · dynamic size · BatchNorm
Validation 與 test 結果矛盾:70.46% validation 對上 10.00% test。在調查完成前,不納入科學結論。
Visual evidence
測試準確率、整體參數效率,以及直接由同步結果產生的完整 training-loss 軌跡。
每個模型都由最佳 validation checkpoint 評估 test accuracy。
ResNet-50 的最佳/目標 epoch 是 185/200;DenseCNN 是 192/200。R-CNN-B + BN 與 MobileNet-B 仍是 30 epochs。
x 軸使用 log-scale 參數量,顏色代表架構 family、形狀代表 normalization,直接標籤與 leader lines 避免相近模型重疊。
淡線保留 raw loss;粗線是 time-weighted EMA trend(decay = 0.99)。不同線長清楚呈現 30 與 200 epochs 的訓練預算。
獨立重現
第二組實驗使用 CUDA 最佳化 pipeline(GPU 常駐 tensor shards、GPU-side augmentation、batch size 1024)。因為 accelerator 與 input pipeline 不同,這裡與 MPS leaderboard 分開呈現。
| 模型 | 最佳/目標 | 最佳 validation | 測試準確率 | 參數量 |
|---|---|---|---|---|
| ResNet-50 | 191/200 | 92.60% | 91.80% | 23,520,842 |
| DenseCNN | 191/200 | 92.10% | 91.50% | 300,634 |
| CNN-C + BN | 200/200 | 89.00% | 88.35% | 2,360,906 |
| ViT | 174/200 | 81.24% | 80.15% | 546,186 |
在 W&B 開啟全部 CUDA runs ↗ · 下載 CUDA checkpoints 與 JSON metadata ↗。完整矩陣:reports/cuda_summary.json。
Model zoo
每個 family 都在回答不同設計問題:容量、正規化、遞迴、效率、attention、特徵重用與 residual depth。
兩個卷積階段加上精簡分類器,channel 從 16/32、32/64 增加到 64/128,讓容量容易比較。
BatchNorm 正規化 batch statistics;LN 選項使用單一 group 的 GroupNorm;def 不使用 normalization。
這是 recurrent convolutional classifier,不是 region detector;它反覆使用共享卷積並加入 residual update。
Depthwise spatial convolution 加上 1×1 pointwise projection,大幅降低參數量。
32×32 影像切成 4×4 patches,每個 patch 攤平後線性投影成 128 維 token,再交給四層 Transformer。
Dense layers 將新特徵附加到所有先前特徵;transition 壓縮 channels,global average pooling 取代大型 classifier。
CIFAR 調整版 ResNet-50 使用 3×3 stride-1 stem,移除 ImageNet max pool。
Interpretability
我們將最強的緊湊特徵重用模型 DenseCNN(92.53%)與 CNN Best——最佳原始 baseline CNN-C + BatchNorm(88.48%)——放在完全相同的四張 CIFAR-10 測試圖片上比較,控制輸入後觀察空間證據差異。
DenseCNN 將證據分布在貓的身體與頭部;CNN Best 則有數個較分散的熱點。兩者都答對,表示熱圖平滑不等於分類一定更準。
DenseCNN 強調較完整的船體;CNN Best 對分離的結構細節與右下船身有反應。不同空間策略仍得到相同答案。
兩者都以極高信心預測 airplane。DenseCNN 沿著細長物體與地平線,CNN Best 聚焦較小邊緣;共同錯誤顯示低解析度形狀歧義。
DenseCNN 集中在明亮軀幹與頭部,以 98.4% 誤判 cat;CNN Best 將證據分布到身體與四肢,以 59.2% 正確判為 dog。最佳 aggregate accuracy 不代表每張圖都贏。
綜合分析
跨越整份研究仍成立的七個觀察。
可重現性
所有實驗都在同一台機器上執行,軟體環境如下。