案例:karpathy-repos

nanoGPT / minGPT / micrograd + 5 篇論文 + 4 張圖——71.5× 基準語料
來源:上游 worked/karpathy-repos · 圖資料沿用上游 · 我們重新分群

案例簡介

這是產出 71.5× token 節省 基準的語料:三個 Karpathy 的知名 repo(nanoGPT、minGPT、micrograd)+ 5 篇論文 PDF + 4 張圖。它展示了跨 repo 的符號連結與論文橋接。

本案例我們採用上游已提交的圖資料worked/karpathy-repos/graph.json,包含論文與圖片節點的完整圖),用 graphify 0.9.36 重新分群並產生互動圖。

我們怎麼跑的

# 重現完整版(需 LLM key 處理論文/圖片)
git clone https://github.com/karpathy/nanoGPT
git clone https://github.com/karpathy/minGPT
git clone https://github.com/karpathy/micrograd
# + 下載 5 篇論文 PDF + 4 張圖,全部放進 raw/
graphify extract ./raw

# 本站做法:從上游 graph.json 重新分群(無需 LLM)
python scripts/gen-case-html.py graph.json graph.html GRAPH_REPORT.md

互動知識圖譜

三個 repo 的程式碼 + 論文與圖片節點組成的圖。

karpathy-repos 知識圖譜(中文界面) 開新分頁 ↗ 英文版 ↗

我們的數字

指標本站結果
節點數177
邊數246
社群數16
EXTRACTED 邊83%
INFERRED 邊17%

我們重新分群的結果(上游原始圖略大)。14 個社群顯示、2 個過薄省略。

God Nodes 解說

  1. Value — 15 條邊
  2. GPT — 9 條邊
  3. Layer — 8 條邊
  4. Neuron — 7 條邊
  5. Encoder — 7 條邊
  6. CfgNode — 7 條邊
  7. AdditionDataset — 7 條邊

完全合理:Value(micrograd 的自動微分核心)與 GPT / Layer / Neuron / Encoder(nanoGPT 的 transformer 元件)就是這批語料的真正抽象核心。

Surprising Connections 解說

跨 repo 的驚喜連線(上游報告的亮點):

這就是「論文節點連到程式碼節點」的價值:讀論文時直接看到它在程式碼裡的落點。

重現

# 程式碼部分可用 --code-only 零 key 重跑:
mkdir raw && git clone https://github.com/karpathy/nanoGPT raw/nanoGPT
git clone https://github.com/karpathy/minGPT raw/minGPT
git clone https://github.com/karpathy/micrograd raw/micrograd
graphify extract ./raw --code-only