DGX Spark ×2 · 深度研究 · Field Note 02
SS · 26.08.14 · 01 / 10
DEEP RESEARCH · MEASURED EDITION

模型天花板
從預測到實測

60 天、兩台 GB10、一條公網生產線——把 25.06.21 那一版的每個預測,換成計分卡上的實測數字。
SS · 出處:DGX-Spark WORK-LOG + benchmarks/results
→ swipe / arrow keys
Hardware Baseline · 起點
SS · 26.08.14 · 02 / 10
BASELINE · GB10 GRACE-BLACKWELL ×2

硬體沒變,認知變了

v1 的核心判斷——decode 是 memory-bound、273 GB/s 決定一切、算力不是主角——60 天實測後依然成立。變的是:每一格數字現在都有自家 harness 的出處。
Bandwidth
273GB/s
LPDDR5x 統一記憶體頻寬——單流 decode 的物理天花板
Memory
128GB ×2
CPU/GPU 統一定址;服務中實際可用約 121 GB
Compute
1PFLOPS FP4
標稱算力——推論場景從未成為瓶頸
Interconnect
101Gb/s
CX-7 RoCE 實測(USB-C PD 韌體修復前只有 13)
Prediction vs Measurement
SS · 26.08.14 · 03 / 10
SAME THESIS · TWO EDITIONS

v1 的預測 vs v2 的實測

0125.06.21 · PREDICTED
MoE 是唯一出路
依社群二手數據推斷:dense 70B 在 273 GB/s 下只有個位數 tok/s,MoE 少量 active 參數才可能破 50。
  • 引用 LMSYS / r/LocalLLaMA / llama.cpp 討論串
  • gpt-oss-120b「58–70 tok/s」——社群宣稱值
  • 雙機 Tensor Parallel:紙上架構,未驗證
0226.08.14 · MEASURED
定律成立,數字收斂
自家 harness 同口徑複測:方向全對,數字更誠實——預測值普遍偏樂觀 15–20%。
  • gpt-oss-120b 實測 50.8 tok/s(非 58–70)
  • 雙機 TP=2 跑通:單流 code 71.3 tok/s
  • dense 對照維持個位數——不必再花時間驗證
Evolution · 公網主力
SS · 26.08.14 · 04 / 10
PRODUCTION TIMELINE · 26.06 → 26.08

公網主力 60 天演進

06.16 50.8tok/s

gpt-oss-120b 上線(llama.cpp 單機):MXFP4 MoE 首次破 50;隔日 Nemotron-3 以 256K 長 context 接任公網主力(~20 tok/s)。

06.30 51tok/s

五模型擂台收官:Qwen3.6-FP8+MTP 勝出(GPQA 0.88、tool-call 5/5、256K),定為單機 agent/coding 主力。

07.01 68.2tok/s

DeepSeek-V4-Flash DSpark 雙機上線(fp8 KV + b12x):conc8 聚合 290,取代 gpt-oss 2×LB 成為公網主力。

07.20 71.3tok/s

SPEC=5 常駐:單流 code 叢集新高(+14%),每 draft 淨接受 3.10 tok——投機解碼甜蜜點就此鎖定。

08.01 0731weights

官方 0731 權重無痛升級:品質平手、acceptance 反而更高;08-10 engine 跟進 production-3.75。

Benchmark · 單流 decode
SS · 26.08.14 · 05 / 10
SINGLE-STREAM CODE DECODE · 同口徑實測

誰站上了 273 GB/s 的天花板

DeepSeek-V4-Flash ×2 · SPEC=5
71.3tok/s
DeepSeek-V4-Flash ×2 · SPEC=3
62.7tok/s
Qwen3.6-FP8+MTP · 單機
51tok/s
gpt-oss-120b · 單機
50.8tok/s
Nemotron-3-Super · 單機
20tok/s
Llama-3.1-70B · dense 對照
~2.5tok/s
Architecture · 現役生產棧
SS · 26.08.14 · 06 / 10
PRODUCTION STACK · 26.08 現役

一條公網生產線,三層

LAYER 01
Hardware
2× GB10(spark201 / 202)· CX-7 200G 直連實測 101 Gb/s · 統一記憶體 121 GB ×2 · 下載一律走 202 單一 WAN 出口。
RoCE v2 · 雙 rail P2P
LAYER 02
Engine
vLLM DSpark 跨機 TP=2 · SPEC=5 投機解碼 · fp8 KV · b12x MoE kernel · 512K context(needle 545K 3/3 實測)。
production-3.75 · 0731 weights
LAYER 03
Service
litellm(zh-TW 繁化 · polguard · 虛擬金鑰)→ cloudflared http2 → 公網。Unlimited-OCR sidecar 經 CX-7 隨行。
llm.roccozora.cc
Throughput · 併發聚合
SS · 26.08.14 · 07 / 10
AGGREGATE THROUGHPUT · tok/s

雙機這張牌,赢在併發

Vendor Claim
145tok/s
部署指南宣稱 · conc8
Qwen3.6 單機
186tok/s
conc5 · FP8+MTP
DSpark 3.7 現役
248tok/s
conc8 · SPEC=5 · 26.07.20
DSpark 3.2 峰值
290tok/s
conc8 · SPEC=5 · 26.07.01
Methodology · 數據紀律
SS · 26.08.14 · 08 / 10
WHY TRUST THESE NUMBERS

為什麼這些數字可信

01
唯一 nonce,防 TTFT 造假

prefix caching 會讓重複 prompt 的首 token 延遲假快一個數量級。每個請求插入唯一 nonce,量到的才是真 TTFT。

02
二元指標用 McNemar 成對檢定

91 vs 99 的獨立信賴區間看似重疊;成對比較 0:8 → p = 0.0078,顯著。不成對,就下不了結論。

03
runspec 指紋 + 讀到串尾

每輪記錄「實際生效」的 engine/SPEC/env 組態;上游 bug 報告一律讀到串尾——四串裡有三次,是回報者自己測錯。

Ceiling · 天花板盤點
SS · 26.08.14 · 09 / 10
CEILING AUDIT · 26.07–08

已到公開紀錄前緣

71.3 / 248–290 已是這套硬體公開紀錄的前緣。剩餘 10–25% 的空間全在投機解碼參數;韌體、功率、pipeline-parallel 路線已盤點關閉。
Context
545K · 3/3
needle 全中;512K 常駐。1M 開得起,但 900K prefill ~13 分鐘——實用性否決
TTFT
0.24s
單流首 token 延遲(nonce 口徑)
Acceptance
3.10tok/draft
SPEC=5 每 draft 淨接受,+26% 有效步長;裸接受率跨組態不可比
Incidents
×3b12x
推理期 kernel resolution 崩潰(07.21 / 07.22 / 08.10)——現役最大營運風險
10 / 10
CLOSING
MANIFESTO

Measure it.
Then believe it.

預測會過期,計分卡不會——這一版的每個數字,都能在 WORK-LOG 與 benchmarks/ 裡找到出處。
SS · DGX Spark ×2 · Field Note 02
26.08.14
TAKEAWAYS
03 RULES
01

頻寬定律成立

273 GB/s 決定 decode,MoE active 參數是唯一槓桿——v1 的預測、v2 的實測,同一個結論。

02

兩張牌分開打

單機日常 agent 用 Qwen3.6-FP8+MTP(51 tok/s);雙機 DSpark 打併發、512K 與 V4 品質牌(71.3 / 248)。

03

沒有 nonce 的數字不要信

可比對數據 = 唯一 nonce + McNemar 成對檢定 + runspec 指紋。方法論比任何單一 tok/s 都值錢。

→ 完 · END OF FIELD NOTE