gpt-oss-120b 上線(llama.cpp 單機):MXFP4 MoE 首次破 50;隔日 Nemotron-3 以 256K 長 context 接任公網主力(~20 tok/s)。
五模型擂台收官:Qwen3.6-FP8+MTP 勝出(GPQA 0.88、tool-call 5/5、256K),定為單機 agent/coding 主力。
DeepSeek-V4-Flash DSpark 雙機上線(fp8 KV + b12x):conc8 聚合 290,取代 gpt-oss 2×LB 成為公網主力。
SPEC=5 常駐:單流 code 叢集新高(+14%),每 draft 淨接受 3.10 tok——投機解碼甜蜜點就此鎖定。
官方 0731 權重無痛升級:品質平手、acceptance 反而更高;08-10 engine 跟進 production-3.75。
prefix caching 會讓重複 prompt 的首 token 延遲假快一個數量級。每個請求插入唯一 nonce,量到的才是真 TTFT。
91 vs 99 的獨立信賴區間看似重疊;成對比較 0:8 → p = 0.0078,顯著。不成對,就下不了結論。
每輪記錄「實際生效」的 engine/SPEC/env 組態;上游 bug 報告一律讀到串尾——四串裡有三次,是回報者自己測錯。
273 GB/s 決定 decode,MoE active 參數是唯一槓桿——v1 的預測、v2 的實測,同一個結論。
單機日常 agent 用 Qwen3.6-FP8+MTP(51 tok/s);雙機 DSpark 打併發、512K 與 V4 品質牌(71.3 / 248)。
可比對數據 = 唯一 nonce + McNemar 成對檢定 + runspec 指紋。方法論比任何單一 tok/s 都值錢。