reddit dgx spark
# NVIDIA DGX Spark (GB10 / ASUS GX10) Reddit 每日追蹤與技術精華彙整 (2026)
---
## 2026-08-27:sparkrun v2.5 發佈與雙機 ConnectX-7 200Gbps 併發實測
### 1. 工具鏈升級:`sparkrun` v2.5 正式釋出
- **自適應記憶體去碎片(Auto-Defrag):** 針對 Blackwell LPDDR5X 記憶體分配器重構。掛載 DeepSeek-V4-Flash(antirez Q2/Q4 混合版)或 Qwen 3.8 27B 進行長時間無人值守 Agent 任務時,能有效防止因頻繁 Tool Calls 導致的首字響應時間(TTFT)暴增。
- **一鍵預載 Best-Fit Recipes:** 整合 `spark-arena.com` 最新驗證參數,自動配置 NVFP4 / FP8 稀疏矩陣引數。
### 2. 雙機拓撲實測:2x Spark ConnectX-7 直連
- **TP=2 張量並行:** 透過標配 ConnectX-7 200Gbps 網卡直連(256GB Unified Memory),TP=2 模式下運行 Qwen 122B (AutoRound int4) 或 DeepSeek-V4-Flash,跨節點通訊延遲極低。
- **多併發吞吐:** 同時開啟 8 個 Agent Session 時,雙機總吞吐量(Aggregate TPS)穩定衝上 **1,250 tokens/sec**。
### 3. 生態採購提醒:ASUS GX10 特價庫存收網
- 受全球 LPDDR5X 合約價上漲影響,特價約 **$2,999~$3,500 美元** 的 ASUS Ascent GX10 (1TB 版) 現貨被迅速收網,後續補貨版本預計站上 $4,000 大關。
---
## 2026-08-28:Perplexity AI 本地合作宣告與 Qwen 180B MoE 單機免 Offload
### 1. 重磅商業新聞:Perplexity AI 原生登陸 DGX Spark
- NVIDIA 宣佈將 Perplexity 搜尋與推理引擎原生移植至 DGX Spark 生態,定位為「企業與個人的 24/7 本地知識庫 Agent 伺服器」,利用 128GB Unified VRAM 進行全量本地快取與語意檢索。
### 2. 單機模型突破:Qwen 3.8 Flash 180B MoE 零 Offload
- `styles01/sparkrun-recipes` 釋出 Runbook:透過 Q3_X_L / Q4_XS 混合量化,成功將 Qwen 3.8 Flash 180B MoE 完整載入單機 128GB VRAM,**無需將 n-gram 卸載至 CPU 主記憶體**,支援 200k 超長 Context。
### 3. 底層架構研討:`sm_121` 核心的指令集界限
- GB10 架構為 `sm_121`,物理上**不具備資料中心級 Blackwell (`sm_100`) 的 Tensor Memory (TMEM) 與 `tcgen05` 指令**。為 H100/GB200 編譯的 CUDA 內核無法直接執行,需認準專屬適配 `sm_121` 的 vLLM/SGLang 編譯包。
---
## 2026-08-29:Qwen 180B 200k Context 複測與 Amazon 水貨拒保警告
### 1. Perplexity AI 本地部署細節
- 引擎能直接調用 128GB Unified Memory 進行全量文檔快取(Full Document Caching),發揮 100W 低功耗與私有資料零洩漏的優勢。
### 2. Qwen 3.8 Flash 180B MoE 200k Context 穩定度驗證
- 經多方壓測,單機 128GB 載入 Q3_X_L 權重後免 CPU 卸載,在 200k Context 下配合 Hermes Agent 執行代碼重構與自動測試極度平滑。
### 3. 採購維護警訊:Amazon/eBay 內銷水貨遭 MSI 拒保
- 買家購買約 $3,000 美元的 MSI EdgeXpert AI(Spark 平台),故障後因序號為海外內銷版遭原廠判定無保固。建議認準授權通路以確保 RMA 權益。
---
## 2026-08-30:1M Context KV Cache 記憶體流失修復與 Qwen 27B NVFP4 Agent
### 1. 長文本救援:1M Context KV Cache 記憶體流失修復
- 長時間運行 100k+ tokens 任務時,背景容易積累記憶體碎片引發 SegFault。
- **避坑參數:** 寫入 `max_split_size_mb=512`,並顯式掛載 `--enable-prefix-caching` 與 **NVFP4 自適應 FP8 KV Cache**,使重複 Prompt 首字預吞吐(Prefill)控制在 **<0.1 秒**。
### 2. Agent 工作流調優:Qwen 3.8 27B NVFP4 + MTP
- 單機 GB10 解碼速度受限於 273 GB/s 頻寬,但載入 Qwen 3.8 27B NVFP4 開啟 MTP 後,生成速度可達 **60~95 tokens/sec**,僅佔用 16~20GB VRAM,留下 100GB+ 空間供多 Agent 併發常駐。
### 3. 硬體維護與選購:ConnectX-7 線材規格提醒
- 2x Spark 雙機直連(256GB VRAM)切勿選用無認證的被動線,請認準 Mellanox/NVIDIA 原廠認證線材(MCP1600 系列),避免 200Gbps 高速傳輸因過熱斷連。
---
## 2026-08-31:一年 Spark 使用實錄、ROI 結算與 sparkrun-recipes v2.6
### 1. 一年實測與 ROI 結算
- 社群總結:透過 2x Spark (256GB VRAM) 雙機直連常駐 DeepSeek-V4-Flash 與 Qwen 122B,團隊已停用雲端 API 訂閱,省下的費用已完全覆蓋硬體成本。
- 核心價值在於 **24/7 低功耗 (~100W) 靜音常駐**、**2,000+ t/s Prefill** 與 **大容量 KV Cache 空間**。
### 2. `sparkrun-recipes` v2.6 升級
- 修復 PagedAttention Block 頁面回收機制,解決 180B MoE 在 200k Context 長 Session 下的微量記憶體流失,TTFT 穩定在 **<0.1 秒**。
### 3. 市場現貨告急
- 全球 LPDDR5X 合約價調漲,特價 $2,999~$3,500 美元現貨庫存見底,市場均價攀升至 $4,200 美元以上。
---
## 2026-09-01:CUDA 13.2 正式版鏡像、16 併發雙機壓測與 spark-monitor
### 1. CUDA 13.2 正式版 Docker 降臨
- 徹底解決先前 nightly 鏡像偶發將 `sm_121` 降級調用 Ampere (`sm_80`) 路徑的 Bug,全面寫入 Blackwell 原生 JIT 優化,Prefill 穩定在 **2,400+ tokens/sec**。
### 2. 2x Spark 16 併發 Agent 壓測
- 雙機 ConnectX-7 直連(256GB VRAM)在 TP=2 模式下載入 Qwen 180B MoE 與 DeepSeek V4 Flash,觸發 16 個併發 Agent 時,總吞吐量達 **1,420 tokens/sec**,整機牆插總功耗僅約 **~220W**。
### 3. 開源工具:`spark-monitor` 儀表板
- 專為 GB10 設計,實時監控 LPDDR5X 記憶體碎片率與 Prefill/Decode 吞吐,並內建風扇轉速自動平衡腳本,維持 SoC 溫度低於 60°C。
---
## 2026-09-02:2x Spark Prefill 衝上 2,900 t/s、CUDA Graphs 避坑與 vLLM 修復
### 1. 雙機極限數據:Prefill 狂飆 2,900 tok/sec
- 2x Spark 載入 Qwen3.8-Flash-Next (NVFP4),Prefill 衝上 **2,900 tokens/sec**,單串流 Decode 達 **50 tokens/sec**。
- **Docker 陷阱:** 預設 Docker 易將 NCCL 降級為 TCP Sockets,導致 TP2 效能折半。務必掛載 `--privileged` 並用 `ibdev2netdev` 校準 RoCE 網卡。
### 2. CUDA Graphs 在 MTP + TP2 下的效能衰退
- PIECEWISE CUDA Graphs 在單機無 MTP 模式下可提升生成速度,但在 **MTP + TP2 模式下開啟會導致 Decode 速度從 50 暴跌至 36 tokens/sec (衰退 ~28%)**。此配置下應**關閉 CUDA Graphs**。
### 3. 開源庫修復:FlashInfer 0.6.18 與 vLLM PR #53896
- GB10 晶片請鎖定 **FlashInfer 0.6.18**(0.6.17 會觸發 GEMM 報錯)。vLLM 請併入 **PR #53896** 邊界保護補丁,修復 `shuffleInputRowsKernel` 越界讀取問題。
---
## 2026-09-03:USB-C DP 顯示黑屏修復、3DGS 點雲壓測與 .NET 10 API 整合
### 1. 硬體避坑:USB-C DisplayPort 轉接黑屏處方
- Spark 在開機 POST 早期對 USB-C DP 僅進行一次物理偵測。若外接 KVM/螢幕未提前上電完成 EDID 握手,該 Port 會被永久判為無訊號。
- **開機順序:** 先讓外接 KVM/顯示器完全啟動(約 50 秒),再按下 Spark 電源鍵。
### 2. 3D 視覺應用:3D Gaussian Splatting (3DGS) 大場景渲染
- 雖然頻寬不如高階顯卡,但 128GB Unified Memory 避免了消費級顯卡(32GB)在城市級點雲與 3D 輻射場重建時的 OOM 崩潰,成為超大點雲訓練的高 CP 值設備。
### 3. `sparkrun-recipes` .NET 10 WebAPI 整合
- 統一修復與第三方 API 通訊時的 UTC 時區轉換與嵌套 Step entity 外洩問題。
---
## 2026-09-04:.NET 10 Agentic 實測高分、KVM 時序確認與生態定位
### 1. .NET 10 Agentic Build Benchmark:56/61 接近滿分
- 單機常駐 **Qwen 3.8 Flash 180B MoE (架構規劃)** 與 **Qwen 27B (代碼編寫)**,執行 ASP.NET Core 10 的全自動構建與自癒測試,拿下 56/61 高分。
### 2. USB-C DisplayPort 顯示處方再確認
- 再次強調「先開 KVM 50 秒,再開機」的標準物理順序,若黑屏需重新插拔線材觸發鏈路重談判。
### 3. 生態定位定性
- Spark 核心優勢在於 **24/7 低功耗 (~103W)** 桌面全量開發,讓小型團隊能直接在桌面進行長文本審計、超大 RAG 向量索引與 Agent 併發營運。
---
## 2026-09-05:社群軟體逆襲論、KVM 軟體重置指令與 API 規範定案
### 1. 社群力量逆襲硬體限制
- 社群指出,雖然 GB10 頻寬為 273 GB/s,但憑藉 **ConnectX-7 200Gbps 網卡** 與 **100% 原生 CUDA 相容性**,配合社群開發的 PagedAttention 優化與 MTP 解碼,建構起極高的軟體護城河。
### 2. KVM 遠端無痛重置指令
- 若 USB-C DP 遠端黑屏且無法實體插拔,可 SSH 進入 KVM 執行:
`echo 0 > /sys/bus/i2c/devices/0-0058/poweron && sleep 3 && echo 1 > /sys/bus/i2c/devices/0-0058/poweron`
以主動重設 Hot-plug 偵測。
### 3. API 規範升級
- 修復 EF Core 10 與 SQLite 整合時 `policyId` 欄位外洩與時間戳未轉化為 UTC (`Z`) 的問題。
---
## 2026-09-06:Qwen 180B 解鎖 256k Context、vLLM v0.7.3-rc1 與雙機 30 天實測
### 1. Qwen 3.8 Flash 180B MoE 解鎖 256k 超長 Context
- 採用 Q3_X_L 權重搭配 NVFP4 自適應 FP8 KV Cache,免 CPU 記憶體卸載。在 256k Context 壓測下,Prefill 維持在 **1,950+ tokens/sec**,Decode 穩定於 **14~18 tokens/sec**。
### 2. vLLM v0.7.3-rc1 釋出
- 針對 `sm_121` 核心重構,修正高頻 Tool Calls 下 LPDDR5X 動態記憶體分配器頁面回收不及的崩潰問題。
### 3. 2x Spark 雙機 30 天 0 洩漏運維報告
- 2x Spark ConnectX-7 直連常駐 DeepSeek V4 Flash,12 併發 Agent 連續運作 30 天 0 記憶體洩漏,總吞吐量穩定維持在 **~1,350 tokens/sec**,功耗僅 **190W~230W**。
---
## 2026-09-07:9 月最佳模型票選、ASUS GX10 漲價與 Mac Studio 對決
### 1. 單機最佳模型票選:Qwen 3.8-Flash-Next 125B (A6B)
- 被評為 9 月單機綜合智商與速度第一梯隊神卡。配合 vLLM + MTP,單機 128GB 載入時 Prefill 達 **1,800+ tokens/sec**,Decode 達 **55~60 tokens/sec**。
### 2. ASUS Ascent GX10 價格飆升至 $5,999
- 記憶體顆粒合約價調漲與產能緊缺,原先 $2,999~$3,500 美元現貨被掃光,部分通路標價拉升至 $5,999 美元。
### 3. Mac Studio M5 vs. DGX Spark 選型劃線
- Mac Studio 適合單人純文字對話(Decode 頻寬高);**DGX Spark 則憑藉 100% CUDA 相容、24/7 低功耗 (~100W) 與 ConnectX-7 200G 橫向擴充**,在多 Agent 營運與工程開發上勝出。
---
## 2026-09-08:vLLM v0.7.3 正式版、每月 $8 電費單與 sparkrun-recipes v2.7
### 1. vLLM v0.7.3 正式版釋出
- 原生適配 `sm_121` 核心,徹底修復 PagedAttention 記憶體頁回收 Bug。單機載入 Qwen 125B 時,重複 Prompt 的 TTFT 壓至 **<0.08 秒**。
### 2. 能效實測:24/7 運作單月電費不足 $8 美元
- 單機常駐 3~4 個 Agent 實例時,待機/低載功耗僅 **35W~40W**,滿載峰值約 **115W**。單月電費僅約 **$6.5~$8.0 美元**。
### 3. `sparkrun-recipes` v2.7 釋出
- 內建 .NET 10 / Python FastAPI 自動化 YAML 格式校驗檔,並自動填入 Blackwell MTP 最優化稀疏矩陣補丁。
---
## 2026-09-09:黑馬 Ornith 1.5 35B、Agent 派系劃分與 $10,000 預算決算
### 1. 黑馬模型:Ornith 1.5 35B (a3b-fp8 MTP)
- 改善了 Qwen 系列在特定長文本下的思考循環問題。單機 Decode 達 **50~60 tokens/sec**,Prefill 高達 **5,000+ tokens/sec**,可承載 **100+ 併發 Session**。
### 2. 單機選型:Dense 邏輯精確 vs. Flash 高速診斷
- **Qwen 3.8 27B Dense:** 適合需要單次極致代碼精確度的場景。
- **Qwen 3.8 Flash Next (Q4_XS):** 適合高頻「嘗試-診斷」的 Agent 循環任務。
### 3. 2x Spark 叢集 vs. 多卡舊顯卡拼裝
- 2x Spark 憑藉 **100W 級省電靜音、原生 200Gbps RoCE 直連**,在 24/7 運作穩定度與總維護成本上全面勝過多卡舊顯卡拼裝。
---
## 2026-09-10:vLLM post1 緊急補丁、1U 機架改裝與 Qwen 125B 256k 壓測
### 1. vLLM v0.7.3.post1 緊急補丁
- 修正 2x Spark 雙機 TP=2 連線超過 48 小時後 PagedAttention 頁面喚醒失敗的問題,長 Session 運作無記憶體滲漏,TTFT 保持在 **<0.08 秒**。
### 2. ASUS GX10 1U 機架改裝方案
- 社群釋出 1U 雙機並排機架轉接架 3D 列印模型與雙風道抽風系統,將全載 SoC 溫度壓制在 **56°C~59°C**。
### 3. Qwen 3.8-Flash-Next 125B 256k Context 複測
- NVFP4 權重佔用約 62GB VRAM,留下 60GB 空間作為 KV Cache。200k+ Context 下 Decode 生成速度維持在 **58~62 tokens/sec**。
---
## 2026-09-11:SGLang 0.4.4-nightly、OEM 刷機避坑與 500k Context
### 1. SGLang 0.4.4-nightly 釋出
- 重構 `sm_121` 核心的 Cross-node 數據廣播機制。2x Spark 載入 DeepSeek V4 Flash 或 Qwen 180B MoE 時,Prefill 衝上 **3,450+ tokens/sec**,跨機等待延遲降低 **~22%**。
### 2. 系統層級避坑:OEM 機型刷回 NVIDIA 原廠 DGX OS
- ASUS GX10、Dell、Lenovo 等預裝 OS 易出現 `sm_121` 核心回退降級 Bug。建議直接刷寫 NVIDIA 官方 DGX OS (Ubuntu 24.04 LTS 變體) 以獲得最佳驅動相容性。
### 3. Qwen 3.8 Flash Next 125B 挑戰 500k Context
- 搭配 prefix-caching,單機 128GB Unified Memory 在 500k Context 下 Prefill 保持在 **2,100+ tokens/sec**,TTFT **<0.09 秒**。
---
## 2026-09-12:RTX Spark N1X 選型論戰、ASUS BIOS 週期與萬元預算
### 1. 次世代 N1X 平台 vs. 現役 GB10
- N1X 定價較低,主打消費級 Windows/遊戲環境;GB10 (DGX Spark / GX10) 具備 **ConnectX-7 200Gbps 網卡** 與 **128GB LPDDR5X (273 GB/s)**,仍是 24/7 Agent 與長文本審計的專業首選。
### 2. ASUS GX10 韌體更新時差
- ASUS GX10 採用自家 EC/PD 韌體,BIOS 更新比 NVIDIA 原廠 FE 慢約 2~3 週,需定期至 ASUS 開發者專區手動更新以保持最佳相容性。
### 3. 萬元預算決算:2x Spark 叢集無懸念勝出
- 2x Spark 雙機直連在長文本 Prefill 與多 Agent 併發上,藉由 RoCE 實現無縫 TP=2,整體表現優於 Thunderbolt 連接的 Mac 叢集。
---
## 2026-09-13:spark-defrag 官方工具、進風口防塵與 Local RAG 黃金配置
### 1. 官方工具:NVIDIA `spark-defrag` v1.0 開源釋出
- 針對 GB10 設計的背景無感記憶體去碎片工具,在不中斷推理服務下重置 LPDDR5X 頁面索引,連續運作 30 天 TTFT 穩定維持在 **<0.08 秒**。
### 2. 硬體物理維護:進風口清潔建議
- 機身緊湊且進風口孔徑細小,建議每隔 1~2 個月使用防靜電吹塵球清理底座與後方進風網罩,確保全載運算溫度穩定在 **55°C~58°C**。
### 3. Qwen 125B + Local RAG 黃金記憶體配置
- 125B NVFP4 佔用 62GB,劃撥 50GB 作為 KV Cache,剩餘 16GB 分配給 Embedding 模型與向量資料庫(Qdrant/LanceDB),Decode 穩定在 **62~65 tokens/sec**。
---
## 2026-09-14:DeepSeek-V4.1-Flash EXL3、CUDA Graphs 衝突真相與社群價值
### 1. 模型驗證:DeepSeek-V4.1-Flash EXL3 推進 4x 叢集測試
- 釋出 4.75bpw EXL3 格式,社群正在推進 4 機 ConnectX-7 直連(512GB VRAM, TP4 模式)下的部署驗證。
### 2. 底層除錯:PIECEWISE CUDA Graphs + MTP + TP2 衝突
- 再次強調:在 MTP + TP2 組合下,CUDA Graphs 會導致解碼速度暴跌 28%(50 → 36 tok/sec),**在此配置下務必顯式關閉 CUDA Graphs**。
### 3. 社群力量與去雲端化定位
- 總結 GB10 晶片憑藉 128GB Unified Memory 與 100% 原生 CUDA 環境,透過開源社群強大的軟體調校能力,成功實現小型團隊 24/7 低功耗 (~100W) 本地超級站點的目標。
---
## 2026-09-15:sparkrun-recipes v2.8、雙模型 Agentic 測試與 macOS Companion
### 1. `sparkrun-recipes` v2.8 重磅升級
- 內建 `spark-defrag` 背景守護進程,並預載 vLLM v0.7.3.post1 補丁,徹底解決跨機 TP2 在 200Gbps RoCE 連線下的長 Session 頁面喚醒問題。
### 2. 雙模型協同 Agent 實測(Qwen 125B + 27B)
- 單機 128GB 同時常駐 **Qwen 125B (架構規劃)** 與 **Qwen 27B (代碼編寫)**,在 .NET 10 大型重構任務中連續重試 50 輪以上,展現 0 崩潰的穩定度。
### 3. 案頭 Companion 最佳定位
- 與 Mac Studio / RTX 5090 各司其職:Mac 適合單人前端高速打字,DGX Spark 則專注於 **24/7 低功耗 (~100W) 放置型後端、超長代碼庫審計與私有 Agent 營運**。
---
## 附錄:DGX Spark / ASUS GX10 常用關鍵命令與黃金參數速查
### 1. vLLM / SGLang 容器推薦啟動參數
```bash
# 避免跨機 NCCL 通訊降級與記憶體碎片溢出
docker run --gpus all --privileged \
-e NCCL_DEBUG=INFO \
-e NCCL_IB_DISABLE=0 \
-e PYTORCH_CUDA_ALLOC_CONF=max_split_size_mb:512 \
-v /dev/infiniband:/dev/infiniband \
vllm/vllm-openai:v0.7.3.post1 \
--model Qwen/Qwen3.8-Flash-Next-125B-NVFP4 \
--enable-prefix-caching \
--max-num-seqs 256 \
--kv-cache-dtype fp8
## 2026-08-27:sparkrun v2.5 發佈與雙機 ConnectX-7 200Gbps 併發實測
### 1. 工具鏈升級:`sparkrun` v2.5 正式釋出
- **自適應記憶體去碎片(Auto-Defrag):** 針對 Blackwell LPDDR5X 記憶體分配器重構。掛載 DeepSeek-V4-Flash(antirez Q2/Q4 混合版)或 Qwen 3.8 27B 進行長時間無人值守 Agent 任務時,能有效防止因頻繁 Tool Calls 導致的首字響應時間(TTFT)暴增。
- **一鍵預載 Best-Fit Recipes:** 整合 `spark-arena.com` 最新驗證參數,自動配置 NVFP4 / FP8 稀疏矩陣引數。
### 2. 雙機拓撲實測:2x Spark ConnectX-7 直連
- **TP=2 張量並行:** 透過標配 ConnectX-7 200Gbps 網卡直連(256GB Unified Memory),TP=2 模式下運行 Qwen 122B (AutoRound int4) 或 DeepSeek-V4-Flash,跨節點通訊延遲極低。
- **多併發吞吐:** 同時開啟 8 個 Agent Session 時,雙機總吞吐量(Aggregate TPS)穩定衝上 **1,250 tokens/sec**。
### 3. 生態採購提醒:ASUS GX10 特價庫存收網
- 受全球 LPDDR5X 合約價上漲影響,特價約 **$2,999~$3,500 美元** 的 ASUS Ascent GX10 (1TB 版) 現貨被迅速收網,後續補貨版本預計站上 $4,000 大關。
---
## 2026-08-28:Perplexity AI 本地合作宣告與 Qwen 180B MoE 單機免 Offload
### 1. 重磅商業新聞:Perplexity AI 原生登陸 DGX Spark
- NVIDIA 宣佈將 Perplexity 搜尋與推理引擎原生移植至 DGX Spark 生態,定位為「企業與個人的 24/7 本地知識庫 Agent 伺服器」,利用 128GB Unified VRAM 進行全量本地快取與語意檢索。
### 2. 單機模型突破:Qwen 3.8 Flash 180B MoE 零 Offload
- `styles01/sparkrun-recipes` 釋出 Runbook:透過 Q3_X_L / Q4_XS 混合量化,成功將 Qwen 3.8 Flash 180B MoE 完整載入單機 128GB VRAM,**無需將 n-gram 卸載至 CPU 主記憶體**,支援 200k 超長 Context。
### 3. 底層架構研討:`sm_121` 核心的指令集界限
- GB10 架構為 `sm_121`,物理上**不具備資料中心級 Blackwell (`sm_100`) 的 Tensor Memory (TMEM) 與 `tcgen05` 指令**。為 H100/GB200 編譯的 CUDA 內核無法直接執行,需認準專屬適配 `sm_121` 的 vLLM/SGLang 編譯包。
---
## 2026-08-29:Qwen 180B 200k Context 複測與 Amazon 水貨拒保警告
### 1. Perplexity AI 本地部署細節
- 引擎能直接調用 128GB Unified Memory 進行全量文檔快取(Full Document Caching),發揮 100W 低功耗與私有資料零洩漏的優勢。
### 2. Qwen 3.8 Flash 180B MoE 200k Context 穩定度驗證
- 經多方壓測,單機 128GB 載入 Q3_X_L 權重後免 CPU 卸載,在 200k Context 下配合 Hermes Agent 執行代碼重構與自動測試極度平滑。
### 3. 採購維護警訊:Amazon/eBay 內銷水貨遭 MSI 拒保
- 買家購買約 $3,000 美元的 MSI EdgeXpert AI(Spark 平台),故障後因序號為海外內銷版遭原廠判定無保固。建議認準授權通路以確保 RMA 權益。
---
## 2026-08-30:1M Context KV Cache 記憶體流失修復與 Qwen 27B NVFP4 Agent
### 1. 長文本救援:1M Context KV Cache 記憶體流失修復
- 長時間運行 100k+ tokens 任務時,背景容易積累記憶體碎片引發 SegFault。
- **避坑參數:** 寫入 `max_split_size_mb=512`,並顯式掛載 `--enable-prefix-caching` 與 **NVFP4 自適應 FP8 KV Cache**,使重複 Prompt 首字預吞吐(Prefill)控制在 **<0.1 秒**。
### 2. Agent 工作流調優:Qwen 3.8 27B NVFP4 + MTP
- 單機 GB10 解碼速度受限於 273 GB/s 頻寬,但載入 Qwen 3.8 27B NVFP4 開啟 MTP 後,生成速度可達 **60~95 tokens/sec**,僅佔用 16~20GB VRAM,留下 100GB+ 空間供多 Agent 併發常駐。
### 3. 硬體維護與選購:ConnectX-7 線材規格提醒
- 2x Spark 雙機直連(256GB VRAM)切勿選用無認證的被動線,請認準 Mellanox/NVIDIA 原廠認證線材(MCP1600 系列),避免 200Gbps 高速傳輸因過熱斷連。
---
## 2026-08-31:一年 Spark 使用實錄、ROI 結算與 sparkrun-recipes v2.6
### 1. 一年實測與 ROI 結算
- 社群總結:透過 2x Spark (256GB VRAM) 雙機直連常駐 DeepSeek-V4-Flash 與 Qwen 122B,團隊已停用雲端 API 訂閱,省下的費用已完全覆蓋硬體成本。
- 核心價值在於 **24/7 低功耗 (~100W) 靜音常駐**、**2,000+ t/s Prefill** 與 **大容量 KV Cache 空間**。
### 2. `sparkrun-recipes` v2.6 升級
- 修復 PagedAttention Block 頁面回收機制,解決 180B MoE 在 200k Context 長 Session 下的微量記憶體流失,TTFT 穩定在 **<0.1 秒**。
### 3. 市場現貨告急
- 全球 LPDDR5X 合約價調漲,特價 $2,999~$3,500 美元現貨庫存見底,市場均價攀升至 $4,200 美元以上。
---
## 2026-09-01:CUDA 13.2 正式版鏡像、16 併發雙機壓測與 spark-monitor
### 1. CUDA 13.2 正式版 Docker 降臨
- 徹底解決先前 nightly 鏡像偶發將 `sm_121` 降級調用 Ampere (`sm_80`) 路徑的 Bug,全面寫入 Blackwell 原生 JIT 優化,Prefill 穩定在 **2,400+ tokens/sec**。
### 2. 2x Spark 16 併發 Agent 壓測
- 雙機 ConnectX-7 直連(256GB VRAM)在 TP=2 模式下載入 Qwen 180B MoE 與 DeepSeek V4 Flash,觸發 16 個併發 Agent 時,總吞吐量達 **1,420 tokens/sec**,整機牆插總功耗僅約 **~220W**。
### 3. 開源工具:`spark-monitor` 儀表板
- 專為 GB10 設計,實時監控 LPDDR5X 記憶體碎片率與 Prefill/Decode 吞吐,並內建風扇轉速自動平衡腳本,維持 SoC 溫度低於 60°C。
---
## 2026-09-02:2x Spark Prefill 衝上 2,900 t/s、CUDA Graphs 避坑與 vLLM 修復
### 1. 雙機極限數據:Prefill 狂飆 2,900 tok/sec
- 2x Spark 載入 Qwen3.8-Flash-Next (NVFP4),Prefill 衝上 **2,900 tokens/sec**,單串流 Decode 達 **50 tokens/sec**。
- **Docker 陷阱:** 預設 Docker 易將 NCCL 降級為 TCP Sockets,導致 TP2 效能折半。務必掛載 `--privileged` 並用 `ibdev2netdev` 校準 RoCE 網卡。
### 2. CUDA Graphs 在 MTP + TP2 下的效能衰退
- PIECEWISE CUDA Graphs 在單機無 MTP 模式下可提升生成速度,但在 **MTP + TP2 模式下開啟會導致 Decode 速度從 50 暴跌至 36 tokens/sec (衰退 ~28%)**。此配置下應**關閉 CUDA Graphs**。
### 3. 開源庫修復:FlashInfer 0.6.18 與 vLLM PR #53896
- GB10 晶片請鎖定 **FlashInfer 0.6.18**(0.6.17 會觸發 GEMM 報錯)。vLLM 請併入 **PR #53896** 邊界保護補丁,修復 `shuffleInputRowsKernel` 越界讀取問題。
---
## 2026-09-03:USB-C DP 顯示黑屏修復、3DGS 點雲壓測與 .NET 10 API 整合
### 1. 硬體避坑:USB-C DisplayPort 轉接黑屏處方
- Spark 在開機 POST 早期對 USB-C DP 僅進行一次物理偵測。若外接 KVM/螢幕未提前上電完成 EDID 握手,該 Port 會被永久判為無訊號。
- **開機順序:** 先讓外接 KVM/顯示器完全啟動(約 50 秒),再按下 Spark 電源鍵。
### 2. 3D 視覺應用:3D Gaussian Splatting (3DGS) 大場景渲染
- 雖然頻寬不如高階顯卡,但 128GB Unified Memory 避免了消費級顯卡(32GB)在城市級點雲與 3D 輻射場重建時的 OOM 崩潰,成為超大點雲訓練的高 CP 值設備。
### 3. `sparkrun-recipes` .NET 10 WebAPI 整合
- 統一修復與第三方 API 通訊時的 UTC 時區轉換與嵌套 Step entity 外洩問題。
---
## 2026-09-04:.NET 10 Agentic 實測高分、KVM 時序確認與生態定位
### 1. .NET 10 Agentic Build Benchmark:56/61 接近滿分
- 單機常駐 **Qwen 3.8 Flash 180B MoE (架構規劃)** 與 **Qwen 27B (代碼編寫)**,執行 ASP.NET Core 10 的全自動構建與自癒測試,拿下 56/61 高分。
### 2. USB-C DisplayPort 顯示處方再確認
- 再次強調「先開 KVM 50 秒,再開機」的標準物理順序,若黑屏需重新插拔線材觸發鏈路重談判。
### 3. 生態定位定性
- Spark 核心優勢在於 **24/7 低功耗 (~103W)** 桌面全量開發,讓小型團隊能直接在桌面進行長文本審計、超大 RAG 向量索引與 Agent 併發營運。
---
## 2026-09-05:社群軟體逆襲論、KVM 軟體重置指令與 API 規範定案
### 1. 社群力量逆襲硬體限制
- 社群指出,雖然 GB10 頻寬為 273 GB/s,但憑藉 **ConnectX-7 200Gbps 網卡** 與 **100% 原生 CUDA 相容性**,配合社群開發的 PagedAttention 優化與 MTP 解碼,建構起極高的軟體護城河。
### 2. KVM 遠端無痛重置指令
- 若 USB-C DP 遠端黑屏且無法實體插拔,可 SSH 進入 KVM 執行:
`echo 0 > /sys/bus/i2c/devices/0-0058/poweron && sleep 3 && echo 1 > /sys/bus/i2c/devices/0-0058/poweron`
以主動重設 Hot-plug 偵測。
### 3. API 規範升級
- 修復 EF Core 10 與 SQLite 整合時 `policyId` 欄位外洩與時間戳未轉化為 UTC (`Z`) 的問題。
---
## 2026-09-06:Qwen 180B 解鎖 256k Context、vLLM v0.7.3-rc1 與雙機 30 天實測
### 1. Qwen 3.8 Flash 180B MoE 解鎖 256k 超長 Context
- 採用 Q3_X_L 權重搭配 NVFP4 自適應 FP8 KV Cache,免 CPU 記憶體卸載。在 256k Context 壓測下,Prefill 維持在 **1,950+ tokens/sec**,Decode 穩定於 **14~18 tokens/sec**。
### 2. vLLM v0.7.3-rc1 釋出
- 針對 `sm_121` 核心重構,修正高頻 Tool Calls 下 LPDDR5X 動態記憶體分配器頁面回收不及的崩潰問題。
### 3. 2x Spark 雙機 30 天 0 洩漏運維報告
- 2x Spark ConnectX-7 直連常駐 DeepSeek V4 Flash,12 併發 Agent 連續運作 30 天 0 記憶體洩漏,總吞吐量穩定維持在 **~1,350 tokens/sec**,功耗僅 **190W~230W**。
---
## 2026-09-07:9 月最佳模型票選、ASUS GX10 漲價與 Mac Studio 對決
### 1. 單機最佳模型票選:Qwen 3.8-Flash-Next 125B (A6B)
- 被評為 9 月單機綜合智商與速度第一梯隊神卡。配合 vLLM + MTP,單機 128GB 載入時 Prefill 達 **1,800+ tokens/sec**,Decode 達 **55~60 tokens/sec**。
### 2. ASUS Ascent GX10 價格飆升至 $5,999
- 記憶體顆粒合約價調漲與產能緊缺,原先 $2,999~$3,500 美元現貨被掃光,部分通路標價拉升至 $5,999 美元。
### 3. Mac Studio M5 vs. DGX Spark 選型劃線
- Mac Studio 適合單人純文字對話(Decode 頻寬高);**DGX Spark 則憑藉 100% CUDA 相容、24/7 低功耗 (~100W) 與 ConnectX-7 200G 橫向擴充**,在多 Agent 營運與工程開發上勝出。
---
## 2026-09-08:vLLM v0.7.3 正式版、每月 $8 電費單與 sparkrun-recipes v2.7
### 1. vLLM v0.7.3 正式版釋出
- 原生適配 `sm_121` 核心,徹底修復 PagedAttention 記憶體頁回收 Bug。單機載入 Qwen 125B 時,重複 Prompt 的 TTFT 壓至 **<0.08 秒**。
### 2. 能效實測:24/7 運作單月電費不足 $8 美元
- 單機常駐 3~4 個 Agent 實例時,待機/低載功耗僅 **35W~40W**,滿載峰值約 **115W**。單月電費僅約 **$6.5~$8.0 美元**。
### 3. `sparkrun-recipes` v2.7 釋出
- 內建 .NET 10 / Python FastAPI 自動化 YAML 格式校驗檔,並自動填入 Blackwell MTP 最優化稀疏矩陣補丁。
---
## 2026-09-09:黑馬 Ornith 1.5 35B、Agent 派系劃分與 $10,000 預算決算
### 1. 黑馬模型:Ornith 1.5 35B (a3b-fp8 MTP)
- 改善了 Qwen 系列在特定長文本下的思考循環問題。單機 Decode 達 **50~60 tokens/sec**,Prefill 高達 **5,000+ tokens/sec**,可承載 **100+ 併發 Session**。
### 2. 單機選型:Dense 邏輯精確 vs. Flash 高速診斷
- **Qwen 3.8 27B Dense:** 適合需要單次極致代碼精確度的場景。
- **Qwen 3.8 Flash Next (Q4_XS):** 適合高頻「嘗試-診斷」的 Agent 循環任務。
### 3. 2x Spark 叢集 vs. 多卡舊顯卡拼裝
- 2x Spark 憑藉 **100W 級省電靜音、原生 200Gbps RoCE 直連**,在 24/7 運作穩定度與總維護成本上全面勝過多卡舊顯卡拼裝。
---
## 2026-09-10:vLLM post1 緊急補丁、1U 機架改裝與 Qwen 125B 256k 壓測
### 1. vLLM v0.7.3.post1 緊急補丁
- 修正 2x Spark 雙機 TP=2 連線超過 48 小時後 PagedAttention 頁面喚醒失敗的問題,長 Session 運作無記憶體滲漏,TTFT 保持在 **<0.08 秒**。
### 2. ASUS GX10 1U 機架改裝方案
- 社群釋出 1U 雙機並排機架轉接架 3D 列印模型與雙風道抽風系統,將全載 SoC 溫度壓制在 **56°C~59°C**。
### 3. Qwen 3.8-Flash-Next 125B 256k Context 複測
- NVFP4 權重佔用約 62GB VRAM,留下 60GB 空間作為 KV Cache。200k+ Context 下 Decode 生成速度維持在 **58~62 tokens/sec**。
---
## 2026-09-11:SGLang 0.4.4-nightly、OEM 刷機避坑與 500k Context
### 1. SGLang 0.4.4-nightly 釋出
- 重構 `sm_121` 核心的 Cross-node 數據廣播機制。2x Spark 載入 DeepSeek V4 Flash 或 Qwen 180B MoE 時,Prefill 衝上 **3,450+ tokens/sec**,跨機等待延遲降低 **~22%**。
### 2. 系統層級避坑:OEM 機型刷回 NVIDIA 原廠 DGX OS
- ASUS GX10、Dell、Lenovo 等預裝 OS 易出現 `sm_121` 核心回退降級 Bug。建議直接刷寫 NVIDIA 官方 DGX OS (Ubuntu 24.04 LTS 變體) 以獲得最佳驅動相容性。
### 3. Qwen 3.8 Flash Next 125B 挑戰 500k Context
- 搭配 prefix-caching,單機 128GB Unified Memory 在 500k Context 下 Prefill 保持在 **2,100+ tokens/sec**,TTFT **<0.09 秒**。
---
## 2026-09-12:RTX Spark N1X 選型論戰、ASUS BIOS 週期與萬元預算
### 1. 次世代 N1X 平台 vs. 現役 GB10
- N1X 定價較低,主打消費級 Windows/遊戲環境;GB10 (DGX Spark / GX10) 具備 **ConnectX-7 200Gbps 網卡** 與 **128GB LPDDR5X (273 GB/s)**,仍是 24/7 Agent 與長文本審計的專業首選。
### 2. ASUS GX10 韌體更新時差
- ASUS GX10 採用自家 EC/PD 韌體,BIOS 更新比 NVIDIA 原廠 FE 慢約 2~3 週,需定期至 ASUS 開發者專區手動更新以保持最佳相容性。
### 3. 萬元預算決算:2x Spark 叢集無懸念勝出
- 2x Spark 雙機直連在長文本 Prefill 與多 Agent 併發上,藉由 RoCE 實現無縫 TP=2,整體表現優於 Thunderbolt 連接的 Mac 叢集。
---
## 2026-09-13:spark-defrag 官方工具、進風口防塵與 Local RAG 黃金配置
### 1. 官方工具:NVIDIA `spark-defrag` v1.0 開源釋出
- 針對 GB10 設計的背景無感記憶體去碎片工具,在不中斷推理服務下重置 LPDDR5X 頁面索引,連續運作 30 天 TTFT 穩定維持在 **<0.08 秒**。
### 2. 硬體物理維護:進風口清潔建議
- 機身緊湊且進風口孔徑細小,建議每隔 1~2 個月使用防靜電吹塵球清理底座與後方進風網罩,確保全載運算溫度穩定在 **55°C~58°C**。
### 3. Qwen 125B + Local RAG 黃金記憶體配置
- 125B NVFP4 佔用 62GB,劃撥 50GB 作為 KV Cache,剩餘 16GB 分配給 Embedding 模型與向量資料庫(Qdrant/LanceDB),Decode 穩定在 **62~65 tokens/sec**。
---
## 2026-09-14:DeepSeek-V4.1-Flash EXL3、CUDA Graphs 衝突真相與社群價值
### 1. 模型驗證:DeepSeek-V4.1-Flash EXL3 推進 4x 叢集測試
- 釋出 4.75bpw EXL3 格式,社群正在推進 4 機 ConnectX-7 直連(512GB VRAM, TP4 模式)下的部署驗證。
### 2. 底層除錯:PIECEWISE CUDA Graphs + MTP + TP2 衝突
- 再次強調:在 MTP + TP2 組合下,CUDA Graphs 會導致解碼速度暴跌 28%(50 → 36 tok/sec),**在此配置下務必顯式關閉 CUDA Graphs**。
### 3. 社群力量與去雲端化定位
- 總結 GB10 晶片憑藉 128GB Unified Memory 與 100% 原生 CUDA 環境,透過開源社群強大的軟體調校能力,成功實現小型團隊 24/7 低功耗 (~100W) 本地超級站點的目標。
---
## 2026-09-15:sparkrun-recipes v2.8、雙模型 Agentic 測試與 macOS Companion
### 1. `sparkrun-recipes` v2.8 重磅升級
- 內建 `spark-defrag` 背景守護進程,並預載 vLLM v0.7.3.post1 補丁,徹底解決跨機 TP2 在 200Gbps RoCE 連線下的長 Session 頁面喚醒問題。
### 2. 雙模型協同 Agent 實測(Qwen 125B + 27B)
- 單機 128GB 同時常駐 **Qwen 125B (架構規劃)** 與 **Qwen 27B (代碼編寫)**,在 .NET 10 大型重構任務中連續重試 50 輪以上,展現 0 崩潰的穩定度。
### 3. 案頭 Companion 最佳定位
- 與 Mac Studio / RTX 5090 各司其職:Mac 適合單人前端高速打字,DGX Spark 則專注於 **24/7 低功耗 (~100W) 放置型後端、超長代碼庫審計與私有 Agent 營運**。
---
## 附錄:DGX Spark / ASUS GX10 常用關鍵命令與黃金參數速查
### 1. vLLM / SGLang 容器推薦啟動參數
```bash
# 避免跨機 NCCL 通訊降級與記憶體碎片溢出
docker run --gpus all --privileged \
-e NCCL_DEBUG=INFO \
-e NCCL_IB_DISABLE=0 \
-e PYTORCH_CUDA_ALLOC_CONF=max_split_size_mb:512 \
-v /dev/infiniband:/dev/infiniband \
vllm/vllm-openai:v0.7.3.post1 \
--model Qwen/Qwen3.8-Flash-Next-125B-NVFP4 \
--enable-prefix-caching \
--max-num-seqs 256 \
--kv-cache-dtype fp8
留言