本地 LLM 跑得動嗎?硬體兼容性檢測工具實測

最近開源 LLM 幾乎每週都有新模型推出,每次看到有趣的檔案,心裡總會冒出一個問號:「我的電腦跑得動嗎?」

本機跑大模型最關鍵的不是 CPU 多強、記憶體多大,而是 GPU 的 VRAM(顯存)。VRAM 不夠,再大的模型也塞不進去,只能退而求其次降量化、縮上下文,甚至根本起不動。手動算每個模型的容量很累人,好在有幾款工具可以一鍵幫你檢查。

為什麼 VRAM 是關鍵?

比喻一下:

  • VRAM = 工作桌的面積。模型越大、量化越低(精度越高),佔用的桌面越大。
  • 系統記憶體(RAM) = 抽屜。空間不夠時可以暫時塞進去,但拿出來會慢很多。
  • CPU / GPU = 你的手。手快(GPU 強)取東西才快,生成才會順。

所以判斷「跑得動嗎」,第一步就是看你的 VRAM 夠不够把這個模型(加上上下文)裝下。接下來這些工具就是幫你自動算這道題。

目前主流檢測工具一覽

工具 類型 適合誰 特色
llmfit 本地終端機 常用命令列的人 掃描硬體 + 實際 benchmark,資料最扎實
WhichLLM 本地 / 線上 從 HuggingFace 挑模型的人 自動偵測後直接推薦最適合的模型
GPUFits 線上網站 想確認「這張卡能不能跑這模型」 VRAM 計算 + 兼容性檢查 + 本機 vs API 成本比較
Local LLM Compatibility Checker 線上網站 只想快速算 VRAM 的人 輸入 GPU/VRAM/RAM 判斷

首推:llmfit(本地工具)

llmfit(GitHub: https://github.com/AlexsJones/llmfit )。

快速安裝
curl -fsSL https://llmfit.axjns.dev/install.sh | sh -s -- --local

安裝後輸入一行命令,它會自動偵測你的:

  • CPU
  • 系統 RAM
  • GPU(含 VRAM)
  • 其他加速器設定

然後比對上百個開源 LLM,從四個维度打分:

  1. 質量:哪個量化版本能保住效果。
  2. 速度:預估生成快慢。
  3. 適配度:你的硬體跟這個模型的契合程度。
  4. 上下文:還能留多少空間給對話歷史。

它預設開的是互動式 TUI(終端介面),畫面會列出「哪些模型能跑、跑多快、用哪個量化最合適」。如果你習慣傳統 CLI,也可以直接關掉互動模式。

更實用的是,llmfit 可以實際下載並執行模型、量出真實的 tokens/sec,把數據分享出去幫到其他人。

不想裝東西?用線上網站

有時候你只是在別人電腦上、或懶得安裝,這時線上工具最方便:

該怎麼選?

  • 想認真了解自己這台機器 → 裝 llmfit,順手跑一次 benchmark,數據最可靠。
  • 只想快速查一下、不想安裝 → 用 GPUFits(查兼容性)或 Local LLM Compatibility Checker(查 VRAM)。

要注意的問題

  • VRAM 會吃滿:就算模型剛好吃進去,剩下給上下文的空间可能就很少,對話長了就 OOM。
  • 估算 ≠ 實測:線上網站多是根據型號推算,實際速度還是要看你的驅動、量化方式、並行設定。
  • Mac 不算「GPU VRAM」:M 系列是統一記憶體,要看總内存夠不夠(建議至少 16GB 起步)。
  • 舊卡驅動:很老的 NVIDIA 卡可能支援度低,檢查時留意驅動版本。