保守的單 job 測試計劃及記憶體工作表,而非保證的生成速度。
01/值得留意的技術進展
ISTA-DASLab 模型卡列出 Qwen3.8-27B GSQ-RCO IQ3_S 檔案為 11.8 GB。GSQ + RCO 使用非均勻量化,使 16GB 顯示卡值得嘗試這類模型。這個數字代表下載的權重檔案,不是總 VRAM 使用量。
作者在部分評估中報告接近基準的表現,但不代表未壓縮精度,也不保證所有任務答案一樣。可選的 MTP 版本更大,視覺用途亦需要額外元件。先用純文字的普通版本,才能分清哪項改動帶來甚麼影響。
02/寫下完整預算
所需記憶體可概括為:權重 + KV cache + 執行緩衝區 + 可選元件,並為畫面及其他程序預留空間。這是規劃公式,不是精確配置器。上下文長度、模型架構、快取精度和並行請求都會影響需求;GB 與 GiB 亦不同,最終應以執行環境實際配置為準。
混合專家模型的 A3B 指活躍計算量,不表示只需儲存 3B 參數。同樣,模型宣傳的最大上下文,不一定是你的卡能承受的長度。先用短上下文及一個 job,記錄成功測試後才逐步增加。
03/先啟動保守配置的 GGUF 伺服器
按官方建置或版本說明,在 NVIDIA 電腦安裝支援 CUDA 的新版 llama.cpp。從模型卡下載指定的普通 IQ3_S GGUF,記錄檔案校驗值,放進工作資料夾後執行以下單行指令。PowerShell 如使用目前資料夾內的執行檔,請改用 .\llama-server.exe。
指令要求 GPU offload、4,096-token 上下文及一個 slot,只綁定本機。請查看啟動紀錄中的實際 offload 層數和記憶體配置;要求的 -ngl 數值不能證明全部在 GPU。伺服器就緒後開啟 http://127.0.0.1:8080。如架構不支援,應更新執行環境,而不是更改模型檔名。
llama-server -m Qwen3.8-27B-GSQ-RCO-IQ3_S.gguf -ngl 99 -c 4096 -np 1 --host 127.0.0.1 --port 808004/每次只改一個變數
選一項短文改寫、一項結構化擷取,以及一個依賴前文的問題;閱讀輸出前先保存預期事實。固定輸出上限,重跑三次,記錄失敗及峰值 VRAM。之後才比較更長上下文或另一量化版本,其餘設定維持一致。
如記憶體不足,先縮短上下文。較小的量化檔案或部分 CPU offload 可能有幫助,但亦會影響品質或速度。量化 KV cache 是另一項取捨,且受模型和後端限制。不要同時啟用權重量化、快取量化及推測解碼,再把所有改善歸功於單一功能。
05/判斷電腦適合做甚麼
成功載入只代表「放得下」;答案可靠且等待時間可接受,才算實用聊天配置。是否適合多 agent,仍需獨立測試並行工具任務。報告應列明 GPU、系統 RAM、模型檔案、上下文及執行環境。
本篇是測試方法,並非 TokFire 對 RTX 5060 Ti 或 RTX 5090 的實測成績。請以自己的結果判斷是否順暢。遊戲顯示卡可以是有用的本地 AI 起點,而不必承諾每個 27B 模型或所有上下文長度都放得下。