你會建立或學到甚麼

一個本地聊天模型、一項可重複的任務,以及可作比較的基準。

01/先揀一項有用的工作

適合的第一個用例,是把自己的短筆記改寫成清晰電郵。你可以逐項核對日期、姓名及行動有沒有保留。先使用虛構資料:模型即使語氣肯定,也可能編造細節。本地推理讓你控制生成在哪裏進行,但不代表答案必然正確。

本篇使用 Qwen3 4B 作為較小且成熟的起點,並非宣稱它是最新或最強模型。Ollama 列表標示的是 Q4_K_M 版本。選擇模型時,要為系統及上下文預留記憶體,不要只看下載檔案是否剛好放得下。

資料來源Ollama · Qwen3 4B model

02/安裝並開始聊天

從 Ollama 官方下載頁安裝,並啟動程式或服務。macOS/Linux 使用終端機,Windows 使用 PowerShell。以下指令會下載模型並開始互動聊天;首次下載需要上網。完成後輸入 /bye 離開。

ollama --version
ollama pull qwen3:4b
ollama run qwen3:4b
資料來源Ollama · Quickstart

03/給任務一個驗收標準

把以下例子貼入聊天,檢查星期三、14:00 及地點有沒有保留,並確認沒有新增價錢、承諾或收件人。之後可試自己的非敏感筆記。有效的評估要看事實和格式,而不只看文筆是否流暢。

分別試短筆記及長筆記,記錄第一段有用文字出現前的等待,以及完整答案所需時間。先預熱一次,再重複同一任務三次;量度期間不要更改模型或提示。

Turn these notes into an email of at most 80 words.
Keep all facts. Do not add missing details.
Notes: Workshop moved to Wednesday, 14:00. Venue: Room B.
Ask participants to reply if they cannot attend.
/no_think

04/弄清楚甚麼留在本機

選擇已下載的本地模型,而非雲端模型。如要使用 Ollama 的純本地模式,可在現有 ~/.ollama/server.json 加入 disable_ollama_cloud: true,保留其他設定,然後重新啟動 Ollama。模型下載仍需要網絡;瀏覽器擴充功能或連接的工具也可能另有資料傳輸。

完成下載後,可暫時斷網再跑無敏感內容的測試。如失敗,找出哪個元件需要連線。模型運行時用 ollama ps 查看運算放在哪裏。意外使用 CPU、記憶體壓力或過長上下文都可能拖慢回應;購買硬件前先試較小模型。

資料來源Ollama · Local-only mode & memory

05/下一步

保留一小組提示及預期事實,日後轉模型時重跑。TokFire Bench 會獨立量度支援的 GGUF/llama.cpp 或 MLX/oMLX 工作流程;Ollama 聊天不會自動變成 TokFire 測試。盡量使用同一基礎模型,並記錄執行環境及量化差異,不要把分數混在一起。