一个本地聊天模型、一项可重复的任务,以及可供比较的基准。
01/先选一项有用的工作
适合的第一个用例,是把自己的短笔记改写成清晰邮件。你可以逐项核对日期、姓名及行动有没有保留。先使用虚构资料:模型即使语气肯定,也可能编造细节。本地推理让你控制生成在哪里进行,但不代表答案必然正确。
本篇使用 Qwen3 4B 作为较小且成熟的起点,并非宣称它是最新或最强模型。Ollama 列表标示的是 Q4_K_M 版本。选择模型时,要为系统及上下文预留内存,不要只看下载文件是否刚好放得下。
02/安装并开始聊天
从 Ollama 官方下载页安装,并启动程序或服务。macOS/Linux 使用终端,Windows 使用 PowerShell。以下命令会下载模型并开始交互聊天;首次下载需要联网。完成后输入 /bye 离开。
ollama --version
ollama pull qwen3:4b
ollama run qwen3:4b03/给任务一个验收标准
把以下例子粘贴到聊天,检查星期三、14:00 及地点有没有保留,并确认没有新增价格、承诺或收件人。之后可试自己的非敏感笔记。有效的评估要看事实和格式,而不只看文笔是否流畅。
分别试短笔记及长笔记,记录第一段有用文字出现前的等待,以及完整答案所需时间。先预热一次,再重复同一任务三次;测量期间不要更改模型或提示。
Turn these notes into an email of at most 80 words.
Keep all facts. Do not add missing details.
Notes: Workshop moved to Wednesday, 14:00. Venue: Room B.
Ask participants to reply if they cannot attend.
/no_think04/弄清楚什么留在本机
选择已下载的本地模型,而非云端模型。如要使用 Ollama 的纯本地模式,可在现有 ~/.ollama/server.json 加入 disable_ollama_cloud: true,保留其他设置,然后重启 Ollama。模型下载仍需要网络;浏览器扩展或连接的工具也可能另有数据传输。
完成下载后,可暂时断网再跑无敏感内容的测试。如失败,找出哪个组件需要连接。模型运行时用 ollama ps 查看运算放在哪里。意外使用 CPU、内存压力或过长上下文都可能拖慢响应;购买硬件前先试较小模型。
05/下一步
保留一小组提示及预期事实,日后换模型时重跑。TokFire Bench 会独立测量支持的 GGUF/llama.cpp 或 MLX/oMLX 工作流程;Ollama 聊天不会自动变成 TokFire 测试。尽量使用同一基础模型,并记录运行环境及量化差异,不要把分数混在一起。