可以检查的测量结果。
固定工作负载
选择一至三个模型。每个模型分开测试,关闭其伺服器后才启动下一个;模型不会同时执行。程式使用各模型的 tokenizer 处理固定合成文字,再使用刚好 512 或 2,048 个输入 token ID。每组工作产生 128 个 token,temperature 为 0、seed 为 42、忽略 EOS,并停用提示词快取。舍弃一次暖机结果,保留三次正式测量。上下文为 4,096、KV 快取为 f16、关闭 flash attention、batch 及 microbatch 为 512、单一 slot、请求 GPU 层数为 999,CPU 执行绪数等于侦测到的逻辑核心数。
并行 jobs
TokFire Bench 亦提供独立并行测试:同一 GGUF 或 MLX 模型,免费可同时执行 1–3 个工作,Pro 最多 20 个。测量三轮同步请求,分别报告每个工作的延迟与速度,以及总吞吐量。结果不会混入依序执行的标准测试。
Windows 预览版
Windows 10/11 x64 使用 llama.cpp 及 GGUF,输入 512 个 token、输出 128 个 token,暖机后进行三轮同步测量。每个工作共用同一模型伺服器,每个 slot 配置 4,096 个上下文 token。报告使用 local-ai-windows-jobs-v1,包含 CPU、机型、GPU 名称、RAM 及 Windows 版本,与 Mac 标准比较表分开储存。GPU 名称不代表已成功启用 GPU 加速。Windows 执行档尚未签署,已在 macOS 交叉编译及通过单元测试;Windows 介面、登入、取消及 CPU/GPU 推论测试仍待完成。
简短试跑
可选的 MiniCPM 试跑使用单一模型、512 个输入及 32 个输出 token,进行一次暖机及一次测量。命令列试跑的 local-ai-trial-v1 报告保留在本机,不会进入标准比较资料库。
测量项目
TTFT 是从开始本机 HTTP 请求到收到首个生成 token ID 的用户端实际经过时间,包含本机 HTTP 开销。预填充及生成速度来自执行环境最后的计时报告。载入时间由启动程序至伺服器就绪,不会清除作业系统档案快取。每个模型工作阶段每 250 毫秒抽样程序 RSS 峰值;这不是全部统一记忆体或 Metal 记忆体用量。
比较规则
模型档案及执行环境二进位档案均以 SHA-256 计算杂凑值。比较组别亦包含所有执行设定、规格版本及输入/输出长度。不同硬件与作业系统组合分列显示。每份报告取三次测量的中位数,社群列再计算这些中位数的平均值。不会产生总分、品质分数、预测速度或已验证标章。
已知限制
这些是社群提交资料,并非经认证的测量。格式验证无法证明硬件资料真实,或防止修改过的用户端。目前尚未测量功耗、温度、swap、实际 GPU 层卸载验证、全部 GPU 记忆体或持续散热表现。模型载入时间受作业系统快取影响。忽略 EOS 是吞吐量测试,不是品质评估。请勿仅凭速度推论回答品质或广泛的应用相容性。
私隐与公开分享
测试程式只向本机发出推论请求,并将报告储存于本机。可选的 MiniCPM 启动程式会从 Hugging Face 下载官方模型并验证校验码。在浏览器汇入不会上传。储存需要明确同意收集及登入;公开是独立的自愿选项。帐户 ID 私人保留,以管理拥有权及删除。公开比较包含硬件及杂凑值,但不包含身分。网站访客可查看公开比较;私人报告只限上传该报告的帐户存取。
桌面程式测试状态
原始码包含 SwiftUI macOS 介面及真正的 llama-server 测试程式。Python 通讯协定测试已在开发环境执行。Swift 编译、实际 Metal 推论、介面生命周期测试及临时签署已在 M2 Max 通过。开发版 DMG 尚未经 Developer ID 签署或 Apple 公证。
执行环境 API 参考:llama.cpp server