BENCHMARK 1.0 · RC1 STABLE SNAPSHOT

39 个本地模型,
在同一台电脑上说话。

一份关于小模型真实本地可用性的可复现记录。我们保留原始证据、分开能力与运行失败,并拒绝用一个万能总分掩盖模型的不同生态位。

01

先给结论,再看榜单

默认本地基线是 Qwen3-8B Q4;但真正的答案取决于你要解决的问题。

01

通用与 Agent

Qwen3-8B Q4 在 Core、推理、翻译、工具与代码之间最均衡。

02

高质量文本

Gemma4 E4B 与 Qwen3.5 9B 更适合通用和长上下文;两者代码或截断风险不同。

03

速度优先

Granite4 7B-A1B、LFM2.5 与 MiniCPM5 很快,但不能把吞吐当成能力。

04

专用工作

Qwen3 Embedding、Granite Guardian 与 TranslateGemma 应在原生生态位内解释。

02

为什么没有一张“万能总榜”

Benchmark 的目标不是复刻厂商 leaderboard,而是回答:这些模型在这台普通本地电脑上,实际能做什么?

分赛道

Core、推理、代码、工具、视觉、OCR、嵌入与安全分别比较,不惩罚不适用能力。

证据分层

不可变 raw、归一化解释、评分器输出与展示报告彼此分离,评分更新无需重新推理。

实用边界

超时、截断和没有 final answer 是本机可用性证据;网络或服务失败绝不算能力 0 分。

身份稳定

版本、manifest hash、模型 digest、profile 和 task ID 共同定义一条结果,修订版不会覆盖旧证据。

03

各赛道分别看,才不会误导

每个分数是当前 RC1 题集内的 0–1 均值。Coverage 与样本数必须和分数一起阅读。

核心Qwen3-8B Q40.77824 records
推理Qwen3-8B Q4 · Falcon-H1R-7B · lfm2.5:8b0.50010 records
代码qwen3-vl:8b0.8638 records
翻译gemma4:e4b · Qwen3-8B Q41.0006 records
工具Qwen3-8B Q4 · lfm2.5:8b · qwen3-vl:8b0.7508 records
视觉gemma4:e4b · Granite Vision 4B · ministral-3:8b · qwen3-vl:8b · qwen3.5:4b · qwen3.5:9b0.1258 records
OCRdeepseek-ocr0.38410 records
长上下文gemma4:e4b · qwen3.5:9b0.5004 records
嵌入qwen3-embedding1.00012 records
安全granite4.1-guardian:8b1.00020 records
医疗nemotron-3-nano:4b0.8336 records
04

39 个模型逐一查看

筛选生态位或赛道,查看官方定位、本机实际得分、推荐用途和风险。Retention 仍为 UNASSESSED。

当前显示 29 个模型

通用候选

Qwen3-8B Q4

8.19B · Q4_K_M · 4.68 GiB
0.778
代码0.625核心0.778长上下文0.250推理0.500工具0.750翻译1.000
推荐用途
当前最适合作为默认本地通用/Agent 基线的模型。
注意事项
长上下文仅 0.250,并出现 2 次截断;仍需按任务选择。
completion · thinking · tools官方来源
视觉/多模态候选

gemma4:e4b

8.0B · Q4_K_M · 8.95 GiB
0.736
代码0.000核心0.736长上下文0.500OCR0.000推理0.400工具0.625翻译1.000视觉0.125
推荐用途
本机通用、翻译和长上下文任务的首选之一。
注意事项
RC1 代码得分为 0;视觉绝对分也很低。
audio · completion · thinking · tools · vision官方来源
视觉/多模态候选

qwen3.5:9b

9.7B · Q4_K_M · 6.14 GiB
0.694
代码0.138核心0.694长上下文0.500医疗0.667OCR0.000推理0.400工具0.625翻译0.517视觉0.125
推荐用途
通用和长上下文任务的高质量候选。
注意事项
代码和翻译明显弱于同级候选,并有 9 次 final 前截断。
completion · thinking · tools · vision官方来源
通用候选

Falcon-H1R-7B

7.59B · Q4_K_M · 4.28 GiB
0.653
代码0.375核心0.653长上下文0.250医疗0.667推理0.500工具0.625翻译0.950
推荐用途
推理、通用与医疗文本的稳健对照模型。
注意事项
代码得分 0.375,性能慢于若干 4B/混合架构模型。
completion · thinking · tools官方来源
通用候选

ornith:9b

9.0B · Q4_K_M · 5.24 GiB
0.628
代码0.762核心0.628长上下文0.250推理0.000工具0.500翻译0.933
推荐用途
代码、通用和翻译任务的强力本地候选。
注意事项
推理为 0,且尚未匹配到可信的精确官方模型卡。
completion · thinking · toolsSource unresolved
通用候选

nemotron-3-nano:4b

4.0B · Q4_K_M · 2.64 GiB
0.625
代码0.500核心0.625长上下文0.250医疗0.833推理0.400工具0.375翻译0.733
推荐用途
4B 级通用、医疗文本和中速 Agent 任务的优先候选。
注意事项
翻译较弱且出现 1 次未知工具调用;医疗结果不代表临床安全。
completion · thinking · tools官方来源
视觉/多模态候选

qwen3.5:4b

4.7B · Q4_K_M · 3.16 GiB
0.611
代码0.300核心0.611长上下文0.250医疗0.500OCR0.100推理0.300工具0.625翻译0.533视觉0.125
推荐用途
4B 级通用、工具和轻量多模态候选。
注意事项
16 次 final 前截断;长输出必须显式控制。
completion · thinking · tools · vision官方来源
通用候选

granite4.1:8b

8.8B · Q4_K_M · 4.98 GiB
0.569
代码0.375核心0.569长上下文0.250工具0.500翻译0.967
推荐用途
稳定的多语言通用助手与企业文本任务候选。
注意事项
代码与工具表现中等,不是本机这两项的第一选择。
completion · tools官方来源
推理候选

olmo-3:7b-think

7.3B · Q4_K_M · 4.17 GiB
0.569
代码0.750核心0.569长上下文0.250推理0.430翻译0.600
推荐用途
允许较长等待时的代码与推理研究。
注意事项
7 次 final 前截断和 1 次超时,不适合时间敏感交互。
completion · thinking官方来源
视觉/多模态候选

qwen3-vl:8b

8.8B · Q4_K_M · 5.72 GiB
0.569
代码0.863核心0.569长上下文0.250OCR0.100推理0.400工具0.750翻译0.700视觉0.125
推荐用途
当前代码与工具任务很强的多模态候选。
注意事项
视觉仅 0.125,且有超时与 final 前截断;不要因模型名假定视觉可靠。
completion · thinking · tools · vision官方来源
通用候选

olmo-3:7b-instruct

7.3B · Q4_K_M · 4.17 GiB
0.528
代码0.250核心0.528长上下文0.250工具0.500翻译0.933
推荐用途
开放研究、通用文本和翻译的可解释对照。
注意事项
代码 0.250,综合表现未达到本轮最强组。
completion · tools官方来源
视觉/多模态候选

ministral-3:8b

8.9B · Q4_K_M · 5.61 GiB
0.486
代码0.512核心0.486长上下文0.250OCR0.000工具0.625翻译0.967视觉0.125
推荐用途
均衡的多语言、代码、工具和多模态候选。
注意事项
视觉绝对分只有 0.125,速度也不占优。
completion · tools · vision官方来源
通用候选

rnj-1

8.3B · Q4_K_M · 4.76 GiB
0.403
代码0.675核心0.403长上下文0.250工具0.625翻译0.933
推荐用途
响应快、适合代码、STEM 和翻译的实用模型。
注意事项
核心只有 0.403,仍需强提示和结果校验。
completion · tools官方来源
多模态/通用候选

gemma3n:e4b

6.9B · Q4_K_M · 7.03 GiB
0.361
代码0.000核心0.361翻译0.833
推荐用途
轻量翻译、摘要和普通文本任务。
注意事项
代码为 0,当前清单也未确认其多模态执行能力。
无适用分数官方来源
通用候选

granite4:7b-a1b-h

6.9B · Q4_K_M · 3.94 GiB
0.361
代码0.600核心0.361长上下文0.250工具0.625翻译0.917
推荐用途
速度优先的代码、翻译和工具调用候选。
注意事项
通用核心分仅 0.361,且精确上游制品映射仍需确认。
completion · tools官方来源
通用候选

mistral:7b

7.2B · Q4_K_M · 4.07 GiB
0.361
代码0.350核心0.361长上下文0.000工具0.250翻译0.900
推荐用途
稳定的传统 7B 多语言基线。
注意事项
工具 0.250、长上下文 0,已被更新模型在多项任务超过。
completion · tools官方来源
通用候选

Phi-4-mini GGUF

3.84B · Q4_K_M · 2.32 GiB
0.361
代码0.237核心0.361长上下文0.250工具0.000翻译0.800
推荐用途
低占用普通问答和翻译备选。
注意事项
代码 0.237、工具 0,复杂任务收益有限。
completion · tools官方来源
通用候选

llama3.2:3b

3.2B · Q4_K_M · 1.88 GiB
0.278
代码0.613核心0.278长上下文0.250工具0.625翻译0.867
推荐用途
轻量代码、工具调用和多语言文本。
注意事项
核心 0.278,复杂指令可靠性有限。
completion · tools官方来源
通用候选

phi4-mini

3.8B · Q4_K_M · 2.32 GiB
0.278
代码0.113核心0.278长上下文0.250医疗0.167工具0.000翻译0.833
推荐用途
快速普通文本与翻译备选。
注意事项
核心 0.278、代码 0.113、工具 0。
completion · tools官方来源
通用候选

smollm2:1.7b

1.7B · Q8_0 · 1.70 GiB
0.236
代码0.450核心0.236长上下文0.000工具0.125翻译0.783
推荐用途
低资源文本生成、翻译和简单代码草案。
注意事项
核心和工具较弱,并出现 5 次工具循环上限。
completion · tools官方来源
视觉/多模态候选

Granite Vision 4B

3.4B · Q4_K_M · 3.04 GiB
0.194
代码0.250核心0.194长上下文0.250OCR0.100工具0.000翻译0.883视觉0.125
推荐用途
轻量文档视觉集成实验和翻译。
注意事项
视觉 0.125、OCR 0.100,当前任务上未复现强文档理解。
completion · tools · vision官方来源
推理候选

deepseek-r1:8b

8.2B · Q4_K_M · 4.87 GiB
0.167
代码0.750核心0.167长上下文0.250推理0.400工具0.125翻译0.950
推荐用途
适合容忍等待时间的代码与翻译辅助。
注意事项
2 次绝对超时、9 个运行异常及多次截断,不适合稳定交互默认模型。
completion · thinking · tools官方来源
推理候选

deepscaler:1.5b

1.8B · F16 · 3.32 GiB
0.139
代码0.613核心0.139长上下文0.000推理0.453工具0.000翻译0.717
推荐用途
快速推理或代码草案的低成本候选。
注意事项
通用、工具与长上下文结果弱;有 3 次截断。
completion · thinking · tools官方来源
通用候选

MiniCPM5-1B

1.1B · Q4_K_M · 0.64 GiB
0.139
代码0.688核心0.139长上下文0.000推理0.230工具0.500翻译0.850
推荐用途
超轻量、极高吞吐的代码和翻译候选。
注意事项
核心与推理较弱,并有 9 次截断和 2 次工具循环上限。
completion · thinking · tools官方来源
视觉/多模态候选

minicpm-v4.6

752.16M · Q4_K_M · 1.52 GiB
0.097
代码0.087核心0.097长上下文0.000OCR0.000推理0.400工具0.500翻译0.933视觉0.000
推荐用途
极快的翻译和轻量文本候选。
注意事项
视觉/OCR 为 0,且本地参数元数据存在身份异常。
completion · thinking · tools · vision官方来源
推理候选

phi4-mini-reasoning

3.8B · Q4_K_M · 2.94 GiB
0.097
代码0.362核心0.097长上下文0.000推理0.400工具0.125翻译0.700
推荐用途
数学推理实验和轻量离线分析。
注意事项
9 次截断,核心、代码和工具表现均有限。
completion · tools官方来源
通用候选

SmolLM3-3B

3.08B · Q4_K_M · 1.81 GiB
0.097
代码0.125核心0.097长上下文0.000推理0.300工具0.000翻译0.850
推荐用途
小体积、快速翻译和轻量文本处理。
注意事项
核心、代码和工具表现弱,不宜承担复杂 Agent 工作。
completion · thinking · tools官方来源
通用候选

lfm2.5:8b

8.5B · Q4_K_M · 4.80 GiB
0.072
代码0.375核心0.072长上下文0.000推理0.500工具0.750翻译0.883
推荐用途
速度优先的工具调用与推理候选。
注意事项
核心仅 0.072、长上下文为 0,不适合作为通用默认模型。
completion · thinking · tools官方来源
推理候选

DS-R1-Qwen3-8B

8.19B · Q4_K_M · 4.68 GiB
0.000
代码0.613核心0.000长上下文0.000推理0.430工具0.000翻译0.917
推荐用途
离线推理或代码草案,适合允许失败重试的研究场景。
注意事项
核心为 0,2 次绝对超时、7 个异常和 13 次截断。
completion · thinking · tools官方来源

RUNTIME EVIDENCE

稳定性是能力的一部分,但不是能力分本身

本轮没有基础设施未完成记录;超时和截断保留为模型在固定 practical-local boundary 下的运行表现。

7绝对超时
104截断相关记录
19运行异常
0未解决评分错误
05

以后新增模型,不重跑原来的 39 个

拉取新模型后记录 digest,显式选择可比能力分配,只跑适用冻结赛道,再导出新的脱敏结果。

  1. 1

    检查真实 metadata 与 digest

  2. 2

    选择已有可比 assignment

  3. 3

    逐题保存 raw 与 checkpoint

  4. 4

    离线评分并验证

  5. 5

    追加脱敏公开结果