BENCHMARK 1.0 · RC1 PRACTICAL SNAPSHOT

39 个本地模型,
在同一台电脑上说话。

一份关于小模型真实本地可用性的可复现记录。严格基线保持不变,默认展示实用离线重评与被选中的定向恢复证据,并拒绝用一个万能总分掩盖不同生态位。

01

先给结论,再看榜单

Qwen3-8B Q4 与 Qwen3-VL 8B 是当前最均衡的通用参考;真正的答案仍取决于任务。

01

通用与 Agent

Qwen3-8B Q4 与 Qwen3-VL 都达到 Core 0.879、Tools 0.909;后者 Code 0.890。

02

高质量文本

Gemma4 E4B 与 Qwen3.5 9B 适合通用和长上下文,但代码侧表现不同。

03

速度优先

Granite4 7B-A1B、LFM2.5 与 MiniCPM5 很快,但不能把吞吐当成能力。

04

专用工作

Qwen3 Embedding、Granite Guardian 与 OCR 模型必须结合完成率在原生生态位内解释。

02

为什么没有一张“万能总榜”

Benchmark 的目标不是复刻厂商 leaderboard,而是回答:这些模型在这台普通本地电脑上,实际能做什么?

分赛道

Core、推理、代码、工具、视觉、OCR、嵌入与安全分别比较,不惩罚不适用能力。

证据分层

不可变 raw、归一化解释、评分器输出与展示报告彼此分离,评分更新无需重新推理。

实用边界

超时、截断和没有 final answer 是本机可用性证据;网络或服务失败绝不算能力 0 分。

身份稳定

版本、manifest hash、模型 digest、profile 和 task ID 共同定义一条结果,修订版不会覆盖旧证据。

03

各赛道分别看,才不会误导

每个分数是实用评分的 0–1 赛道均值;排序同时考虑完成率。Coverage、完成率与样本数必须一起阅读。

核心gemma4:e4b · Qwen3-8B Q4 · Falcon-H1R-7B · ministral-3:8b · qwen3-vl:8b · qwen3.5:9b0.87924 records · 100% complete
推理deepscaler:1.5b · gemma4:e4b · Qwen3-8B Q4 · Falcon-H1R-7B · SmolLM3-3B · DS-R1-Qwen3-8B · lfm2.5:8b · minicpm-v4.6 · nemotron-3-nano:4b · MiniCPM5-1B · ornith:9b · phi4-mini-reasoning · qwen3.5:9b0.80010 records · 100% complete
代码olmo-3:7b-think0.9008 records · 100% complete
翻译gemma4:e4b · Qwen3-8B Q4 · qwen3-vl:8b1.0006 records · 100% complete
工具Qwen3-8B Q4 · lfm2.5:8b · minicpm-v4.6 · qwen3-vl:8b0.9098 records · 100% complete
视觉qwen3-vl:8b1.0008 records · 100% complete
OCRdeepseek-ocr0.79210 records · 100% complete
长上下文deepscaler:1.5b · deepseek-r1:8b · gemma4:e4b · granite4.1:8b · granite4:7b-a1b-h · Granite Vision 4B · Qwen3-8B Q4 · Falcon-H1R-7B · SmolLM3-3B · Phi-4-mini GGUF · lfm2.5:8b · llama3.2:3b · minicpm-v4.6 · ministral-3:8b · nemotron-3-nano:4b · olmo-3:7b-instruct · MiniCPM5-1B · phi4-mini-reasoning · phi4-mini · qwen3-vl:8b · qwen3.5:4b · qwen3.5:9b · rnj-11.0004 records · 100% complete
嵌入qwen3-embedding1.00012 records · 100% complete
安全granite4.1-guardian:8b1.00020 records · 100% complete
医疗nemotron-3-nano:4b · qwen3.5:4b · qwen3.5:9b0.8006 records · 100% complete
04

39 个模型逐一查看

筛选生态位或赛道,查看官方定位、本机实际得分、推荐用途和风险。Retention 仍为 UNASSESSED。

当前显示 29 个模型

通用候选

Falcon-H1R-7B

7.59B · Q4_K_M · 4.28 GiB
0.879
代码0.500100% ✓核心0.879100% ✓长上下文1.000100% ✓医疗0.781100% ✓推理0.800100% ✓工具0.907100% ✓翻译0.950100% ✓
推荐用途
推理、通用与医疗文本的稳健对照模型。
注意事项
代码为 0.500,且性能慢于若干 4B/混合架构模型。
completion · thinking · tools官方来源 ↗
视觉/多模态候选

gemma4:e4b

8.0B · Q4_K_M · 8.95 GiB
0.879
代码0.200100% ✓核心0.879100% ✓长上下文1.000100% ✓OCR0.143100% ✓推理0.800100% ✓工具0.905100% ✓翻译1.000100% ✓视觉0.875100% ✓
推荐用途
本机通用、翻译和长上下文任务的首选之一。
注意事项
实用重评后代码仍仅 0.200;应按文本/长上下文优势使用。
audio · completion · thinking · tools · vision官方来源 ↗
视觉/多模态候选

ministral-3:8b

8.9B · Q4_K_M · 5.61 GiB
0.879
代码0.585100% ✓核心0.879100% ✓长上下文1.000100% ✓OCR0.548100% ✓工具0.876100% ✓翻译0.967100% ✓视觉0.750100% ✓
推荐用途
均衡的多语言、代码、工具和多模态候选。
注意事项
视觉为 0.750,仍受 8 条小型夹具限制,速度也不占优。
completion · tools · vision官方来源 ↗
通用候选

Qwen3-8B Q4

8.19B · Q4_K_M · 4.68 GiB
0.879
代码0.700100% ✓核心0.879100% ✓长上下文1.000100% ✓推理0.800100% ✓工具0.909100% ✓翻译1.000100% ✓
推荐用途
当前最适合作为默认本地通用/Agent 基线的模型。
注意事项
长上下文实用分 1.000,但只有 4 条夹具且仍有 2 次截断。
completion · thinking · tools官方来源 ↗
视觉/多模态候选

qwen3-vl:8b

8.8B · Q4_K_M · 5.72 GiB
0.879
代码0.890100% ✓核心0.879100% ✓长上下文1.000100% ✓OCR0.723100% ✓推理0.700100% ✓ · R1工具0.909100% ✓翻译1.000100% ✓ · R2视觉1.000100% ✓
推荐用途
当前代码、工具与视觉最均衡的多模态候选。
注意事项
仍有 1 次超时和 1 次截断;视觉 1.000 只代表 8 条小型夹具。
completion · thinking · tools · vision官方来源 ↗
视觉/多模态候选

qwen3.5:9b

9.7B · Q4_K_M · 6.14 GiB
0.879
代码0.410100% ✓ · R1核心0.879100% ✓ · R1长上下文1.000100% ✓医疗0.800100% ✓OCR0.658100% ✓ · R2推理0.800100% ✓ · R1工具0.904100% ✓翻译0.967100% ✓ · R3视觉0.875100% ✓ · R1
推荐用途
通用和长上下文任务的高质量候选。
注意事项
9 条恢复结果全部形成可评分输出;代码 0.410 仍弱于同级代码候选。
completion · thinking · tools · vision官方来源 ↗
视觉/多模态候选

minicpm-v4.6

752.16M · Q4_K_M · 1.52 GiB
0.863
代码0.220100% ✓核心0.863100% ✓长上下文1.000100% ✓OCR0.463100% ✓推理0.800100% ✓工具0.909100% ✓翻译0.933100% ✓视觉0.750100% ✓
推荐用途
极快的翻译和轻量文本候选。
注意事项
视觉 0.750、OCR 0.463,但本地参数元数据仍存在身份异常。
completion · thinking · tools · vision官方来源 ↗
通用候选

granite4.1:8b

8.8B · Q4_K_M · 4.98 GiB
0.844
代码0.500100% ✓核心0.844100% ✓长上下文1.000100% ✓工具0.884100% ✓翻译0.967100% ✓
推荐用途
稳定的多语言通用助手与企业文本任务候选。
注意事项
代码与工具表现中等,不是本机这两项的第一选择。
completion · tools官方来源 ↗
视觉/多模态候选

qwen3.5:4b

4.7B · Q4_K_M · 3.16 GiB
0.844
代码0.440100% ✓ · R1核心0.844100% ✓ · R1长上下文1.000100% ✓医疗0.800100% ✓OCR0.744100% ✓ · R5推理0.62580% ✓工具0.886100% ✓翻译0.967100% ✓ · R3视觉0.875100% ✓ · R4
推荐用途
4B 级通用、工具和轻量多模态候选。
注意事项
定向恢复选用了 14 条改善结果,但仍有 2 次 final 前截断;长输出需控制。
completion · thinking · tools · vision官方来源 ↗
通用候选

lfm2.5:8b

8.5B · Q4_K_M · 4.80 GiB
0.838
代码0.500100% ✓核心0.838100% ✓长上下文1.000100% ✓推理0.800100% ✓工具0.909100% ✓翻译0.883100% ✓
推荐用途
速度优先的工具调用与推理候选。
注意事项
实用 Core 0.838、Tools 0.909,但仍需用更大题集验证泛化。
completion · thinking · tools官方来源 ↗
通用候选

olmo-3:7b-instruct

7.3B · Q4_K_M · 4.17 GiB
0.832
代码0.400100% ✓核心0.832100% ✓长上下文1.000100% ✓工具0.822100% ✓翻译0.933100% ✓
推荐用途
开放研究、通用文本和翻译的可解释对照。
注意事项
代码 0.400,综合表现仍未达到本轮最强组。
completion · tools官方来源 ↗
通用候选

rnj-1

8.3B · Q4_K_M · 4.76 GiB
0.829
代码0.590100% ✓核心0.829100% ✓长上下文1.000100% ✓工具0.889100% ✓翻译0.933100% ✓
推荐用途
响应快、适合代码、STEM 和翻译的实用模型。
注意事项
实用 Core 0.829,但仍需强提示和结果校验。
completion · tools官方来源 ↗
多模态/通用候选

gemma3n:e4b

6.9B · Q4_K_M · 7.03 GiB
0.827
代码0.200100% ✓核心0.827100% ✓翻译0.833100% ✓
推荐用途
轻量翻译、摘要和普通文本任务。
注意事项
代码仅 0.200,当前清单也未确认其多模态执行能力。
无适用分数官方来源 ↗
推理候选

phi4-mini-reasoning

3.8B · Q4_K_M · 2.94 GiB
0.827
代码0.415100% ✓核心0.827100% ✓长上下文1.000100% ✓推理0.800100% ✓工具0.487100% ✓翻译0.700100% ✓
推荐用途
数学推理实验和轻量离线分析。
注意事项
仍保留多次截断证据;实用分改善不等于时间敏感任务稳定。
completion · tools官方来源 ↗
通用候选

nemotron-3-nano:4b

4.0B · Q4_K_M · 2.64 GiB
0.808
代码0.600100% ✓核心0.808100% ✓长上下文1.000100% ✓医疗0.800100% ✓推理0.800100% ✓工具0.82688% ✓翻译0.733100% ✓
推荐用途
4B 级通用、医疗文本和中速 Agent 任务的优先候选。
注意事项
翻译较弱且出现 1 次未知工具调用;医疗结果不代表临床安全。
completion · thinking · tools官方来源 ↗
通用候选

ornith:9b

9.0B · Q4_K_M · 5.24 GiB
0.808
代码0.810100% ✓核心0.808100% ✓长上下文0.500100% ✓推理0.800100% ✓工具0.884100% ✓翻译0.933100% ✓
推荐用途
代码、通用和翻译任务的强力本地候选。
注意事项
推理实用分 0.800,但尚未匹配到可信的精确官方模型卡。
completion · thinking · toolsSource unresolved
推理候选

deepscaler:1.5b

1.8B · F16 · 3.32 GiB
0.802
代码0.665100% ✓核心0.802100% ✓长上下文1.000100% ✓推理0.800100% ✓工具0.479100% ✓翻译0.717100% ✓
推荐用途
快速推理或代码草案的低成本候选。
注意事项
工具表现偏弱,且仍有 3 次截断;复杂 Agent 任务需复核。
completion · thinking · tools官方来源 ↗
通用候选

MiniCPM5-1B

1.1B · Q4_K_M · 0.64 GiB
0.802
代码0.725100% ✓核心0.802100% ✓长上下文1.000100% ✓推理0.800100% ✓工具0.891100% ✓ · R2翻译0.850100% ✓
推荐用途
超轻量、极高吞吐的代码和翻译候选。
注意事项
实用重评表现明显改善,但仍有 2 次截断;超轻量优势不等于复杂任务可靠性。
completion · thinking · tools官方来源 ↗
推理候选

olmo-3:7b-think

7.3B · Q4_K_M · 4.17 GiB
0.837
代码0.900100% ✓ · R1核心0.83796% ✓长上下文1.00075% ✓推理0.77890% ✓翻译0.850100% ✓ · R2
推荐用途
允许较长等待时的代码与推理研究。
注意事项
宽松恢复后仍有 2 次 final 前截断和 1 次超时,不适合时间敏感交互。
completion · thinking官方来源 ↗
通用候选

SmolLM3-3B

3.08B · Q4_K_M · 1.81 GiB
0.756
代码0.125100% ✓核心0.756100% ✓长上下文1.000100% ✓推理0.800100% ✓工具0.482100% ✓翻译0.850100% ✓
推荐用途
小体积、快速翻译和轻量文本处理。
注意事项
核心、代码和工具表现弱,不宜承担复杂 Agent 工作。
completion · thinking · tools官方来源 ↗
通用候选

llama3.2:3b

3.2B · Q4_K_M · 1.88 GiB
0.748
代码0.615100% ✓核心0.748100% ✓长上下文1.000100% ✓工具0.820100% ✓翻译0.867100% ✓
推荐用途
轻量代码、工具调用和多语言文本。
注意事项
实用 Core 0.748;复杂指令仍应结合工具与代码结果复核。
completion · tools官方来源 ↗
通用候选

mistral:7b

7.2B · Q4_K_M · 4.07 GiB
0.748
代码0.480100% ✓核心0.748100% ✓长上下文0.750100% ✓工具0.767100% ✓翻译0.900100% ✓
推荐用途
稳定的传统 7B 多语言基线。
注意事项
工具 0.767、长上下文 0.750;仍不是当前各赛道首选。
completion · tools官方来源 ↗
通用候选

Phi-4-mini GGUF

3.84B · Q4_K_M · 2.32 GiB
0.723
代码0.315100% ✓核心0.723100% ✓长上下文1.000100% ✓工具0.477100% ✓翻译0.800100% ✓
推荐用途
低占用普通问答和翻译备选。
注意事项
代码 0.315、工具 0.477,复杂任务仍需强校验。
completion · tools官方来源 ↗
视觉/多模态候选

Granite Vision 4B

3.4B · Q4_K_M · 3.04 GiB
0.702
代码0.300100% ✓核心0.702100% ✓长上下文1.000100% ✓OCR0.370100% ✓工具0.470100% ✓翻译0.883100% ✓视觉0.875100% ✓
推荐用途
轻量文档视觉集成实验和翻译。
注意事项
视觉 0.875、OCR 0.370;视觉选择题改善明显,但 OCR 仍不可靠。
completion · tools · vision官方来源 ↗
通用候选

granite4:7b-a1b-h

6.9B · Q4_K_M · 3.94 GiB
0.702
代码0.680100% ✓核心0.702100% ✓长上下文1.000100% ✓工具0.889100% ✓翻译0.917100% ✓
推荐用途
速度优先的代码、翻译和工具调用候选。
注意事项
实用 Core 为 0.702,但精确上游制品映射仍需确认。
completion · tools官方来源 ↗
通用候选

phi4-mini

3.8B · Q4_K_M · 2.32 GiB
0.611
代码0.240100% ✓核心0.611100% ✓长上下文1.000100% ✓医疗0.664100% ✓工具0.477100% ✓翻译0.833100% ✓
推荐用途
快速普通文本与翻译备选。
注意事项
核心 0.611、代码 0.240、工具 0.477,复杂 Agent 能力有限。
completion · tools官方来源 ↗
通用候选

smollm2:1.7b

1.7B · Q8_0 · 1.70 GiB
0.581
代码0.560100% ✓核心0.581100% ✓长上下文0.500100% ✓工具0.73275% ✓ · R3翻译0.783100% ✓
推荐用途
低资源文本生成、翻译和简单代码草案。
注意事项
工具恢复明显改善,但仍有 2 次工具循环上限;复杂 Agent 任务需限制轮次。
completion · tools官方来源 ↗
推理候选

deepseek-r1:8b

8.2B · Q4_K_M · 4.87 GiB
0.518
代码0.775100% ✓ · R1核心0.518100% ✓ · R2长上下文1.000100% ✓ · R1推理0.77890% ✓ · R1工具0.487100% ✓翻译0.950100% ✓
推荐用途
适合容忍等待时间的代码与翻译辅助。
注意事项
宽松恢复后仍有 1 次超时、1 次截断和 7 次流中断,不适合稳定交互默认模型。
completion · thinking · tools官方来源 ↗
推理候选

DS-R1-Qwen3-8B

8.19B · Q4_K_M · 4.68 GiB
0.429
代码0.665100% ✓核心0.429100% ✓长上下文0.750100% ✓推理0.800100% ✓工具0.485100% ✓翻译0.917100% ✓
推荐用途
离线推理或代码草案,适合允许失败重试的研究场景。
注意事项
实用 Core 仅 0.429,且原运行仍保留较多超时、异常与截断证据。
completion · thinking · tools官方来源 ↗

RUNTIME EVIDENCE

稳定性是能力的一部分,但不是能力分本身

严格基线没有基础设施缺口。50 条定向恢复只替换可评分且更好的派生结果,原始证据始终保留。

50定向恢复记录
39被选用的恢复结果
6仍无可评分 final 的能力任务
0基础设施未完成
05

以后新增模型,不重跑原来的 39 个

拉取新模型后记录 digest,显式选择可比能力分配,只跑适用冻结赛道,再导出新的脱敏结果。

  1. 1

    检查真实 metadata 与 digest

  2. 2

    选择已有可比 assignment

  3. 3

    逐题保存 raw 与 checkpoint

  4. 4

    离线评分并验证

  5. 5

    追加脱敏公开结果