通用候选
Falcon-H1R-7B
7.59B · Q4_K_M · 4.28 GiB0.879代码0.500100% ✓核心0.879100% ✓长上下文1.000100% ✓医疗0.781100% ✓推理0.800100% ✓工具0.907100% ✓翻译0.950100% ✓
- 推荐用途
- 推理、通用与医疗文本的稳健对照模型。
- 注意事项
- 代码为 0.500,且性能慢于若干 4B/混合架构模型。
视觉/多模态候选
gemma4:e4b
8.0B · Q4_K_M · 8.95 GiB0.879代码0.200100% ✓核心0.879100% ✓长上下文1.000100% ✓OCR0.143100% ✓推理0.800100% ✓工具0.905100% ✓翻译1.000100% ✓视觉0.875100% ✓
- 推荐用途
- 本机通用、翻译和长上下文任务的首选之一。
- 注意事项
- 实用重评后代码仍仅 0.200;应按文本/长上下文优势使用。
视觉/多模态候选
ministral-3:8b
8.9B · Q4_K_M · 5.61 GiB0.879代码0.585100% ✓核心0.879100% ✓长上下文1.000100% ✓OCR0.548100% ✓工具0.876100% ✓翻译0.967100% ✓视觉0.750100% ✓
- 推荐用途
- 均衡的多语言、代码、工具和多模态候选。
- 注意事项
- 视觉为 0.750,仍受 8 条小型夹具限制,速度也不占优。
通用候选
Qwen3-8B Q4
8.19B · Q4_K_M · 4.68 GiB0.879代码0.700100% ✓核心0.879100% ✓长上下文1.000100% ✓推理0.800100% ✓工具0.909100% ✓翻译1.000100% ✓
- 推荐用途
- 当前最适合作为默认本地通用/Agent 基线的模型。
- 注意事项
- 长上下文实用分 1.000,但只有 4 条夹具且仍有 2 次截断。
视觉/多模态候选
qwen3-vl:8b
8.8B · Q4_K_M · 5.72 GiB0.879代码0.890100% ✓核心0.879100% ✓长上下文1.000100% ✓OCR0.723100% ✓推理0.700100% ✓ · R1工具0.909100% ✓翻译1.000100% ✓ · R2视觉1.000100% ✓
- 推荐用途
- 当前代码、工具与视觉最均衡的多模态候选。
- 注意事项
- 仍有 1 次超时和 1 次截断;视觉 1.000 只代表 8 条小型夹具。
视觉/多模态候选
qwen3.5:9b
9.7B · Q4_K_M · 6.14 GiB0.879代码0.410100% ✓ · R1核心0.879100% ✓ · R1长上下文1.000100% ✓医疗0.800100% ✓OCR0.658100% ✓ · R2推理0.800100% ✓ · R1工具0.904100% ✓翻译0.967100% ✓ · R3视觉0.875100% ✓ · R1
- 推荐用途
- 通用和长上下文任务的高质量候选。
- 注意事项
- 9 条恢复结果全部形成可评分输出;代码 0.410 仍弱于同级代码候选。
视觉/多模态候选
minicpm-v4.6
752.16M · Q4_K_M · 1.52 GiB0.863代码0.220100% ✓核心0.863100% ✓长上下文1.000100% ✓OCR0.463100% ✓推理0.800100% ✓工具0.909100% ✓翻译0.933100% ✓视觉0.750100% ✓
- 推荐用途
- 极快的翻译和轻量文本候选。
- 注意事项
- 视觉 0.750、OCR 0.463,但本地参数元数据仍存在身份异常。
通用候选
granite4.1:8b
8.8B · Q4_K_M · 4.98 GiB0.844代码0.500100% ✓核心0.844100% ✓长上下文1.000100% ✓工具0.884100% ✓翻译0.967100% ✓
- 推荐用途
- 稳定的多语言通用助手与企业文本任务候选。
- 注意事项
- 代码与工具表现中等,不是本机这两项的第一选择。
视觉/多模态候选
qwen3.5:4b
4.7B · Q4_K_M · 3.16 GiB0.844代码0.440100% ✓ · R1核心0.844100% ✓ · R1长上下文1.000100% ✓医疗0.800100% ✓OCR0.744100% ✓ · R5推理0.62580% ✓工具0.886100% ✓翻译0.967100% ✓ · R3视觉0.875100% ✓ · R4
- 推荐用途
- 4B 级通用、工具和轻量多模态候选。
- 注意事项
- 定向恢复选用了 14 条改善结果,但仍有 2 次 final 前截断;长输出需控制。
通用候选
lfm2.5:8b
8.5B · Q4_K_M · 4.80 GiB0.838代码0.500100% ✓核心0.838100% ✓长上下文1.000100% ✓推理0.800100% ✓工具0.909100% ✓翻译0.883100% ✓
- 推荐用途
- 速度优先的工具调用与推理候选。
- 注意事项
- 实用 Core 0.838、Tools 0.909,但仍需用更大题集验证泛化。
通用候选
olmo-3:7b-instruct
7.3B · Q4_K_M · 4.17 GiB0.832代码0.400100% ✓核心0.832100% ✓长上下文1.000100% ✓工具0.822100% ✓翻译0.933100% ✓
- 推荐用途
- 开放研究、通用文本和翻译的可解释对照。
- 注意事项
- 代码 0.400,综合表现仍未达到本轮最强组。
通用候选
rnj-1
8.3B · Q4_K_M · 4.76 GiB0.829代码0.590100% ✓核心0.829100% ✓长上下文1.000100% ✓工具0.889100% ✓翻译0.933100% ✓
- 推荐用途
- 响应快、适合代码、STEM 和翻译的实用模型。
- 注意事项
- 实用 Core 0.829,但仍需强提示和结果校验。
多模态/通用候选
gemma3n:e4b
6.9B · Q4_K_M · 7.03 GiB0.827代码0.200100% ✓核心0.827100% ✓翻译0.833100% ✓
- 推荐用途
- 轻量翻译、摘要和普通文本任务。
- 注意事项
- 代码仅 0.200,当前清单也未确认其多模态执行能力。
推理候选
phi4-mini-reasoning
3.8B · Q4_K_M · 2.94 GiB0.827代码0.415100% ✓核心0.827100% ✓长上下文1.000100% ✓推理0.800100% ✓工具0.487100% ✓翻译0.700100% ✓
- 推荐用途
- 数学推理实验和轻量离线分析。
- 注意事项
- 仍保留多次截断证据;实用分改善不等于时间敏感任务稳定。
通用候选
nemotron-3-nano:4b
4.0B · Q4_K_M · 2.64 GiB0.808代码0.600100% ✓核心0.808100% ✓长上下文1.000100% ✓医疗0.800100% ✓推理0.800100% ✓工具0.82688% ✓翻译0.733100% ✓
- 推荐用途
- 4B 级通用、医疗文本和中速 Agent 任务的优先候选。
- 注意事项
- 翻译较弱且出现 1 次未知工具调用;医疗结果不代表临床安全。
通用候选
ornith:9b
9.0B · Q4_K_M · 5.24 GiB0.808代码0.810100% ✓核心0.808100% ✓长上下文0.500100% ✓推理0.800100% ✓工具0.884100% ✓翻译0.933100% ✓
- 推荐用途
- 代码、通用和翻译任务的强力本地候选。
- 注意事项
- 推理实用分 0.800,但尚未匹配到可信的精确官方模型卡。
推理候选
deepscaler:1.5b
1.8B · F16 · 3.32 GiB0.802代码0.665100% ✓核心0.802100% ✓长上下文1.000100% ✓推理0.800100% ✓工具0.479100% ✓翻译0.717100% ✓
- 推荐用途
- 快速推理或代码草案的低成本候选。
- 注意事项
- 工具表现偏弱,且仍有 3 次截断;复杂 Agent 任务需复核。
通用候选
MiniCPM5-1B
1.1B · Q4_K_M · 0.64 GiB0.802代码0.725100% ✓核心0.802100% ✓长上下文1.000100% ✓推理0.800100% ✓工具0.891100% ✓ · R2翻译0.850100% ✓
- 推荐用途
- 超轻量、极高吞吐的代码和翻译候选。
- 注意事项
- 实用重评表现明显改善,但仍有 2 次截断;超轻量优势不等于复杂任务可靠性。
推理候选
olmo-3:7b-think
7.3B · Q4_K_M · 4.17 GiB0.837代码0.900100% ✓ · R1核心0.83796% ✓长上下文1.00075% ✓推理0.77890% ✓翻译0.850100% ✓ · R2
- 推荐用途
- 允许较长等待时的代码与推理研究。
- 注意事项
- 宽松恢复后仍有 2 次 final 前截断和 1 次超时,不适合时间敏感交互。
通用候选
SmolLM3-3B
3.08B · Q4_K_M · 1.81 GiB0.756代码0.125100% ✓核心0.756100% ✓长上下文1.000100% ✓推理0.800100% ✓工具0.482100% ✓翻译0.850100% ✓
- 推荐用途
- 小体积、快速翻译和轻量文本处理。
- 注意事项
- 核心、代码和工具表现弱,不宜承担复杂 Agent 工作。
通用候选
llama3.2:3b
3.2B · Q4_K_M · 1.88 GiB0.748代码0.615100% ✓核心0.748100% ✓长上下文1.000100% ✓工具0.820100% ✓翻译0.867100% ✓
- 推荐用途
- 轻量代码、工具调用和多语言文本。
- 注意事项
- 实用 Core 0.748;复杂指令仍应结合工具与代码结果复核。
通用候选
mistral:7b
7.2B · Q4_K_M · 4.07 GiB0.748代码0.480100% ✓核心0.748100% ✓长上下文0.750100% ✓工具0.767100% ✓翻译0.900100% ✓
- 推荐用途
- 稳定的传统 7B 多语言基线。
- 注意事项
- 工具 0.767、长上下文 0.750;仍不是当前各赛道首选。
通用候选
Phi-4-mini GGUF
3.84B · Q4_K_M · 2.32 GiB0.723代码0.315100% ✓核心0.723100% ✓长上下文1.000100% ✓工具0.477100% ✓翻译0.800100% ✓
- 推荐用途
- 低占用普通问答和翻译备选。
- 注意事项
- 代码 0.315、工具 0.477,复杂任务仍需强校验。
视觉/多模态候选
Granite Vision 4B
3.4B · Q4_K_M · 3.04 GiB0.702代码0.300100% ✓核心0.702100% ✓长上下文1.000100% ✓OCR0.370100% ✓工具0.470100% ✓翻译0.883100% ✓视觉0.875100% ✓
- 推荐用途
- 轻量文档视觉集成实验和翻译。
- 注意事项
- 视觉 0.875、OCR 0.370;视觉选择题改善明显,但 OCR 仍不可靠。
通用候选
granite4:7b-a1b-h
6.9B · Q4_K_M · 3.94 GiB0.702代码0.680100% ✓核心0.702100% ✓长上下文1.000100% ✓工具0.889100% ✓翻译0.917100% ✓
- 推荐用途
- 速度优先的代码、翻译和工具调用候选。
- 注意事项
- 实用 Core 为 0.702,但精确上游制品映射仍需确认。
通用候选
phi4-mini
3.8B · Q4_K_M · 2.32 GiB0.611代码0.240100% ✓核心0.611100% ✓长上下文1.000100% ✓医疗0.664100% ✓工具0.477100% ✓翻译0.833100% ✓
- 推荐用途
- 快速普通文本与翻译备选。
- 注意事项
- 核心 0.611、代码 0.240、工具 0.477,复杂 Agent 能力有限。
通用候选
smollm2:1.7b
1.7B · Q8_0 · 1.70 GiB0.581代码0.560100% ✓核心0.581100% ✓长上下文0.500100% ✓工具0.73275% ✓ · R3翻译0.783100% ✓
- 推荐用途
- 低资源文本生成、翻译和简单代码草案。
- 注意事项
- 工具恢复明显改善,但仍有 2 次工具循环上限;复杂 Agent 任务需限制轮次。
推理候选
deepseek-r1:8b
8.2B · Q4_K_M · 4.87 GiB0.518代码0.775100% ✓ · R1核心0.518100% ✓ · R2长上下文1.000100% ✓ · R1推理0.77890% ✓ · R1工具0.487100% ✓翻译0.950100% ✓
- 推荐用途
- 适合容忍等待时间的代码与翻译辅助。
- 注意事项
- 宽松恢复后仍有 1 次超时、1 次截断和 7 次流中断,不适合稳定交互默认模型。
推理候选
DS-R1-Qwen3-8B
8.19B · Q4_K_M · 4.68 GiB0.429代码0.665100% ✓核心0.429100% ✓长上下文0.750100% ✓推理0.800100% ✓工具0.485100% ✓翻译0.917100% ✓
- 推荐用途
- 离线推理或代码草案,适合允许失败重试的研究场景。
- 注意事项
- 实用 Core 仅 0.429,且原运行仍保留较多超时、异常与截断证据。