Qwen/Qwen3-VL-8B-Instruct
日常识图的起点。清晰的单题截图、常规公式和扫描 PDF,可先用它完成识别,对应「默认公式识图模型」。
识别后核对分式、上下标与符号;题目如何切分由后续拆题模型负责。
先选要做的事,再选对应的模型。
硅基流动:Qwen/Qwen3.8-27B;DeepSeek 官方:deepseek-flash只用硅基流动时可尝试 Qwen3.8-27B 拆题。若想使用 DeepSeek 系列,优先去官网配置 deepseek-flash;作者观察到硅基流动的 DeepSeek 更新相对较慢。
题目合并或遗漏:先缩短内容;希望进一步改善拆题效果,可用 Gemini 3.8 Flash 或 GPT 5.6 Luna 对照同一份样例。只调整解题模型不会改变拆题结果。
配置依据 MathBank v2.3.0 与本次本地新增预设整理;效果建议来自作者实际使用经验,并非统一测试集上的排名。先用小样例确认,再处理正式资料。
在同一个硅基流动账号下,用一份 API Key 调用不同模型。日常识图先用 Qwen-VL 8B,需要更好效果时尝试 32B;文本拆题与解题可尝试 Qwen3.8-27B。
首次导入 Word,可先配「试卷智能拆解模型」为 Qwen/Qwen3.8-27B 即可。要识别截图或扫描 PDF,再添加 Qwen/Qwen3-VL-8B-Instruct;需要生成解析时,再选择 Qwen/Qwen3.8-27B。各项的平台都选择硅基流动。
按作者的使用观察,硅基流动的 DeepSeek 型号更新相对较慢。因此,如果你想使用 DeepSeek 系列,建议优先在DeepSeek 官方平台获取 Key,选择官方提供的型号:日常拆题可用 deepseek-flash,解题可用 deepseek-v4-pro。
硅基流动适合在本指南中选择千问等模型。已有的 DeepSeek 配置可以继续核对使用,但官网与硅基流动属于两套服务,不能混用 Key 或模型 ID。查看具体填写方式 →
常规识图可以先用 Qwen-VL 8B,想改善效果可尝试 32B 或新增的 Qwen3.8-27B。保留名称中的 Qwen/ 或 deepseek-ai/ 前缀,不要直接套用 DeepSeek 官方平台的模型 ID。
Qwen/Qwen3-VL-8B-Instruct日常识图的起点。清晰的单题截图、常规公式和扫描 PDF,可先用它完成识别,对应「默认公式识图模型」。
识别后核对分式、上下标与符号;题目如何切分由后续拆题模型负责。
Qwen/Qwen3-VL-32B-Instruct希望获得更好的识别效果时可优先尝试。按作者使用经验,32B 相比 8B 整体表现更好,适合复杂公式、表格或较密集的版面。
用同一页原图对照结果,不能仅凭参数量保证每一题都正确。高级 TikZ 绘图优先参考下方 GPT / Gemini 方案。
Qwen/Qwen3.8-27B另一个值得尝试的识图与文本处理候选。作者在数学题库任务中反馈效果不错;可用于识图,也可对照测试拆题与解题。
Qwen3.8-27B 是本次本地更新新增的预设;已发布的 v2.3.0 包若还没有此项,可点击模型旁的“+”手动添加完整 ID。
deepseek-ai/DeepSeek-V4-Flash已有硅基流动配置时,可继续作为文本拆题与分类候选。新配置 DeepSeek 系列时,优先使用 DeepSeek 官网。
按作者观察,硅基流动的 DeepSeek 型号更新相对较慢;官方平台与此处的 Key、模型 ID 不同,不能混填。
deepseek-ai/DeepSeek-V4-Pro已有硅基流动配置时的文本解题候选。若专门使用 DeepSeek 系列,建议转到官方平台核对当前型号。
官网使用 deepseek-v4-pro;硅基流动使用带 deepseek-ai/ 前缀的 ID,并且不列入当前硅基流动 OCR 选项。
Qwen3.8-27B 是本次本地更新新增的预设;已发布的 v2.3.0 包若还没有此项,可点击模型旁的“+”手动添加完整 ID。 查看添加位置 →
8B 适合作为常规使用的起点。按作者使用经验,32B 整体效果更好;遇到复杂公式、表格或较密集的版面,可以直接尝试 32B。Qwen3.8-27B 也是作者反馈效果不错的候选,支持图片理解,可用同一页资料作对照。识图与拆题仍是两个独立设置。
原图模糊、缺半道题、内容太长时,先改善资料再换模型。PDF 缺配图仍按当前配图限制处理;换到 32B 不能替代手动核图。模型费用、权限和可用性以硅基流动控制台为准。
已有 DeepSeek 官方账号时,可用 deepseek-flash 识图、拆题与分类,解题尝试 deepseek-v4-pro。已有百炼账号,可用 qwen3.7-flash 做常规任务,解题或绘图尝试 qwen3.7-plus。不需要为了跟教程而重新注册所有平台。
deepseek-flash同一平台完成日常拆题、分类与图片识别的入门候选。
项目已接入其识图能力;先用单题验证账号与接口。
deepseek-v4-pro用于生成解析,尝试处理更复杂的数学推导。
当前项目不将它列为 DeepSeek 识图选项;解答仍需教师核对。
qwen3.7-flash当前百炼常规拆题、分类与 OCR 的默认候选。
先用小样例确认公式、题目边界和返回内容。
qwen3.7-plus解题与绘图的默认候选,也可用于识图和拆题对照。
绘图预览还依赖本地 LaTeX;更换模型后重新验证样例。
qwen3.8-max进阶解题、拆题与绘图的备选。
当前项目 OCR 预设未列入它,不据此判断模型本身的视觉能力。
作者目前日常使用 Gemini 3.8 Flash,认为它在题库处理中非常好用;GPT 5.6 Luna 也是推荐选择。如果常规模型不能满足要求,尤其遇到复杂公式、较难解析或精细绘图,可以尝试能力更强、对当前任务表现更好的模型。
gemini-3.8-flash作者目前日常使用的模型,在题库处理中体验很好。重视识别、题目整理与综合效果时可以优先尝试,也是 TikZ 绘图的推荐候选。
通过支持该模型的服务接入;中转站的实际模型 ID 可能带后缀,以该站说明为准。
官方模型说明 ↗gpt-5.6-luna作者推荐的另一种选择,可用于公式识别、拆题、生成解析,并优先用于较复杂的 TikZ 绘图需求。
官方支持图片输入;通过中转站使用时,还要确认该站的对应接口支持图片。
官方模型说明 ↗选择时同时考虑识别质量、推导完整性、响应速度与调用成本。用同一小样例对照,比只看模型名或价格更有参考价值。
按作者目前的使用经验,GPT 与 Gemini 更适合生成和修改数学几何图的 TikZ 源码;国内模型在这一块相对较弱,往往需要更多轮修正。因此,建议将「高级 TikZ 绘图模型」优先设置为 gemini-3.8-flash 或 gpt-5.6-luna,实际 ID 按服务商说明填写。
有参考图时,确认接口支持图片输入;生成后必须在本地编译预览,并核对位置、标注和几何关系。这不是调用图片生成模型直接画一张图片,也不能省略本地 LaTeX 环境。
GPT 与 Gemini 的官方服务可能受网络和服务地区等条件影响。使用第三方中转站前,先确认所需模型、图片输入与兼容接口都可用。软件的中转站 A/B 模型名称由用户填写,这些型号不属于固定内置选项。
查看 README 中的推广链接及风险说明 →。第三方的模型名称、价格与可用性不能仅凭本页作保证。
| 出现的情况 | 优先检查 |
|---|---|
| 图片里的字或公式读错 | 原图质量 → 提取方式 → 识图模型 |
| 文字完整,但题目合并或漏题 | 单次长度 → 拆题模型 |
| 题目完整,但推导或答案不正确 | 条件是否清晰 → 解题模型 |
| PDF 中的配图缺失 | 当前功能限制,改用原始 Word 或手动补图 |
| 密钥、权限或连接报错 | 配置和网络,先排查后再考虑模型 |