本地 AI 复习软件:导入资料,使用 Unlimited-OCR 识别 PDF/图片,再用本地 Qwen3.5-4B 生成题目、闪卡和复习队列。
当前主入口是 Python 桌面版,不需要下载前端依赖:
desktop_python\run_startthinking.bat如果系统提示没有 Python,可以安装 Python 3.11+,或者继续使用 Codex 自带 Python 路径运行:
C:\Users\hangi\.cache\codex-runtimes\codex-primary-runtime\dependencies\python\python.exe desktop_python\startthinking.py- 桌面壳:Python Tkinter(当前可运行主版本)
- 可选桌面壳:Electron(源码已保留,安装依赖后可继续升级)
- OCR:调用本机
baidu/Unlimited-OCR的infer.py - 本地大模型:Ollama,默认
qwen3.5:4b - 数据保存:
data/startthinking.json,资料和生成结果不上传云端
安装 Ollama 后拉取默认模型:
ollama pull qwen3.5:4bOllama 默认服务地址是:
http://127.0.0.1:11434
项目地址:
https://github.com/baidu/Unlimited-OCR
按官方 README 安装依赖和模型后,在 StartThinking 的“设置”里填写:
- Python:例如
python或你的虚拟环境 Python 路径 - Unlimited-OCR infer.py:例如
C:\AI\Unlimited-OCR\infer.py - OCR 并发:个人电脑建议先用
1或2
PDF 和图片导入时,软件会调用:
python infer.py --pdf <file> --output_dir <temp> --concurrency <n> --image_mode <mode>
图片会先放入临时目录,然后用 --image_dir 调用。
npm install
npm start如果 PowerShell 拦截 npm.ps1,用:
npm.cmd install
npm.cmd start- 直接读取 TXT / MD / CSV / JSON。
- PDF / PNG / JPG / JPEG / WEBP 会优先尝试 Unlimited-OCR。
- Windows 原生环境下,Unlimited-OCR 的 SGLang kernel 当前没有
win_amd64wheel;软件会自动回退到本地qwen3.5:4b视觉 OCR。 - 调用 Ollama
qwen3.5:4b生成单选题、填空题、简答题和闪卡。 - Ollama 或 Unlimited-OCR 不可用时,文本资料会回退到本地启发式生成。
- 按“忘记 / 模糊 / 记住 / 熟练”调整下次复习时间。
- 可导出本地 JSON 备份。
已提供脚本:
scripts\setup_unlimited_ocr.bat它会:
- 克隆
baidu/Unlimited-OCR到third_party/Unlimited-OCR - 创建
.venv-ocr - 安装 PDF 转图片和请求依赖
- 尝试安装 Unlimited-OCR 的 SGLang wheel
注意:官方 infer.py 走 SGLang。当前 Windows 原生环境会因为 sglang-kernel 缺少 Windows wheel 而无法完整安装 SGLang。要完整运行 Unlimited-OCR,建议后续使用 WSL2 Ubuntu 或 Linux/Docker 环境。当前软件已经做了可用后备:PDF 先转图片,再用本地 qwen3.5:4b 视觉能力提取文字。
默认使用 qwen3.5:4b,原因:
- 体积约 3.4GB,个人电脑更容易跑起来。
- 256K 上下文,适合长资料总结和出题。
- 中文、多语言、视觉能力都比普通小模型更适合学习资料处理。