5 分钟快速上手 GOT-OCR2_0-4bit:在 Apple Silicon Mac 上跑通首个 OCR 任务

5 分钟快速上手 GOT-OCR2_0-4bit:在 Apple Silicon Mac 上跑通首个 OCR 任务
5 分钟快速上手 GOT-OCR2_0-4bit在 Apple Silicon Mac 上跑通首个 OCR 任务【免费下载链接】GOT-OCR2_0-4bit项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/GOT-OCR2_0-4bit想把图片里的文字一键变成可编辑文本GOT-OCR2_0-4bit正是为此而生的OCR 模型它把强大的 GOT-OCR 2.0 视觉大模型量化到 4-bit并转换为 MLX 格式专为Apple Silicon Mac本地推理优化。整个模型只有约457 MB、5.6 亿参数不需要 GPU 服务器M 系列芯片的 MacBook 就能流畅运行。这篇文章带你5 分钟跑通首个 OCR 任务从环境安装到识别出第一段文字全程无需联网 API。GOT-OCR2_0-4bit 是什么为什么值得一试简单说GOT-OCR2_0-4bit 是一个能看懂图片并输出文字的通用视觉语言模型它的前身是 stepfun-ai 发布的 GOT-OCR 2.0560M 参数。本项目在此基础上做了三件事特性说明 4-bit 量化权重压缩到 4-bit磁盘占用仅 457 MB MLX 适配原生跑在 Apple Silicon 上发挥 M 系列芯片性能 推理加速官方实测 4-bit 版本生成速度约 272 tok/sM 系列 Mac对新手最友好的一点是它不需要繁琐的配置一条命令即可完成 OCR 识别适合文档数字化、发票票据提取、表格转文本等日常场景。第一步准备环境2 分钟开始之前请确认你的电脑满足以下条件✅ Apple Silicon MacM1 / M1 Pro / M2 / M3 / M4 系列均可✅ 已安装 Python 3.9 及以上版本✅ 已安装pip包管理器然后克隆模型仓库并安装推理依赖git clone https://gitcode.com/hf_mirrors/mlx-community/GOT-OCR2_0-4bit cd GOT-OCR2_0-4bit pip install mlx-vlm 提示仓库根目录的 README.md 是官方使用说明config.json 记录了模型的量化参数4-bit、group size 64与网络结构想深入了解可以打开看看。第二步运行你的第一个 OCR 任务2 分钟准备一张包含文字的图片比如一张票据截图命名为document.png放在当前目录下然后执行python -m mlx_vlm generate \ --model mlx-community/GOT-OCR2_0-4bit \ --image document.png \ --prompt OCR: \ --max-tokens 1024命令说明--model指定模型首次运行会自动加载本地仓库中的权重--image要识别的图片路径--prompt识别指令纯文本识别用OCR:--max-tokens输出最大 token 数一般 1024 足够几秒钟后终端就会输出图片中的文字内容你的第一个本地 OCR 任务就完成了 两种指令模式纯文本与结构化输出GOT-OCR 2.0 不是聊天模型它只认两种口令用错会出现不符合预期的输出指令用途示例场景OCR:纯文本识别发票、合同、书籍扫描件OCR with format:结构化输出表格、数学公式、乐谱想要提取表格或公式时把--prompt换成OCR with format: 即可。识别结果会以 Markdown / LaTeX 等结构化格式返回方便直接二次编辑。第三步进阶用代码调用识别能力如果你希望把 OCR 能力集成到自己的脚本里可以参考 modeling_GOT.py 中实现的chat接口位于文件第 487 行附近它封装了完整的图片加载、提示词构造与生成逻辑。核心流程是用load_image读取图片根据识别类型纯文本 / 结构化拼装OCR:或OCR with format:提示词调用模型的generate方法输出结果视觉编码部分在 got_vision_b.py12 层 ViT 视觉塔分词器在 tokenization_qwen.py需要二次开发时可以按需查阅。常见问题与避坑指南1. 为什么识别结果包含奇怪字符 GOT 只接受OCR:和OCR with format:两种指令其他提示词属于分布之外会降低识别质量请严格按照上述格式输入。2. 4-bit 量化会影响准确率吗项目 README 给出了与 bf16 原始版本的对比4-bit 版本在字段、内容、数字三类指标上与原版差距极小字符错误率约 0.0116日常文档识别完全够用8-bit 版本甚至与原版输出字节级一致追求极致精度可以选用 8-bit 版本。3. 识别超慢或报错先确认你的 Mac 是 Apple Silicon 芯片且mlx-vlm已正确安装。另外README.md 中提到当前mlx-vlm需要支持 GOT-OCR 2.0 的版本如遇兼容问题请升级到最新版。4. 图片太大怎么办本项目在 1024×1024 的单图裁剪路径上测试最充分超大图片建议先裁剪再识别GOT 的细粒度区域识别按框 / 按颜色和多页识别属于进阶功能可在 README 的说明中进一步了解。总结GOT-OCR2_0-4bit 让Apple Silicon Mac用户用极低的成本获得了专业的本地 OCR 能力5.6 亿参数、457 MB 体积、一条命令完成识别无论是文档数字化还是表格提取都能轻松胜任。从本文的步骤出发你已经在 5 分钟内跑通了首个 OCR 任务。接下来试着用OCR with format:识别一张带表格的图片感受结构化输出的惊喜吧【免费下载链接】GOT-OCR2_0-4bit项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/GOT-OCR2_0-4bit创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

最新新闻

日新闻

周新闻

月新闻