
RapidOCR 完整上手指南从安装到多语言识别的三步路【免费下载链接】RapidOCR Awesome OCR multiple programing languages toolkits based on ONNX Runtime, OpenVINO, MNN, PaddlePaddle, TensorRT and PyTorch.项目地址: https://gitcode.com/GitHub_Trending/ra/RapidOCR一堆中英文混排的截图要变成可检索的文字时多数云识别服务会卡在数据不能出内网这一步。RapidOCR 解决的就是这个诉求一个完全开源、免费的多语言 OCR 库在本地离线完成文本检测、方向分类与识别支持中文、英文、日文、韩文等多种语言。项目速览它定位在哪 RapidOCR 把 PaddleOCR 系列的模型转换为可移植性更强的 ONNX 格式再用一层轻量的 Python 接口包起来。它内置 ONNX Runtime、OpenVINO、PaddlePaddle、PyTorch、TensorRT、MNN 六套推理引擎默认使用 ONNX RuntimeLinux、Windows、macOS 都能跑。相比直接引入完整的 PaddlePaddle 依赖栈好处是安装体积更小、部署更容易一条 pip 命令即可起步模型在首次运行时自动下载离线或内网场景也可以预先缓存模型目录。开箱即用中文与英文其余语言通过配置切换即可。最短路径装一次五行代码拿到文字 ⚡PyPI 包要求 Python 3.8 及以上普通 CPU 环境安装 onnxruntime 即可pip install rapidocr onnxruntime然后五行代码就能得到识别结果from rapidocr import RapidOCR engine RapidOCR() result engine(your_image.jpg) print(result.txts)输入可以是本地路径、网络 URL、numpy 数组或字节流输出对象带有框坐标boxes、文本txts、置信度scores并提供to_json()、to_markdown()、vis()三个转换方法。模型在首次调用时自动下载缓存位置可通过配置项model_root_dir调整。三个实战任务 从命令行跑一张图安装 PyPI 包后会带上rapidocr命令行入口rapidocr -img your_image.jpg --vis--vis会把画好检测框的可视化图片保存下来加--text_score 0.6可以在命令行直接调整置信度阈值过滤掉把握不大的结果。把识别结果导出成 Markdown 或 JSON文档数字化场景里通常需要的是文字而不是框result engine(doc.jpg) print(result.to_markdown()) # 按坐标还原近似原始排版 print(result.to_json()) # {box, txt, score} 结构化列表to_markdown()会把文本行按位置归组输出接近原文排版的 Markdownto_json()的结果是结构化列表方便直接交给下游程序消费。切换到日文或其他语言默认配置走的是中文识别模型。把包内自带的 配置文件 复制一份将Rec段的lang_type改成目标语言如japan再传给引擎engine RapidOCR(config_pathmy_config.yaml)default_models.yaml 里列出了全部可用模型japan、korean、latin、arabic、cyrillic、devanagari、th 等用到哪个就自动下载哪个无需手动维护模型文件。进阶能力一套配置加一组按次参数 引擎热替换。config.yaml 中 Det、Cls、Rec 三段各有独立的engine_type选项同一套流水线可以混合不同后端比如检测跑 ONNX Runtime、识别跑 TensorRT。docker/ 目录为每个引擎都提供了预构建镜像onnxruntime-cpu、onnxruntime-gpu、tensorrt、openvino、paddle、pytorch、mnnGPU 环境一条 make 命令就能拉起来。按次参数覆盖。临时调参不必改配置文件直接在调用时传入result engine( scan.jpg, use_clsFalse, # 跳过方向分类 text_score0.65, # 调高置信度阈值 return_word_boxTrue, # 额外返回词级框 )测试集里有一张日文样例图把识别模型切到japan后这类内容也能正常读出内部构造速览 核心代码集中在python/rapidocr/下模块边界清晰python/rapidocr/ch_ppocr_det/ — 文本检测负责定位文字区域python/rapidocr/ch_ppocr_cls/ — 方向分类处理倒置文字python/rapidocr/ch_ppocr_rec/ — 文本识别输出具体文字python/rapidocr/inference_engine/ — 六种推理引擎及各自的设备配置python/rapidocr/config.yaml — 默认配置开关、阈值、引擎参数调优与避坑建议 引擎选择普通 CPU 用默认 ONNX Runtime 即可NVIDIA GPU 可切 onnxruntime CUDA 或 tensorrt支持 fp16Intel CPU 适合 openvino。Docker 镜像已配好依赖环境能省去不少版本兼容问题。阈值调节text_score默认 0.5调高可减少噪声结果漏检明显时再调低或者配合检测段参数box_thresh、unclip_ratio一起微调。注意输入尺寸长边超过 2000 像素的图会被自动缩放边长小于 30 像素的图会被直接过滤。缩略图、严重模糊的截图别期望太高优先保证原图清晰。空结果不等于出错纯黑、纯白且无文字的图片返回空结果是正常行为。测试集里专门有一组这类坑图比如透明底黑字截图收尾从示例到你的项目 Radar 之外的最短路径其实就三件事装、调、拿文字而有更高要求时——换引擎、换语言、调阈值——都有对应的开关。克隆仓库跑一遍 python/demo.py就能完整走通一遍流程git clone https://gitcode.com/GitHub_Trending/ra/RapidOCR【免费下载链接】RapidOCR Awesome OCR multiple programing languages toolkits based on ONNX Runtime, OpenVINO, MNN, PaddlePaddle, TensorRT and PyTorch.项目地址: https://gitcode.com/GitHub_Trending/ra/RapidOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考