先把文字拍正、拍清
OCR 不是凭空猜字。裁掉大面积无关背景,避免反光和运动模糊,让文字至少有十几像素高,往往比盲目更换识别引擎更有效。无关区域很多时可先用图片裁剪保留文字主体。表格、双栏和弯曲页面仍可能需要手工整理顺序。
置信度不是正确率证明
置信度只反映引擎对当前结果的把握,不代表合同金额、姓名和编号一定正确。涉及关键数据时,要对照原图逐项复核。
从截图、扫描件和照片中提取印刷文字。游客可以先选图查看本地预览,登录后才下载固定的 PP-OCRv6 small 模型并开始识别;结果可复制或批量导出 TXT。
选文件和设置参数无需登录;开始处理、复制或导出结果时需要登录,成功后自动继续 —— 图片不会传到我们的服务器,全程在你自己的浏览器里跑,用多少次都行,不花任何算力。
(站里的 AI 功能是另一回事:PS 插件里的 AI 注册送 50 张; 网页上的 Image-2 生图 和 香蕉改图 按张计费、要买对应的积分包。 跟本页无关。)
先选清晰截图或扫描图片。登录前只显示最长边不超过 512px 的本地预览,不加载模型、不识别文字。
首次使用会从本站下载 PP-OCRv6 small 模型和浏览器推理核心(根据浏览器约 45–60MB),之后可被缓存。优先使用 WebGPU,不支持时自动切换 WASM。HEIC 会在本地等比缩到最长边不超过 4096px 且不超过浏览器 Canvas 面积上限;图片和识别文字不会上传。
识别后按文件展示文本与置信度,可复制或下载 TXT。
OCR 不是凭空猜字。裁掉大面积无关背景,避免反光和运动模糊,让文字至少有十几像素高,往往比盲目更换识别引擎更有效。无关区域很多时可先用图片裁剪保留文字主体。表格、双栏和弯曲页面仍可能需要手工整理顺序。
置信度只反映引擎对当前结果的把握,不代表合同金额、姓名和编号一定正确。涉及关键数据时,要对照原图逐项复核。
不会。PP-OCRv6 small 模型和浏览器推理核心由本站静态资源提供,下载进浏览器后在本机运行。图片、识别文字和文件名都不会进入处理接口或统计参数。
第一次需要下载固定的 PP-OCRv6 small 检测/识别模型和浏览器推理核心,根据浏览器约 45–60MB,之后通常会被浏览器缓存。页面会把模型加载和图片识别分开显示进度。
本工具主要面向清晰印刷体、截图和扫描件。手写体、艺术字、弯曲文字、严重反光和低分辨率图片的准确率不稳定,结果需要人工复核。