工具哇!

OCR 文字识别

免费的文字在线识别工具,支持多场景下的文字检测识别,能识别所有常用字和大部分生僻字

OCR 文字识别
点击选择,或将图片拖拽到此处
支持 JPG / PNG / WEBP / BMP,也可直接 Ctrl+V 粘贴截图
使用说明

OCR 文字识别

上传一张包含文字的图片,工具会在你的浏览器本地完成文字识别,自动提取图中的文字内容。整个过程在本地进行,图片不会上传到任何服务器,安全又保护隐私。

使用方法

  1. 点击上传区域,或将图片拖拽到上传框中;也可以直接按 Ctrl + V 粘贴截图。
  2. 在「识别选项」中选择 OCR 引擎
    • Tesseract.js(多语言):支持约 130 种语言,包含中文、英文、日语、韩语等;首次识别某语言需联网下载语言包。
    • PaddleOCR(本地·中文):使用本地内置的中文模型,专为中文场景优化,首次识别需加载本地模型。
  3. 若选择 Tesseract.js,可在相邻下拉中选择识别语言。下拉分「常用语言」和「其他语言」两组,常用组含简体/繁体中文、中英文混合、英日韩法德西俄等;不常用的语言在「其他语言」里按需选择。(PaddleOCR 仅支持中文,选择后语言项会自动禁用。)
  4. 可按需勾选下方两个选项(均默认开启):
    • 标记文字区域:在图片上框选出识别到的每一个文字块。
    • 智能整理空格:自动去除识别结果中多余的空格,尤其是中文字与字之间被误插入的空格,让文本更整洁;英文单词之间的正常空格会保留。
  5. 图片加载后,点击「开始识别」按钮。
  6. 稍等片刻,识别出的文字会显示在下方文本框中。
  7. 点击「复制结果」可一键复制,点击「下载 TXT」可保存为文本文件。

支持的功能

  • 多种图片格式:JPG、PNG、WEBP、BMP 等。
  • 点击、拖拽、粘贴三种上传方式。
  • 双引擎可选:Tesseract.js(约 130 种语言)与 PaddleOCR(中文本地模型),可按图片特点切换。
  • 丰富的语言选择:常用语言快速选取,其他小语种一应俱全。
  • 「标记文字区域」可在图片上框选出识别到的每一个文字块。
  • 「智能整理空格」自动清理多余空格,中文排版更干净。
  • 识别结果可复制或下载,方便二次编辑。

支持的语言

Tesseract.js 引擎支持以下语言(括号内为语言代码,首次识别某语言需联网下载对应语言包):

语言 代码 语言 代码 语言 代码
简体中文 chi_sim 繁体中文 chi_tra 英语 eng
中英文混合 chi_sim+eng 日语 jpn 韩语 kor
法语 fra 德语 deu 西班牙语 spa
俄语 rus 葡萄牙语 por 阿拉伯语 ara
印地语 hin 越南语 vie 泰语 tha
南非荷兰语 afr 阿姆哈拉语 amh 阿萨姆语 asm
阿塞拜疆语 aze 阿塞拜疆语·西里尔 aze_cyrl 白俄罗斯语 bel
孟加拉语 ben 藏语 bod 波斯尼亚语 bos
布列塔尼语 bre 保加利亚语 bul 加泰罗尼亚语 cat
宿务语 ceb 捷克语 ces 切罗基语 chr
科西嘉语 cos 威尔士语 cym 丹麦语 dan
迪维希语 div 不丹语 dzo 希腊语 ell
中古英语 enm 世界语 epo 爱沙尼亚语 est
巴斯克语 eus 法罗语 fao 波斯语 fas
菲律宾语 fil 芬兰语 fin 法兰克语 frk
中古法语 frm 弗里西亚语 fry 苏格兰盖尔语 gla
爱尔兰语 gle 加利西亚语 glg 古希腊语 grc
古吉拉特语 guj 海地克里奥尔语 hat 希伯来语 heb
克罗地亚语 hrv 匈牙利语 hun 亚美尼亚语 hye
伊努克提图特语 iku 印尼语 ind 冰岛语 isl
意大利语 ita 古意大利语 ita_old 爪哇语 jav
卡纳达语 kan 格鲁吉亚语 kat 古格鲁吉亚语 kat_old
哈萨克语 kaz 高棉语 khm 吉尔吉斯语 kir
库尔德语 kmr 老挝语 lao 拉丁语 lat
拉脱维亚语 lav 立陶宛语 lit 卢森堡语 ltz
马拉雅拉姆语 mal 马拉地语 mar 马其顿语 mkd
马耳他语 mlt 蒙古语 mon 毛利语 mri
马来语 msa 缅甸语 mya 尼泊尔语 nep
荷兰语 nld 挪威语 nor 奥克语 oci
奥里亚语 ori 旁遮普语 pan 波兰语 pol
普什图语 pus 克丘亚语 que 罗马尼亚语 ron
梵语 san 僧伽罗语 sin 斯洛伐克语 slk
斯洛文尼亚语 slv 索马里语 som 索托语 sot
古西班牙语 spa_old 阿尔巴尼亚语 sqi 塞尔维亚语 srp
塞尔维亚语·拉丁 srp_latn 巽他语 sun 斯瓦希里语 swa
瑞典语 swe 鞑靼语 tat 泰米尔语 tam
泰卢固语 tel 塔吉克语 tgk 提格雷尼亚语 tir
汤加语 ton 土耳其语 tur 维吾尔语 uig
乌克兰语 ukr 乌尔都语 urd 乌兹别克语 uzb
乌兹别克语·西里尔 uzb_cyrl 意第绪语 yid 约鲁巴语 yor

提示:PaddleOCR 引擎仅支持中文,选择该引擎后语言下拉会自动禁用。

注意事项

  • Tesseract.js:识别引擎已内置,首次识别某一种语言时需从网络下载对应的语言包,请耐心等待;下载完成后再次识别会更快。语言种类较多,选择与图片实际语种匹配的选项,识别更准确。
  • PaddleOCR:使用本地内置的中文模型,首次识别需要加载模型文件,请稍候;之后识别会更快。
  • 图片越清晰、文字越端正,识别效果越好;过于模糊或倾斜的图片可能影响准确率。
  • 建议使用较新版本的 Chrome、Edge、Firefox 或 Safari。
  • 图片内容和识别过程均在本地完成,不会上传到服务器,适合处理包含敏感信息的图片。