Word 故障排查

扫描文件放进 Word 仍不能编辑?先做 OCR 再校对

扫描页插入 Word 后仍是一张图片,不能直接修改文字;应先用 OCR 提取字符,再重建段落、表格并逐项核对重要信息。

撰文: ToolboxHub 编辑部 资料核对日期: 4 分钟阅读 1630 字

扫描页放进 Microsoft Word 后,如果只能选中整张图片,光标不能落在字与字之间,说明 Word 得到的是像素,不是可编辑字符。正确流程是保留原扫描件,用 OCR 提取文字,再在新文档里重建结构并人工校对。

先确认问题是“图片”,不是 Word 被锁定

能拖动整页图片,却不能选中某个词,通常表示页面本来就是扫描图。先在副本中操作,尝试选中一小段文字;若始终只能选中一个图片对象,就不要继续寻找字体或修订设置。

例如一份盖章申请表看起来有标题、表格和签名,但这些内容可能全部压在一张图里。OCR 能尝试识别“申请日期”四个字,却不知道它属于哪个表格单元格,也不能证明印章、勾选框或手写数字识别正确。原扫描件应作为对照依据,OCR 结果只能先当作待校对稿。

涉及身份证件、合同、病历或账号时,还要先确认组织允许使用哪种处理方式。不要为了省一步,把受限制文件交给未经批准的服务。

多页资料优先用 OneNote 的官方 OCR 路径

Microsoft 当前文档列出的 OneNote OCR 适用于 OneNote for Microsoft 365、OneNote 2024、2021 和 2016。单张图片可以右键选择 Copy Text from Picture;文件打印输出包含多页图片时,可以复制当前页或全部页面的文字,再粘贴到 Word。

这个菜单不是 Word 的通用“扫描件转文档”按钮。Microsoft 还说明,图片复杂度、清晰度和文字量会影响处理速度;命令可能不会立刻出现,个别结果可能需要 24–48 小时。若界面与说明不同,先核对自己使用的是哪一版 OneNote,而不是反复点击 Word 中的图片。

复制到 Word 后只得到可编辑文字。标题样式、分页、表格边框、脚注和双栏阅读顺序仍需在 Word 中重新设置。

单张图片只需要文字时,可在浏览器中提取

只有一页图片、目标只是获得纯文本时,可以使用 OCR 图片转文字 选择简体中文或简体中文加英文。工具会在浏览器中加载 Tesseract.js 和语言模型,识别结果可复制,也可下载为 .txt。

这个 OCR 工具一次接收一张图片,不会打开 PDF 或 DOCX,也不会编辑 Word。它不能输出带样式的 Word 文件,不能保留表格、印章、签名、文本框和页码,更不能承诺原版排版。首次使用还需要下载所选语言模型,网络或浏览器资源受限时可能无法开始。

如果来源是多页 PDF,应按单位许可使用文档流程,或把允许处理的单页转换成清晰图片后逐页识别。把几页照片合成 PDF 的图片转 PDF 功能也不是 OCR,不能让图片里的字自动变为可编辑内容。

识别前先改善输入,别急着修输出

清晰、方向正确、语言选择匹配的图片更适合识别。先把页面旋转为正向,裁掉桌面、手指和相邻页面,保留完整文字边缘;不要把小字过度压缩,也不要为了“变清楚”而把浅色数字处理成一片白。

比如双栏通知混有一张三列表格,可以先分别裁出正文和表格区域。正文按正常阅读顺序识别,表格则逐行核对后在 Word 里重新建表。中英混排时选择组合语言;若页面主要是数字和符号,仍要对日期、负号、小数点、字母 O 与数字 0 做专项检查。

手写体、低对比复印件、弯曲书页和遮挡文字的印章属于高风险输入。遇到这些情况,缩小识别范围或直接人工录入,往往比把错误结果批量带进 Word 更安全。

在 Word 中重建,并按高风险字段校对

粘贴文字后,先保存一个明确标注“转写稿”的 Word 副本,再恢复标题、段落、列表和表格。不要一开始就追求版面完全相同;先保证文字内容与原扫描件一致,再处理格式。

校对可从会改变结论的字段开始:

  • 姓名、单位、地址和联系人;
  • 日期、金额、百分比、小数点及负号;
  • 合同编号、证件尾号和账号;
  • “不”“未”“除外”等容易漏掉的否定词;
  • 表格每一行与对应列,尤其是跨页表头。

完成后把扫描件与 Word 并排查看,从第一页、中间页和最后一页各抽查一段,再搜索一个独特名称和一组已知数字。需要核对字数时,Word 自己应作为完整文档的主计数;网页字数工具只能统计粘贴进去的纯文本,不能检查 DOCX,也不能证明 OCR 内容正确。

常见问题

为什么扫描页在 Word 里看得到却选不中字?

因为它通常是一张图片,Word 只能选中图片对象。必须先经过 OCR 得到字符,再粘贴到新文档中编辑。

OneNote 的 OCR 菜单为什么没有马上出现?

Microsoft 说明复杂度、清晰度和文字量会影响处理,命令可能延迟,个别结果可能需要 24–48 小时。先确认版本和图片质量,再决定是否改用其他获批流程。

OCR 能完整保留表格和印章吗?

不能。OCR 的主要输出是识别到的文字;表格关系、印章位置、签名、分页和样式都需要回到原扫描件人工确认并在 Word 重建。

ToolboxHub 会把 PDF 或 DOCX 直接改成可编辑 Word 吗?

不会。OCR 图片转文字只处理用户选择的单张图片并输出纯文本,不打开或编辑 PDF、DOCX,也不生成保持原排版的 Word 文件。

识别完以后最少要检查哪些内容?

至少核对姓名、日期、金额、编号、否定词和表格对应关系,并抽查首、中、末页面。正式交付前还应由了解原文件用途的人复核。

参考资料