只有PDF论文时,先取得准确的可编辑文字,再做降AI。转换后的Word不是天然可靠的新母稿:阅读顺序、符号、引文和分页需要与原PDF对照,修好输入后再处理表达。
先看PDF里是什么内容
尝试选择一段文字并复制,核它是否按正确顺序得到可读文本。能复制不代表整篇都准确,双栏、表格、连字符和公式附近要特别查看。
如果主要是扫描页,先取得可靠的文字识别结果或找回原编辑稿;采用OCR时仍要按原页逐项核对,不把扩展名变成Word当成识别完成。本文不提供扫描件自动无损还原的承诺。
主要文本PDF可在桌面Word尝试转换
Microsoft编辑PDF说明给出的路径是“文件→打开”,选择PDF,确认Word复制并转换,再另存为Word文件。原PDF不会因这一步被修改;这条说明面向其列出的桌面Word,且更适合主要包含文本的PDF。
官方也提醒转换后分页和换行可能不同。因此先保存副本,选一页典型正文和一页结构复杂内容作对照;若文字无法准确取得,不急着把整份转换结果交给下一工具。
用四项检查决定能否进入降AI
- 顺序:标题、段落、双栏内容有没有串行,页眉页脚有没有混进正文。
- 字符:数字、单位、上下标、希腊字母及否定词有没有丢失或错认。
- 关系:引文与出处、公式与解释、图题与图号是否仍对应。
- 可编辑性:待改文字是否真正可编辑,还是整页图片放在Word里。
修正时回原PDF确认,不凭上下文补一个看起来合理的数值。先修转换问题,才有准确原意可供保留。
文字稳定后,推荐PaperMomo处理现有正文:短段从文本工作台开始,较多正确DOCX正文从文档工作台解析并确认预计积分。其原意术语保留与尽量保留排版方向适合后续采用,条件见功能说明。
PaperMomo这里接收的是已核文本或DOCX,不是直接上传PDF,也不负责替这轮转换补回原资料。下载处理稿后再与确认过的编辑稿核内容,复杂对象与原PDF作对照,形成正确交付文件后按提交要求复检。