Tips & Tricks

如何 OCR 包含乐谱或乐谱的 PDF

乐谱对光学字符识别提出了独特的挑战。标准 OCR 引擎旨在识别字母数字字符的水平线,而不是构成乐谱的五线谱线、音符头、符干、横梁、谱号和动态标记的复杂组合。当您将乐谱扫描成 PDF 时,您得到的是乐谱图像,而将该图像转换为可编辑、可播放的数字乐谱需要采用与在文本文档上运行 OCR 完全不同的方法。标准 OCR 提供的内容与音乐家所需的内容之间的差距足够大,以至于已经开发出整个子领域——光学音乐识别(OMR)来解决这个问题。

How to OCR a PDF That Contains Sheet Music or Musical Notation

为什么标准 OCR 工具无法处理乐谱

标准 OCR 软件可检测字母数字字符的水平线。当它遇到五线谱时,五条平行线会迷惑识别引擎。软件可能会将五线谱解释为表格边框、下划线或只是要过滤掉的噪音。音符头被误解为杂散点或斑点,茎被误解为垂直条,梁被误解为粗水平线。结果是混乱的输出,与原始乐谱没有相似之处。此故障并非 OCR 引擎质量低下的问题。这是类别不匹配:引擎是根据文本语料库而不是乐谱进行训练的,并且其关于字符构成的基本假设不适用。

当您考虑到典型的钢琴乐谱包含两个由大括号连接的五线谱、每个五线谱有多个声部、发音标记、连线、连线、力度和踏板标记时,复杂性就会成倍增加。完整的管弦乐乐谱添加了乐器名称、小节编号、排练标记和速度指示。这些元素均未映射到标准OCR PDF引擎所依赖的逐字符识别模型。每个音乐符号与五线谱都具有特定的空间关系,并且二维定位所承载的含义是一维逐行文本识别器无法捕获的。

乐谱还使用空间语法,没有等效的文本。音符头在五线谱上的垂直位置决定了它的音高。水平间距表示节奏持续时间。位于另一个四分音符右侧两英寸处的四分音符具有完全不同的音乐含义。专为文本设计的 OCR 工具没有解释这种二维语言的机制。即使是音乐雕刻中使用的高度专业化的字体,包含没有 Unicode 等效项的符号,也不属于标准 OCR 引擎经过训练可识别的字符集。

WukongPDF

尝试 PDF OCR

无需安装。直接在您的浏览器中工作。

立即开始 →

准备乐谱 PDF 以获得更好的 OCR 结果

在将乐谱 PDF 输入任何识别系统之前,一些准备步骤可以显着提高输出质量。首先确保您的扫描尽可能干净。 300 至 600 DPI 的分辨率是音乐 OCR 的理想选择。较低的分辨率会导致音符头和小发音标记模糊在一起,而过高的分辨率会放大纸张纹理和打印伪影,而不会提高识别精度。目标是获得清晰的图像,其中最小的有意义的符号(通常是断奏点或偶然的装饰音符)占据足够的像素以与噪声区分开。

如果您的 PDF 是根据照片而不是平板扫描仪创建的,请检查透视变形。以一定角度拍摄的页面的五线谱将不再完全水平,这会影响音乐 OCR 所依赖的五线谱线检测算法。在继续操作之前,请使用扫描软件或 PDF 编辑器中的倾斜校正功能来校正角度。整个页面宽度上即使只有 1 度的偏差也会使音符头位置移动足够的像素,从而导致音高错误识别。

删除不属于原始符号的所有标记。铅笔注释、咖啡渍、图书馆印章和打孔都会产生视觉噪音,识别引擎必须解决这些噪音。许多 PDF 编辑器都包含可以处理微小缺陷的清理或去斑滤镜。对于标记较多的乐谱,请考虑使用更清晰的副本(如果有)。在源质量上花费的额外努力在识别准确性方面得到了指数级的回报。经过适当的纠偏和去斑处理后的干净 400 DPI 扫描可实现比同一页面未经处理的照片高 30% 至 40% 的识别率。

音乐特定 OCR 技术的工作原理

音乐 OCR(有时称为光学音乐识别或 OMR)采用的多阶段方法远远超出了文本识别的范围。第一阶段是人员在线检测和清除。该软件识别每个员工的五条平行线,并使用霍夫变换或类似的线检测算法计算它们的精确位置。一旦找到,五线谱线就会以数学方式从图像中减去,只留下音乐符号。仅此一步就使音乐 OCR 与文本 OCR 根本不同,而且如果五线谱线弯曲、断裂或间距不均匀,这也是大多数错误产生的地方。

人员移除后,第二阶段对页面上剩余的每个标记进行分类。音符头通过其椭圆形状及其相对于五线谱线的位置来识别。茎被检测为附加到音符头的垂直线段。梁被认为是连接多个杆的粗水平或倾斜杆。升记号和降记号、谱号、拍号、休止符和发音记号等记号都有自己的识别模型,经过数千个示例的训练。现代 OMR 系统使用基于数字乐谱库生成的合成数据进行训练的卷积神经网络,使它们能够处理各种音乐雕刻风格(OMR 研究小组,利兹大学,2025 年)。

最后阶段是音乐解释,将识别的符号重新组合成连贯的乐谱。这包括当共享主干并垂直对齐时将音符分组为和弦,通过将音符头类型与旗、点和梁相结合来计算节奏值,并根据检测到的谱号和调号将音符头的垂直位置映射到特定音高。输出通常是 MusicXML 或 MIDI 文件,可以在 MuseScore、Sibelius 或 Finale 等记谱软件中打开。每个阶段都有自己的错误率和错误复合,因此符号分类准确率达到 95%、音乐解释准确率达到 90% 的系统会产生大约 85% 音符准确度的最终输出,但仍需要手动校正。

通过在线 OCR 工具运行乐谱

WukongPDF 的扫描 PDF OCR 功能可以处理乐谱 PDF 并提取底层文本元素,如标题、作曲家姓名、节奏标记和歌词。虽然它不会将记谱转换为 MusicXML,但它可以有效地处理乐谱的文本层。当您需要按作曲家或标题在大型扫描乐谱库中进行搜索时,或者当您想要从声乐乐谱中提取歌词进行单独编辑时,这非常有用。提取的文本保留原始语言,无论是英语、意大利语、德语还是法语。

首先将乐谱 PDF 上传到 OCR 工具。系统处理每个页面,将文本区域与乐谱区域分开识别。然后,识别出的文本将作为可搜索层嵌入到 PDF 中,而乐谱的原始图形外观保持不变。您的音乐看起来与原始扫描相同,但您现在可以在文档中搜索文本字符串。这种混合方法保留了性能的视觉保真度,同时增加了编目和研究的数字可访问性。

对于包含大量文本形式的演奏说明、脚注或批评评论的乐谱,OCR 可以将所有文本材料提取到单独的文本文件或 Word 文档中。音乐图书馆员建立可搜索的数字目录和指挥家准备节目说明发现这特别有价值。当您可以搜索所有标记为“行板”的作品或在整个库中查找每个提及特定音乐术语的内容时,500 个扫描乐谱的集合变得更加易于管理。

通用OCR和专用乐谱软件之间的选择

您选择的工具取决于您需要的输出。下表概述了通用 PDF OCR 工具和专用光学音乐识别应用程序之间的主要区别。

功能通用 PDF OCR专用 OMR 软件
主输出可搜索的 PDF、提取的文本MusicXML、MIDI、可编辑符号
人员线路处理视为噪声或图像元素通过算法检测并删除
音调识别不支持员工位置的完整音调映射
节奏诠释不支持音符时长、拍号、连音
文本提取标题、歌词、节奏标记文本加上所有音乐符号
最适合可搜索乐谱档案、歌词提取、编目编辑、移调、播放、编曲

对于许多实际任务,通用 OCR 工具只需较少的设置即可满足您的大部分需求。如果您的目标是使扫描的乐谱集合可进行文本搜索,或者从合唱团排练表的声乐乐谱中提取歌词,基于浏览器的 OCR 可以有效地处理这些任务。对于编辑实际音符、移调到新调或创建编排,具有 OMR 导入功能的专用记谱软件是正确的工具。这两种方法是互补的。实用的工作流程使用通用 OCR 进行编目和搜索,然后切换到专用 OMR 来处理需要音乐编辑的特定乐谱。

纠正 OCR 输出并最终确定您的数字乐谱

无论是文本还是音乐,任何 OCR 过程都无法在第一遍就产生完美的输出。在处理乐谱时,需要花时间检查和纠正结果。对于从乐谱中提取的文本,检查是否存在常见错误,例如将字母 l 误认为数字 1、将字母 O 与数字 0 混淆以及误读与五线谱线重叠的字符。意大利节奏标记(如“allegretto”或“diminuendo”)特别容易出错,因为主要针对英语文本训练的 OCR 引擎可能没有针对这些术语的强大语言模型。

如果您使用专用的 OMR 软件,审核过程会更加复杂。播放 MIDI 输出并聆听错误的音符,这些音符通常出现在页面边缘、污迹附近或音符头重叠的密集和弦通道中。检查调号和拍号是否正确识别。验证意外事件是否按预期执行该措施。大多数 OMR 应用程序都会以不同的颜色突出显示不确定的读数,因此您可以将修正集中在软件标记的区域上。审核步骤是工作流程的一部分,而不是失败的迹象。即使是专业的音乐雕刻师也会花费大量时间校对数字转录的乐谱。

验证后,将您的乐谱导出为 PDF,并嵌入已识别的音乐数据。这将为您提供一个看起来像原始扫描的文件,但包含音乐的机器可读表示。此类文件可以通过数字音乐库系统进行索引,导入到练习应用程序中,或者以随着技术的发展而保持可访问的格式进行存档。视觉保存和数字可访问性的结合确保了音乐作品在原始纸张损坏很长时间后仍可供表演者、学者和听众使用。

这才是真正的回报。

工作是值得的。

WukongPDF

尝试 PDF OCR

无需安装。直接在您的浏览器中工作。

立即开始 →