基于多模态大模型的多媒体资源编目系统探索

基于多模态大模型的多媒体资源编目系统探索

2026年07期【本期推荐】

作者:钱国富,张智东,李贵
来源:钱国富,张智东,李贵.基于多模态大模型的多媒体资源编目系统探索[J].图书情报工作,2026,70(9):105-113.

摘要  [目的/意义] 针对光盘音像出版物编目工作中存在的效率瓶颈,提出一种基于多模态大模型的多媒体资源编目解决方案,并以光盘音像出版物为例进行了实证研究,有助于提升编目效率,提高数据加工质量。[方法/过程]首先整合视觉大模型和大语言模型,对光盘音像出版物外观进行识别和信息提取,然后结合 FFmpeg 等视频工具库,生成符合规范要求的编目数据,最后利用 M3-Embedding 模型将生成数据与人工数据进行对比。 [结果/结论]实验数据表明,生成的核心元数据与人工编目数据的相似度达 74.3%,能有效帮助编目人员进行预编目,使工作效率得到提升。最后根据设计方案开发了一套基于多模态大模型的多媒体资源编目辅助软件,以期通过应用平台建设提高编目工作效率和准确率。

关键词:多模态大模型;生成式人工智能;资源编目;智慧图书馆

1 引言/Introduction

技术发展和科技创新给图书馆等信息管理和服务机构带来了新的机遇和挑战。人工智能等技术在信息资源管理领域的应用日趋丰富,为相关机构的业务发展和效率提升提供了新的技术支撑,也为智慧图书馆等体系建设提供了更多可能性。各类型信息资源服务机构和学者都在结合具体场景,积极探索以多模态大模型为代表的人工智能相关技术的应用路径,包括智能客服、数据分析、阅读推广、资源推荐等。多模态大模型在信息资源分类编目业务上同样具有很大的应用空间,广州国家版本馆藏有大量电影胶片、光盘等非书资料,如何对这些非书资料进行高效、准确的编目加工存在着一定技术难度。本研究聚焦多媒体光盘编目这一业务问题,将多模态大模型技术引入编目业务流程,提出光盘音像出版物智能编目解决方案,并通过开发原型系统进行了验证,旨在为后续开发智能化资源分编系统提供理论和技术支持。

2 文献综述现状/Literature review

2.1 多模态大模型概述
多模态大模型,是指能够输入、理解和生成文本、图像、音频、视频等两种以上模态的数据的人工智能大语言模型,其先后经历了从自然语言处理到大语言模型、从文本大模型到视觉大模型、从单模态大模型到多模态大模型的演进历程 。多模态大模型为信息资源管理提供了全新的技术选择和发展机遇,可以判断未来信息资源管理智能化转型将成为大势所趋。但对智慧图书馆进行考察时,不难发现传统信息资源分类编目业务的智能化程度偏低,依旧普遍沿用传统作业模式,依靠馆员或者外包服务人员来进行人工作业。虽然已有同行围绕大语言模型开展编目智能化的探索,但系统重点依旧聚焦在图书,对日益增长的多媒体资源的编目加工缺乏足够的关注。

多模态大模型技术的发展也给 OCR( Optical Character Recognition)识别提供了新的可能。以往的 OCR 方式多基于机器学习实现,如通过深度学习的方法对各种不同字形、不同阅读方向、不同语种等字体进行识别。其中由百度开发的 PaddleOCR 在中文字符识别应用中处于先进水平。近年来,视觉大语言模型(Vision Language Model, VLM )快速发展,为提升 VLM 的泛化与推理能力,研究者已开发出众多 VLM 模型,通过利用大规模视觉—语言数据来增强模型应对这些多样化挑战的能力。VLM 模型虽然能根据图片回答简单而具体的问题,且回答准确率较高,但在解决分类任务或者需要理解抽象概念时,仍然存在明显缺陷,因此直接使用 VLM 模型来解决编目工作尚不可行。另一方面,VLM 在 OCR 方面却有天然优势,传统 OCR 无法处理的特殊字体,VLM 都能正确解析,特别是经过 OCR 任务特殊训练的 VLM 模型,例如 Qwen-VL-OCR、GOT-OCR2等视觉大语言模型,在单一 OCR 任务上都有出色的表现。

大语言模型( large language model, LLM)在处理复杂问题上也有了长足进步,特别是推理模型的出现,使得大语言模型在演绎归纳推理、分解多步骤问题、复杂决策能力、对新颖问题的泛化能力等方面得到了极大提升,而这些特性,正是编目工作需要的能力。特别是 DeepSeek-R1 的出现让推理模型在达到最先进模型 OpenAI-o1-1217 相当能力的同时使用和微调成本大幅下降,除此之外,开源和国产的特性让 DeepSeek-R1 在国内快速落地和普及。除了 DeepSeek-R1,国内还涌现了许多优秀的推理模型,包括 QWQ-32B 用更小的参数量媲美 DeepSeek-R1-671B 参数量的模型,以及 Kimi1.5 通过长思维链到短思维链迁移方法提升短链推理的性能。

2.2 多媒体编目研究概述
多媒体资源是伴随着技术发展而不断演化创新的,对其的分类编目却一直停留在手工作业和数据电子化管理上,现有图书馆业务系统也没有能够将多媒体资源纳入一体化管理,往往是以随书光盘管理系统等方式进行管理,在资源统一管理,尤其是数据整合上存在壁垒。21 世纪以来,XML 、元数据的普及,尤其是下一代图书馆服务平台的发展,对资源和数据整合的要求越来越高,如何基于编目系统,实现多类型资源的有效组织和管理成为图书馆界和业界研究的重点,随着自动标引技术的推广,如何减少人工干预实现自动化分编,成为关注重点。

近年来,生成式人工智能的发展为自动标引提供了新的可能,虽然围绕人工智能和图书馆的研究很多,但专门从人工智能视角探索采分编智能化的研究成果非常少见。刘贝玲等展望了 LLM 在图书馆采分编领域的应用,提出将 LLM 与图书馆系统深度集成,构建领域专用大模型,并提出了在编目环节基于大语言模型进行自动化编目的流程,但缺乏对编目中不同类型字段、不同来源数据的处理及关键要素的详细论述。随着 ChatGPT 的推出,有学者通过应用 ChatGPT 来生成学位论文主题词,通过实验证明其在学位论文编目中的效率优势,也揭示了通用大模型的局限性,即对复杂语义结构的理解仍不完善,实验显示生成的主题词中只有 23% 完全符合受控词表,且细分规则的误用率较高。相关研究为大语言模型在信息资源编目中的应用开展了积极探索。和早期 AI 技术相比,LLM 的预训练优势使其能够通过上下文感知直接解析文本深层语义,避免关键词依赖导致的误标问题,同时具备跨语言、跨文化的概念理解潜力。而随着多模态大模型的发展,为信息资源管理,尤其是图书采分编的智慧化提供了新的想象空间。

为了解决以上三个困境,本文提出了一种基于预训练大语言模型(LLM)和多模态视觉模型的多媒体资源编目系统,通过利用多模态大模型,探究提升工作流程中从图片中提取可用客观信息,将客观信息转为符合编目规范的信息这两个步骤的效率。并利用 FFmpeg 整合各类工具链提高从音视频文件中提取客观信息这一步骤的准确率和效率,进而开发一套多媒体资源编目辅助软件,提高整体工作流程的准确率,提高数据加工质量,为后续数据整合和开发利用奠定坚实的基础,助力人工智能在信息资源管理,尤其是传统信息资源采分编领域的运用探索,推动智慧图书馆建设。

3 研究过程/Research process

3.1 实践现状
不同于传统的图书编目,多媒体资源编目绝大多数属于原编工作,需要耗费大量的人力,目前常见的光盘资源编目工作流程如图 1 所示,包括整理、提取、编目、保存等环节。在实践中,不难发现当前多媒体资源,尤其是光盘的分辨加工工作面临三个困境。

(1)现有 OCR 工具的局限性。在利用 OCR 工具从图片中提取可用客观信息时,现有的 OCR 工具对艺术字体和特殊字体基本无法识别,而在音像制品中,各类艺术字体会频繁出现,导致整体识别率偏低。

图 1 编目工作流程 Figure 1 Cataloging workflow

除此之外,音像制品封面的排版比较随意,导致各类 OCR 软件无法按照正确的排版方式识别整块的内容信息,使得加工人员需要重新进行理解和排版。

(2)加工工作准确率低。编目人员不仅需要熟悉各个元数据的著录规则,并且由于数字资源编目的特殊性,许多文件客观属性需要从专用的视频工具中人工读取,客观信息和主观信息的提取准确率低。因此,光盘实物信息的编目效率大约为 25 分钟/册件。

(3)加工工作效率低。由于各类辅助加工工具分散,目前加工人员需要操作 3 到 5 个独立系统,包括 OCR 工具、音视频文件信息读取工具、模板录入工具、光盘文件抽取工具等,并且需要持续性人工介入操作,加工人员的学习成本陡增,工作效率低下。

为了解决以上三个困境,本研究通过利用多模态大模型,探究提升工作流程中从图片中提取可用客观信息、将客观信息转为符合编目规范的信息这两个步骤的效率。并利用 FFmpeg 整合各类工具链,提高从音视频文件中提取客观信息这一步骤的准确率和效率。最终开发辅助光盘音像出版物编目的桌面软件,提高整体工作流程的准确率,提高数据加工质量,为后续数据整合和开发利用奠定坚实的基础。

3.2 实验设计

为了验证利用多模态大模型从图片中提取可用客观信息,并将客观信息转为符合编目规范的信息的可行性,本研究设计了如图 2 所示的实验流程,并进行了实验。

图 2 实验流程 Figure 2 Experimental workflow diagram

测试集从已经完成人工编目的 900 多条数据中提取,数量为 140 条,包括了符合相应规范的 9 个维度的元数据,包括题名、数字资源类型、数字资源形态、标识符、描述、出版者、其他责任人、语种、歌手(主演),以及通过高拍仪拍摄的实物相片。

视觉模型处理模块将测试集中的实物照片输入到模型中,提取其中所有的信息,形成文字数据。视觉模型使用了传统深度学习实现的 OCR 工具 Pad- dleOCR-V3、经过 OCR 任务特化训练的视觉大语言模型 Qwen-VL-OCR 以及小参数的视觉大语言模型 GOT- OCR2 作为处理引擎,对传统深度学习实现的 OCR 和视觉大语言模型之间的能力进行比较。随着视觉大语言模型的发展,该模块可以替换为任意的模型。

大语言模型处理模块将上一步视觉模型处理得到的文字数据,结合 Prompt 工程生成的提示词输入到大语言模型中,再通过代码处理成标准的结构化数据。大语言模型使用了 DeepSeek-R1-671B(全参数推理模型) 、DeepSeek-R1-Distill-Qwen-32B(通过蒸馏的推理模型) 以及 DeepSeek-V3-671B(混合专家语言模型)作为处理引擎,比较不同参数规模的推理模型和普通大语言模型在处理编目数据之间的区别。

为了准确评估测试集的生成数据和人工编目数据之间的偏差,本文采用了 M3-Embedding 模型对每个元数据之间的语义相似度进行计算。M3-Embedding模型为 100 多种语言提供统一的语义检索支持,在多语言检索、跨语言检索以及长文档检索等基准测试中均拥有当前最先进的性能表现,例如:“清晨的微风轻拂过脸庞,带来一丝清新的凉意”和“早晨的微风轻轻吹过脸颊,送来一缕清新的凉爽”这两句话,在语义层面基本相同,只不过在表达方式上有所区别,利用 M3-Embedding 计算出的相似度为 95%。

3.3 数据验证

利用以上实验流程,基于不同视觉模型和大语言模型进行了 5 组实验,实验结果如表 1 所示。

表 1 实验对比结果 Table 1 Experimental comparison results

根据实验结果可以发现,传统深度学习实现的视觉模型、经过 OCR 任务特化训练的视觉大语言模型以及小参数的视觉大语言模型在 OCR 任务下的差别并不大。效果最好的 Qwen-VL-OCR 也仅仅比PaddleOCR 高了 0.5%,而拥有 72B 参数量的 Qwen-VL-OCR 也仅比拥有 580M 参数量的 GOT-OCR2 高了 1.9%。另一方面,不同的大语言模型在该实验中的表现差距就相对较大。推理模型在这类复杂问题上的表现要远好于普通的混合专家模型,DeepSeek-R1- 671B 比 DeepSeek-V3-671B 的相似度高了 7.3%。而参数量也会在一定程度上影响推理模型的能力,从实验数据中看到,32B 参数量的 DeepSeek-R1 比 671B参数量的 DeepSeek-R1 相似度低了 5.1%。

在实验过程中,我们发现 Qwen-VL-OCR 这类视觉大语言模型不仅拥有文档排版检测的能力,对于艺术字体、模糊字体都能正确识别。见图 3。

但是对于 GOT-OCR2 这类参数量较少的视觉大语言模型,其缺少文档排版检测能力,导致识别的文字排版混乱,且部分清晰度低的文字会识别失败。见图 4 ISBN 号识别结果。

而对于 PaddleOCR 这类基于深度学习的模型而言,虽然其文字排版检测能力很强,甚至能给出识别文字的准确坐标,这是视觉大语言模型无法处理的,但是对于艺术字体、模糊文字的识别能力会很差,例如“Classical”的艺术字识别和 ISBN 号的识别,见图 5。

对于大语言模型而言,大参数量的推理模型在错别字纠正、信息推理识别、复杂问题分步求解等方面展现出了强大的能力,比如上文《爱德华大夫》光盘这一案例,图 6 为 DeepSeek-R1-671B 模型的部分推理过程,可以看到当因为识别错误导致提供的信息产生冲突时,推理模型会从别的信息中推理出正确的答案,选出正确的出版者为:北京电视艺术中心音像出版社。推理模型强大的推理能力,弥补了不同 OCR 识别模型之间的差距,使得 PaddleOCR 和 GOT-OCR2 这两个模型最终得出的编目结果和人工编目的相似度与 Qwen-VL-OCR 的相近。

相对而言,DeepSeek-V3-671B 这类混合专家语言模型以及 DeepSeek-R1-32B 这类低参数的推理模型,其在遇到同样的复杂决策问题时就无法处理得到正确结果,这也正是在相同的 OCR 结果下,使用不同大语言模型准确率差距大的原因。因此,在编目工作中,优秀的推理模型起到了决定性的作用。

图 3 Qwen-VL-OCR 对示例图片识别结果
Figure 3 Recognition results of Qwen VL-OCR for the sample image

图 4 GOT-OCR2 对示例图片识别结果
Figure 4 Recognition results of GOT-OCR2 for the sample image

图 5 PaddleOCR 对示例图片识别结果
Figure 5 Recognition results of PaddleOCR for the sample image

图 6 模型识别结果输入到 DeepSeek-R1-671B 中的推理过程

Figure 6 The inference process of inputting the model recognition results into DeepSeeker R1-671B

通过“视觉模型提取→大语言模型结构化处理→语义相似度评估”的流程,最终生成数据与人工编目的平均相似度最高达 74.3%,而推理大语言模型在处理 140 条测试数据时最多只消耗了 33 万 tokens,按照如今 16 元 / 百万 tokens 的价格计算,仅需花费 5.3 元。因此无论在成本效益还是准确度方面,该方案均具备实际应用潜力。

3.4 系统实现和应用

根据前述研究,对融合多模态大模型的多媒体光盘编目流程进行了优化,如图 7 所示。

图 7 基于多模态大模型的多媒体光盘编目流程 Figure 7 Cataloging flowchart of multimedia CDs based on multimodal large models

根据业务流程,提出了基于多模态大模型的 C/S架构多媒体光盘编目辅助系统,系统架构见图 8,由数据库、服务端和客户端组成完整的自动化处理模块,来实现编目辅助功能。

3.4.1 应用服务器实现

为了方便数据处理和应用服务逻辑统一,应用服务器用 Python 语言实现。该系统的核心在应用服务器中工厂模式的设计与实现,应用服务器通过工厂模式抽象了各类模型的请求方式和编目数据处理的流程,再通过继承模型工厂实现了视觉模型工厂和大语言模型工厂两个类,这两个工厂类实现了通用 OpenAI 接口用于和本地或者远程的大模型服务器进行异步任务调度,最终实现了各类模型服务的无感切换,以便于随时使用最先进的、目前最高水平(SOTA)的模型。

3.4.2 客户端实现

编目客户端采用 Flutter 框架开发,Flutter 框架是一款跨平台的客户端开发框架,可以用一套代码实现在 Windows/Mac/Linux 系统上运行 。编目客户端主要实现以下功能。

图 8 编目辅助系统架构
Figure 8 Architecture of cataloging auxiliary system

(1)通过 HTTP 请求应用服务器实现视觉模型识别图片并对识别到的结果进行可视化标注。

(2)通过 HTTP 请求应用服务器大语言模型从上一步得到的信息中提取关键信息并对大语言模型生成的编目信息进行校验。

(3)调用本地 FFmpeg 库获取文件客观信息(时长 / 分辨率 / 编码格式等)。编目客户端通过界面交互将各个主要功能整合起来,最终生成符合规范的编目数据,并通过结构化数据表单导出编目数据。应用界面如图 9 所示。

图 9 编目辅助系统 Figure 9 Cataloging assistance system

编目人员按照多媒体编目规范的要求依次完成光盘外观拍照、音视频提取和文件归档工作,然后将图片信息发送给大语言模型提取出专辑编目数据完成后续流程。

4 研究不足与展望/Limitations and prospect

本研究从多模态大模型在编目业务中的应用出发,通过理论研究和实验设计,验证了多模态大模型能有效提高多媒体资源编目的效率和编目数据的准确率。并通过开发一套 C/S 架构的编目辅助系统,对多模态大模型在编目工作中的应用进行了探索实践,但在实验过程中也发现了多模态大模型在多媒体资源编目中的局限性。

(1)大参数的推理模型部署成本高。通过实验发现,大参数的推理模型在编目工作中具有决定性的作用,但是部署类似 DeepSeek-R1-671B 这样的模型,至少需要 8 张 NVIDIA A100/H100 显卡,其成本达到一百万元以上。虽然可以通过云服务使用推理模型,但受限于网速和流量,云服务的大量使用也不可行。

(2)实验的多媒体资源类型不够丰富。本研究只针对光盘音像出版物中的音视频资源的编目进行了研究,而信息类型多种多样。多模态大模型若要应用于更多类型的资源编目,就需要不断对提示词进行兼容和优化,更需要对视觉大模型和推理模型进行训练和微调,这样才能达到理想的准确率。

基于当前研究的基础与局限性,对于多模态大模型在多媒体资源编目中的应用,提出以下方向的展望。

(1)模型蒸馏(Distilling)和微调(Fine-Tuning)技术的应用。大语言模型的知识蒸馏技术能构建领域专用的小规模模型,向小模型传递高阶知识,构建更普惠、高效、强大的信息资源编目领域专用模型,这能极大解决当前大参数的推理模型部署成本高的问题。除此之外,视觉大模型在特定领域的微调,例如光盘封面识别、海外书籍识别等,能让视觉大模型在特定识别任务上拥有更高的准确率和更低的使用成本。

(2)检索增强生成(Retrieval-augmented Genera- tion)的应用。充分利用已有的海量正式出版物数据,这些数据呈现半结构化特征,可应用于构建高质量的结构化数据集,服务检索增强生成等场景。通过结合推理模型和信息检索技术,不仅能有效缓解大语言模型的幻觉问题,输出基于真实世界的最新数据,还能让大语言模型从外部知识源获取最新的文档和信息,提高信息资源编目的准确率和效率。最终形成数据治理优化模型输出、模型迭代反哺数据质量的正向循环。

(3)优化测试集和丰富信息资源编目的类型。通过本研究实现的编目辅助软件能让加工人员验证多模态大模型的生成数据的准确性,进一步提高测试数据的质量,生成数量更多、质量更高的测试数据集。这能为后续的多模态大模型在信息资源编目中的研究和利用提供更多的训练数据和验证数据。另一方面,不断扩展各类信息资源编目工作的开展,并尝试在编目工作中使用多模态大模型,探究多模态大模型的适用边界。

5 结语/Conclusion

本研究通过融合视觉大语言模型(VLM)与大语言模型(LLM)的多模态优势,结合 FFmpeg 视频解析技术,成功实现了音像出版物外观信息与视频元数据的提取。通过设计实验和研发辅助编目系统验证了技术可行性,为多模态大模型在信息资源编目中的利用提供了实践范例。未来我们将继续探索多模态大模型在古籍善本、数字资源等多种类型信息资源编目中的适用边界,以及在智慧编目基础上开展馆藏资源统一管理以及语义化组织的探索,推动智能编目技术向普惠化、精准化方向演进,使大模型技术能够在智慧图书馆建设中落地生根。

发表评论

云瀚联盟-智慧图书馆技术应用联盟