Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine ...
文章主要内容总结本文针对文档图像机器翻译(DIMT)任务中因训练数据有限、视觉与文本信息交互复杂导致的泛化能力不足问题,提出了一种名为M4Doc的单模态到混合模态对齐框架。该框架利用多模态大语言模型(MLLMs)的优势,通过训练阶段将仅图像编码器与MLLM的多模态表示对齐,使轻量级DIMT模型学习关键的视觉-文本关联;推理阶段则绕过MLLM,在保持计算效率的同时复用其多模态知识。实验表明,M4Doc在翻译质量上有显著提升,尤其在跨域泛化和复杂文档图像场景中表现优异。创新点提出M4Doc框架:利用MLLM的预训练知识辅助小型DIMT模型训练,实现翻译质量与推理速度的平衡。开发单模态到混合模态对齐方法:仅以图像为输入,即可与MLLM的混合模态(图像+文本)表示对齐,有效传递MLLM的知识。提升泛化能力:实验验证了该方法在跨域、长上下文、复杂布局等挑战性DIMT场景中的有效性,显著优于现有级联、端到端及知识蒸馏方法。翻译部分(Markdown格式)Abstract(摘要)文档图像机器翻译(DIMT)旨在翻译文档图像中的文本,由于训练数据有限以及视觉和文本信息之间的复杂交互,该任务面临泛化挑战。为解决这些挑战,我们提出了M4Doc,这是一种利用多模态大语言模型(MLLMs)的新型单模态到混合模态对齐框架。M4Doc将仅图像编码器与