徐海洋-多模态文档大模型mPLUG-DocOwl

3.0 2025-05-10 67 0 13775 KB 61 页 PDF

侵权投诉

文档加载中……请稍候！
如果长时间未打开，您也可以点击刷新试试。

下载文档到电脑，查找使用更方便

0 人已下载

立即下载

摘要：

多模态文档大模型mPLUG-DocOwl徐海洋阿里巴巴通义实验室演讲嘉宾徐海洋阿里巴巴通义实验室-高级算法专家负责通义多模态大模型mPLUG系列工作，包括基础多模态模型mPLUG/mPLUG-2，多模态对话大模型mPLUG-Owl，多模态文档大模型mPLUG-DocOwl，多模态智能体Mobile-Agent等，其中 mPLUG工作在 VQA榜单首超人类的成绩。在国际顶级期刊和会议ICML/CVPR/ICCV/ACL/EMNLP/MM/TOIS/IJCAI/AAAI等发表论文40多篇，并担任多个顶级和会议AC/PC/Reviewer。主导参与开源项目mPLUG，X-PLUG，AliceMind，DELTA。目录CONTENTS1.多模态文档大模型背景2.mPLUG-DocOwl系列工作3.mPLUG-DocOwl开源实战4.总结与展望多模态文档大模型背景PART 01多模态文档大模型背景富含文字的图片（简称“文档图片”）在生活中无处不在！多模态文档大模型背景Revolutionizing Document AI with Multimodal Document Foundation Models多模态文档大模型背景一个通用的多模态大模型应该具备文档图片理解的能力，例如 GPT4V多模态文档大模型背景多模态大模型模型（MLLM）主要关注于一般图片的对话和问答mPLUG-OwlLLaVAInstructBLIP多模态文档大模型背景由于预训练中存在富含文字的图片，他们也初显一定的图片文字理解能力MLLM具备实现通用文档图片理解的潜力多模态文档大模型挑战多模态文档大模型背景PART 01mPLUG-DocOwlmPLUG-DocOwl•模型结构形状适应的切图模块1.𝑮𝒓𝒊𝒅𝒔={𝟏×𝟏,𝟏×𝟐,…𝟏×𝟐𝟎,𝟐×𝟏,𝟐×𝟏,…,𝟐×𝟏𝟎,…𝟐𝟎×𝟏}2.同时考虑形状和⼤⼩进⾏grid选择）每个子图在原图中第几行第几列mPLUG-DocOwl•模型训练: 训练任务mPLUG-DocOwl•模型训练: 训练任务mPLUG-DocOwl•模型训练: 训练数据mPLUG-DocOwl•实验结果mPLUG-DocOwl1.5mPLUG-DocOwl1.5mPLUG-DocOwl1.5mPLUG-DocOwl1.5mPLUG-DocOw

展开>> 收起<<

徐海洋-多模态文档大模型mPLUG-DocOwl

共 61 页,预览3页

还剩58页未读，继续阅读