徐海洋-多模态文档大模型mPLUG-DocOwl

3.0 2025-05-10 67 0 13775 KB 61 页 PDF
侵权投诉
徐海洋-多模态文档大模型mPLUG-DocOwl
徐海洋-多模态文档大模型mPLUG-DocOwl
徐海洋-多模态文档大模型mPLUG-DocOwl
徐海洋-多模态文档大模型mPLUG-DocOwl
徐海洋-多模态文档大模型mPLUG-DocOwl
摘要:

多模态文档大模型mPLUG-DocOwl徐海洋 阿里巴巴通义实验室演讲嘉宾徐海洋阿里巴巴通义实验室-高级算法专家负责通义多模态大模型mPLUG系列工作,包括基础多模态模型mPLUG/mPLUG-2,多模态对话大模型mPLUG-Owl,多模态文档大模型mPLUG-DocOwl,多模态智能体Mobile-Agent等,其中 mPLUG工作在 VQA榜单首超人类的成绩。在国际顶级期刊和会议ICML/CVPR/ICCV/ACL/EMNLP/MM/TOIS/IJCAI/AAAI等发表论文40多篇,并担任多个顶级和会议AC/PC/Reviewer。主导参与开源项目mPLUG,X-PLUG,AliceMind,DELTA。目 录CONTENTS1.多模态文档大模型背景2.mPLUG-DocOwl系列工作3.mPLUG-DocOwl开源实战4.总结与展望多模态文档大模型背景PART 01多模态文档大模型背景富含文字的图片(简称“文档图片”)在生活中无处不在!多模态文档大模型背景Revolutionizing Document AI with Multimodal Document Foundation Models多模态文档大模型背景一个通用的多模态大模型应该具备文档图片理解的能力,例如 GPT4V多模态文档大模型背景多模态大模型模型(MLLM)主要关注于一般图片的对话和问答mPLUG-OwlLLaVAInstructBLIP多模态文档大模型背景由于预训练中存在富含文字的图片,他们也初显一定的图片文字理解能力MLLM具备实现通用文档图片理解的潜力多模态文档大模型挑战多模态文档大模型背景PART 01mPLUG-DocOwlmPLUG-DocOwl•模型结构形状适应的切图模块1.𝑮𝒓𝒊𝒅𝒔={𝟏×𝟏,𝟏×𝟐,…𝟏×𝟐𝟎,𝟐×𝟏,𝟐×𝟏,…,𝟐×𝟏𝟎,…𝟐𝟎×𝟏}2.同时考虑形状和⼤⼩进⾏grid选择)每个子图在原图中第几行第几列mPLUG-DocOwl•模型训练: 训练任务mPLUG-DocOwl•模型训练: 训练任务mPLUG-DocOwl•模型训练: 训练数据mPLUG-DocOwl•实验结果mPLUG-DocOwl1.5mPLUG-DocOwl1.5mPLUG-DocOwl1.5mPLUG-DocOwl1.5mPLUG-DocOw

展开>> 收起<<
徐海洋-多模态文档大模型mPLUG-DocOwl

共 61 页,预览3页

还剩58页未读, 继续阅读

声明:企商查报告文库所有资源均是客户上传分享,仅供网友学习交流,未经上传用户书面授权,请勿作商用。
作者: 分类: 属性:61 页 大小:13775 KB 格式:PDF 时间:2025-05-10

开通VIP享超值会员特权

  • 多端同步记录
  • 高速下载文档
  • 免费文档工具
  • 分享文档赚钱
  • 每日登录抽奖
  • 优质衍生服务
/ 3
客服
关注