您的位置:首页 > 互联网

在视觉提示中加入标记,微软等让GPT-4V看的更准、分的更细

发布时间:2023-10-23 23:54:11  来源:互联网     背景:

声明:本文来自于微信公众号 机器之心(ID:almosthuman2014),作者:机器之心,授权转载发布。

最近一段时间,我们见证了大型语言模型(LLM)的显著进步。特别是,生成式预训练 Transformer 或 GPT 的发布引领了业界和学术界的多项突破。自 GPT-4发布以来,大型多模态模型 (LMM) 引起了研究界越来越多的兴趣,许多工作致力于构建多模态 GPT-4。

近日,GPT-4V (ision) 由于出色的多模态感知和推理能力得到了大家格外的关注。然而,尽管 GPT-4V 具有前所未有的视觉语言理解能力,但其细粒度 visual grounding(输入是图片和对应的物体描述,输出是描述物体的 box)能力相对较弱,或者尚未发挥出来。

举例来说,当用户询问下图中放置在右边笔记本电脑的左边是什么物体?GPT-4V 给出了马克杯这个错误的答案。当用户接着询问,想找一个靠窗的座位,我可以坐在哪里?GPT-4V 同样回答不正确。

在意识到上述问题后,来自微软、香港科技大学等机构的研究者提出了一种新的视觉 prompt 方法 Set-of-Mark(SoM),来解决 GPT-4V 在细粒度视觉任务上的问题。

  • 论文地址:https://arxiv.org/pdf/2310.11441.pdf

  • 论文主页:https://som-gpt4v.github.io/

如图1(右)所示,SoM 采用交互式分割模型(例如 SAM)将图像划分为不同粒度级别的区域,并在这些区域上添加一组标记(mark),例如字母数字、掩码(mask)、框(box)。使用添加标记的图像作为输入,以解决上述问题。

我们先来看下效果,左为 GPT-4V,右为 GPT-4V+SoM,很明显后者分类更细致、准确。

下图示例依然如此,GPT-4V+SoM 效果更明显。

此外,对于这项研究,有人问道:SoM 是手动(人工输入)还是自动的?

论文一作 Jianwei Yang 表示,SoM 是自动或半自动的。他们编译了很多自己构建自己的分割工具,比如 SEEM、Semantic-SAM 和 SAM,用来帮助用户自动为图像分割区域。同时用户也可以自己选择区域。

用于视觉的 SoM prompt

使用 SoM prompt GPT-4V 的独特优点是它可以产生文本之外的输出。由于每个标记都与掩码表征的图像区域特定关联,因此可以追溯文本输出中任何提到的标记的掩码。

华为鸿蒙3.0线上发布会

生成成对文本和掩码的能力使 SoM 能够 prompt GPT-4V 来生成视觉关联的文本,更重要的是支持各种细粒度视觉任务,这对普通的 GPT-4V 模型来说是一个挑战。

通过简单的 prompt 工程,SoM 可以让 GPT-4V 广泛地用于多种视觉任务,例如:

  • 开放词汇图像分割:该研究要求 GPT-4V 详尽地给出所有标记区域的类别以及从预定池中选择的类别。

  • 参考分割:给定一个参考表达式,GPT-4V 的任务是从图像分区工具箱生成的候选区域中选择最匹配的区域。

  • 短语关联(Phrase Grounding):与参考分割略有不同,短语关联使用由多个名词短语组成的完整句子。该研究要求 GPT-4V 为所有标记的短语分配相应的区域。

  • 视频对象分割:以两个图像作为输入。第一个图像是查询图像,其中包含第二个图像中需要识别的一些对象。鉴于 GPT-4V 支持多个图像作为输入,因此 SoM 也可以应用于视频中跨帧的关联视觉对象。

实验及结果

研究者使用分而治之(divide-and-conquer)的策略来运行实验和评估。对于每个实例,他们使用新的聊天窗口,这样一来,评估期间就不会出现上下文泄露了。

具体来讲,研究者从每个数据集中选择了小规模的验证数据子集。对于数据集中的每个图像,他们在使用图像分割工具箱提取的区域上覆盖了一组标记。同时基于具体的任务,研究者利用不同的分割工具来提出区域。

下表1列出了每个任务的设置细节。

研究者将其方法与以下模型进行比较:

  • 预测坐标的 GPT-4V 基线模型

  • SOTA 专用模型

  • 开源 LMM

定量结果

详细的实验结果如下表2所示。

首先是图像分割任务。研究者将 GPT-4V + SoM 与 COCO Panoptic 分割数据集上的强大分割模型 MaskDINO、ADE20K Panoptic 分割数据集上的模型 OpenSeeD 进行了比较。

三星s20 fe 5g百度百科

结果显示,GPT-4V + SoM 的零样本性能接近微调后的 MaskDINO,并大幅优于 OpenSeeD。GPT-4V 在 COCO 和 ADE20K 上的相似性能表现出其对广泛视觉和语义域任务的强大泛化能力。

然后是参考(referrring)任务,研究者评估了 RefCOCOg 数据集上的模型 RES 和 REC。他们使用 MaskDINO 来提出掩码,并在图像上覆盖上掩码和数字。同时使用 mIoU 作为评估指标,并与 SOTA 专用模型 PolyFormer 和 SEEM 进行比较。

结果显示,GPT-4V+SoM 击败了 Grounding DINO、Polyformer 等专用模型以及 Shikra、LLaVA-1.5、MiniGPT-v2和 Ferret 等最近的开源 LMM。

接着是 Flickr30K 上的短语关联任务,研究者使用 Grounding DINO 为每个图像生成框建议。GPT-4V+SoM 实现了比 GLIPv2和 Grounding DINO 更强的零样本性能。

最后研究者在 DAVIS2017数据集上评估了视频分割任务。GPT-4V+SoM 实现了优于其他专用视觉模型的最佳追踪性能(78.8J&F)。

消融研究

研究者探讨了标记类型如何影响 Flickr30k 数据集上短语关联任务的最终性能,并比较了两种类型的标记。第一种是数字和掩码,第二种是数字、掩码和框。

结果如下表3所示,添加额外的框可以显著提升性能。

此外研究者探究了当生成带有真值注释的标记时,GPT-4V 如何表现。他们选择在 RefCOCOg 验证集中用真值掩码替换预测到的分割掩码。这意味着 GPT-4V 只需要从注释短语区域选择一个即可。如预期一样,参考分割的性能可以得到进一步提升,尤其是当分割模型有一些缺失的区域。

结果如下表4所示,在 SoM 中使用真值掩码可以将 RefCOCOg 上的性能提升14.5%(mIoU)。

更多技术细节和实验结果参阅原论文。


返回网站首页

本文评论
荣耀MagicBook 14 2023推出32GB大内存版今日开售:首销尊享价5599元_荣耀magicbook142021参数
8 月 24 日,荣耀手机官方微博宣布,荣耀MagicBook 14 2023 32GB大内存版本正式开售,首销尊享价 5599 元。此次升级至32GB超大内存,意味着用户在应对重度多任务时使用将会更为顺畅...
日期:08-24
系列销量达7500万!《巫师3》跻身史上最畅销游戏前十「巫师3pc销量」
快科技5月30日消息,今天凌晨,CD Projekt公布了公司2023年第一季度的收益情况,其中就包含了《巫师》系列的销量信息。iphone13系列参数的对比图华为p50pro骁龙版和荣耀magic4根...
日期:05-31
拆分上市明明是利好 但阿里股价怎么就起不来?「阿里巴巴一股拆分了多少股」
阿里最近着实令许多人士感到不解,业务拆分上市对资本市场分明是利好,但股价走势却是相当平平。当理论利好迟迟不能市场兑现,“聪明的投资者”也会怀疑人生,于是又出现了“阿里好...
日期:05-25
抖音发布治理处罚公告   打击刻意炫富等不良内容_抖音违规处罚通知怎么关闭
  2月26日,抖音安全中心发布治理处罚公告,对一批涉嫌刻意炫富、恶意炒作、有违社会公序良俗的账号进行禁言、封禁等处理。1月以来,抖音安全中心已清理此类视频2862条、音频3...
日期:07-16
消息称字节跳动计划下半年将出音乐 App:暂定名“飞乐”,由抖音团队负责
  9 月 16 日消息 据 36 氪报道,从多个独立信源处了解到,字节跳动将于今年下半年在国内推出一款音乐流媒体产品,目前该产品已进入关键开发阶段,产品名称暂定“飞乐”,项目内部...
日期:07-17
ChatGPT发福利了!付费用户可邀请朋友免费体验Plus功能
快科技9月29日消息,OpenAI近期宣布,无论是收费用户还是免费用户,都可以体验到联网模式,ChatGPT不再局限于2021年9月之前的数据,可以为用户提供最新的搜索信息。amd的GPUChatGPT还...
日期:09-30
京东“新品情报局”神探陈铭解开iQOO 8系列性能之谜 首发E5高亮发光材料
  2021年ChinaJoy上,iQOO 8系列真身一现就引发了现场观众的簇足,几张海报更是引发了网格热议。虽然网上爆料信息较少,但始终蒙着一层纱的iQOO 8系列却让人一直心痒痒。8月13...
日期:07-17
吾本熊元宇宙与元力奶品牌达成战略合作 数字藏品赋能实体企业
吾本熊元宇宙与元力奶品牌近日达成战略合作,元力奶品牌竞得吾本熊 222 号熊小熊和 222 号吾本熊作为品牌形象,同时,双方将开启数字藏品赋能实体企业的合作探索。吾本熊元宇宙创...
日期:08-01
印度有苹果专卖店么「印度首次成为苹果自主销售地区 即将开设首家实体零售店」
彭博社报道称,苹果正在调整其全球业务的运营方式,以便更加重视印度市场。 印度将成为苹果内部的一个独立销售区域,这将使该国在公司内部“更加显眼”。印度是苹果近年来越来越...
日期:03-09
史上最大屏!苹果6月或推出15英寸MacBook Air:搭载M2芯片_mac有15.4英寸的吗
快科技4月11日消息,屏幕分析师罗斯杨(Ross Young)今天带来了苹果的最新消息,称其有望在WWDC 2023大会上推出15英寸的MacBook Air。其实早在今年2月份,苹果就已经开始为15英寸MacB...
日期:04-11
英伟达、英特尔、AMD等芯片巨头集体萎靡,PC销售热潮已退(英伟达竞争的企业)
国内汽车电商有哪几种主要模式   过去近两年,当疫情期间人们被隔离在家时,PC出货量出现爆发式增长。而现在,这样的增长终于消失。   当地时间8月8日,存储芯片公司美光警告称...
日期:08-15
Cerebras Systems与阿联酋Group 42签署价值1亿美元AI超级计算机协议「阿联酋科技巨头g42」
7月21日 消息:据路透社消息,人工智能芯片初创公司Cerebras Systems Inc.与阿布扎比的科技公司Group 42 Holding Ltd.合作,打造了据称是世界上最大的AI训练超级计算机,为企业提...
日期:07-21
亚马逊云存储服务Amazon Drive将于2023年12月31日正式关停_amazon drive暂时关闭
11月15日消息:亚马逊宣布旗下的云存储服务 Amazon Drive 将于2023年12月31日正式关停。目前,Amazon Drive 官网已经放出了公告,亚马逊也向使用该服务的用户发送了电子邮件。华...
日期:11-20
华大九天:模拟全流程系统能够完整支持28nm及以上的成熟工艺_华大九天 模拟仿真
集微网消息,9月13日,北京华大九天科技股份有限公司(以下简称“华大九天”)披露的投资者关系活动记录表显示,公司模拟全流程系统目前能够完整支持 28nm 及以上的成熟工艺,正在大规...
日期:09-15
公司估值过高是好是坏_分析称人人公司估值过高 存在三大缺陷
(小贝)北京时间6月25日消息,据国外媒体报道,美国投资网站MoneyShow.com周五发表罗伯特·苏(Robert Hsu)的署名文章称,尽管人人公司成功赴纽约证券交易所上市,但公司估值过高,而且三...
日期:07-30
万万没想到 你的心愿TA都能满足_你可以满足我一个愿望吗
  新年是漫漫寒冬里最能温暖人心的节日,许下新年心愿,则是一件很有仪式感的事情,这小小的心愿承载着对生活的热爱,以及对美好未来的期盼!万万没想到,你的心愿TA都能满足,快和卡...
日期:07-16
mate 50 发布「的Mate 50系列明天开售:现在能预购」
中关村在线消息:明天上午10:08分,华为Mate 50系列最后一款机型华为Mate 50E也将开售,该机是华为Mate 50系列中最便宜的机型,同时也是最轻薄的机型,仅7.98mm,起售价为3999元。目前,...
日期:10-17
iPhone16Pro或取消灵动岛 仅保留1个前摄圆形打孔
1月11日 消息:据两个不同的消息来源表明,苹果将在明年的 iPhone16系列(可能只限于 iPhone16Pro 机型)中引入屏下 Face ID 传感器,从而可以取消灵动岛(或刘海),仅保留一个前摄圆形...
日期:01-11
假期人从众模式开启!网友吐槽假期坐高铁动车像挤地铁
9月28日消息,据媒体报道,广东广州一男子双节前坐动车坐出地铁的感觉。抖音mcn机构简介当事人张先生称这是一趟从广州南到湛江西的动车,一上车就很惊讶,因为车厢内有扶手,很多人站...
日期:09-28
《精灵与萤火意志》两部合集 10 月登陆 Switch 平台,预售价 49.99 美元_精灵与萤火意志switch国行
  8 月 1 日消息 微软 Moon Studios 工作室的知名游戏《精灵与黑暗森林》、《精灵与萤火意志》两部曲的合集将在 10 月份登陆任天堂 Switch 平台,预售价 49.99 美元。  ...
日期:06-03