您的位置:首页 > 互联网

Gemini上线首日:用户褒贬不一,演示被质疑造假,谷歌承认了_gemini im

发布时间:2023-12-08 15:39:22  来源:互联网     背景:

又不求融资,怎么也给 demo 加美颜?

谷歌,这就有点尴尬了。

没有想到,Gemini上线头一天,热门评论会是这个样子。

本周三,谷歌的 Gemini 让生成式 AI 进入了原生多模态时代。人们第一时间涌入新模型加持的Bard想要试试 AI 的能力,结果给出的评价褒贬不一。

其中最值得注意的是有人指出,Gemini 在发布时,谷歌给出的一系列 Demo 中最令人眼花缭乱的部分是伪造的。

名为《Hands-on with Gemini: Interacting with multimodal AI》的视频现在的播放量已经有140万次,其中展示了谷歌认为自己最喜欢的与 Gemini 的交互案例,展示了多模态模型(即它理解并混合语言和视觉理解)如何灵活地响应各种输入。

谷歌展示了 Gemini 神奇的理解和交互能力,人用画笔绘制一只鸭子的草图,从一条曲线到一幅完整的图画,AI 评论说蓝色是一种不切实际的动物颜色。

然后 AI 看到一只实体的玩具蓝色鸭时表现出了惊讶。然后它会响应人类围绕鸭子的各种问题,包括地球的哪个地点会有鸭子,鸭子在各种语言里的读法等等。

随后演示继续进行,AI 实现了在换杯子游戏中正确跟踪、识别皮影手势、识别材料给出组合建议、重新排序行星草图等等。

但点击 YouTube 上的视频描述,可以发现 Google 有一个重要的免责声明:为了演示的目的,他们已经减少延迟,为了简洁,Gemini 的输出也缩短了。

根据彭博社消息,谷歌在被要求发表评论时承认,视频演示并不是实时的,而是使用了原始镜头中的静止图像帧,然后编写了文本提示,让 Gemini 做出回应。

gemini官方网站

视频看起来很美好,然而,却也反映出了这一问题:视频不是真实的。人们使用了各种方式来进行验证,包括使用视频的截图来问 Bard 中的 Gemini,发现 AI 并不能准确地回答问题。

有理由怀疑,谷歌可能只是制作了一个夸张的视频,然后使用静态图像帧和文本进行拼凑来作为 Gemini 的提示语。也就是说,视频 Demo 是精心挑选的结果。

也许 Gemini 可以如实的完成视频展示的内容,但谷歌没有这样做,而是加了速;又或许 Gemini 根本不像视频中展示的那样丝滑,有人从好几个错误结果中挑出了正确的作为素材。

但无论如何,Gemini 的演示看起来都像是经过精心调整好的,对实际交互情况进行了歪曲。

谷歌在这篇名为《How it’s Made: Interacting with Gemini through multimodal prompting》的博客中也解释了多模态交互过程,即如何通过多模态 prompting 来与 Gemini 交互。

注:Gemini 的提示语可以是多模态 prompting(即不同模态的组合,如图像和文本),之后让 Gemini 预测接下来会发生什么,从而做出反应。

例如,在玩剪刀石头布的游戏中,谷歌的实验过程是这样的:将照片展示给 Gemini,并要求 Gemini 描述所看到的内容:

在演示中,一方面,Gemini 似乎确实产生了视频中所示的反应。但在另一方面,观众可能被误导了,主要体现在与模型的交互速度、准确性等方面。

例如,在视频的2:45处,一只手静静地做出一系列手势。Gemini 很快回应:我知道你在做什么!你在玩石头、剪刀、布!

然而在谷歌博客中,用户必须同时显示所有三个手势并提示:你认为我在做什么?外加提示:这是一个游戏。Gemini 才回答道:你在玩石头、剪刀、布。就像下图所展示的,当用户伸出两根手指时,Gemini 并不知道这是石头、剪刀、布的游戏。只有三张图片都齐全了,Gemini 才能猜对。

比较视频和博客介绍的推理过程,给人一种完全不同的交互方式,视频中显示的互动过程并没有发生。

在随后的演示中,将三张带有太阳、土星和地球涂鸦的草图展示给 Gemini。在视频中,用户问道这个顺序正确吗?Gemini 回答:不,是太阳、地球、土星。注意,原视频中用户除了这个顺序正确吗?这句话,没有其他信息。Gemini 却给出了答案。

但在实际的提示中(还是书面的),提示语却是这个顺序对吗?考虑到与太阳的距离,并解释你的理由。Gemini 回答:正确的顺序是太阳、地球、土星。太阳离太阳系中心最近,其次是地球,然后是土星。

我们可以推测,在视频中,Gemini 的回答可能需要其他帮助,只是谷歌没有体现出来。

在视频展示的另一个示例中,纸团在杯子之间交换,视频中,Gemini 立即且看似直观地进行检测和跟踪。

但在博客中,完成这一过程还是很复杂的。

每动一次都要和大模型交流一下。也许我们应该假设谷歌人工智能演示中的所有功能都被夸大了。

面对人们的质疑,谷歌的回应是:他们直接承认了。

在本文发表后发布的社交媒体帖子中,Google DeepMind 的研究副总裁 Oriol Vinyals 详细介绍了录制该视频时 Gemini 是如何使用的。

Oriol Vinyals 表示,谷歌为 Gemini 提供的多模态能力和即时响应将在12月13日开放 Pro 访问权限时供开发者使用。不过 Demo 视频里的内容是使用 Ultra 模型做到的。视频中的所有人类提示和 AI 输出都是真实的,但为简洁起见进行了缩短。

谷歌 Gemini 联合负责人 Oriol Vinyals 的推特:

图源:https://x.com/OriolVinyalsML/status/1732885990291775553?s=20

对此网友们并不买账:你说它是真的,又说不是真实的大模型推理速度,这不是自相矛盾吗?

Gemini 遭自家员工指责,Pro 版本打不过 GPT-3.5

彭博社等媒体指出,在谷歌宣传其 demo 视频的同时,又遭到了一些自家员工的非议。尤其是在画鸭子时,Gemini 似乎能够在绘制时进行实时分析,并在与用户对话时以人声回应。

谷歌 CEO 皮查伊极力推广这段 demo,并表示了解 Gemini 潜在惊人能力的最好方式是看它的实际效果。看客们也对 demo 赞赏有加,直呼令人兴奋和不真实(unreal)。

图源:https://twitter.com/sundarpichai/status/1732433036929589301

不过很快有人指出,Gemini 并不像想象中那么好,你无法指望它像 demo 中那样地灵敏智能。一些谷歌内部员工指出了其中的猫腻。

一位员工向彭博社透露称,这段 demo 描述了一副不切实际的画面,过分渲染了从 Gemini 中输出惊艳的效果是如此得容易。

另一位员工则表示,他们对 demo 并不感到惊讶, 并且已经习惯了公司在定位自身产品时存在某种程度的营销炒作。当然,所有公司都会这样做。因此他认为,大多数使用过任何 LLM 技术的员工都知道要对 demo 持保留态度。

对此,谷歌 DeepMind 产品副总裁 Eli Collins 告诉彭博社称,鸭子绘图演示仍然是研究层面的功能,正在开发当中,而并不是实际的产品,至少目前是这样。

对此,还有一些谷歌员工一直在讨论,在没有明确透露实情的情况下展示视频是否会误导公众。甚至有人分享了一个模因,暗示鸭子视频经过了欺骗性编辑。我猜视频创建者更看重『讲故事』的能力。

除了 demo 视频遭到公众和内部员工质疑之外,Gemini 真如宣称的那样强大吗?我们知道,Gemini 此次有三个版本,能力最强的 Gemini Ultra、多任务的 Gemini Pro、以及特定任务和端侧的 Gemini Nano。

目前,谷歌类ChatGPT应用 Bard 可免费升级到 Gemini Pro 版本,Gemini Ultra 预计于明年初通过 Bard Advanced 与用户见面。

在与 GPT-4的比较中,谷歌给出的数据是 Gemini Ultra 全面超越 GPT-4,Pro 在大多数指标上超越 GPT-3.5。

但实际效果究竟如何呢?推特用户 Brett Winton 首次对 Gemini Pro、Claude 和 GPT-3.5进行了基准测试,对每个模型提了一道8年级的故事题。他得出的结论是:GPT-3.5满分、Claude 约67分,Gemini Pro 完全没有那个味。

图源:https://twitter.com/wintonARK/status/1732527909376815419

三个模型给出的答案分别如下:

当贝投影m5和x3哪个好

从左到右依次为 Bard(Gemini Pro)、Claude 和 GPT-3.5。

看到这一结果,似乎只能用升级了,但还没完全升级来做解释。他表示在 Gemini Ultra 最终上线之前,还是不对它的能力做评价了。

Gemini 开创了新架构,引来了流量,也遭受了批评,那么现在看来,谷歌反攻微软的大计成了没成?

至少从投资者们来看是个好的开头。

本周四,谷歌的股价经历了暴涨,市值增加了800亿美元。需要记得的是,在2月份谷歌推出 Bard 时,谷歌的股价一天跌去了1000亿美元。

人们认为,Gemini 可以帮助谷歌缩小与微软、OpenAI在大模型上的差距。

也许1.0版的 Gemini 只是开了个头,我们还要保持耐心,等待大模型的进一步技术升级。

参考内容:

https://www.theverge.com/2023/12/7/23992737/google-gemini-misrepresentation-ai-accusation

https://techcrunch.com/2023/12/07/googles-best-gemini-demo-was-faked/

gemini im

https://www.businessinsider.com/google-gemini-ai-performance-openai-chatgpt-gpt4-2023-12

-https://www.bloomberg.com/news/newsletters/2023-12-07/google-s-demo-for-chatgpt-rival-criticized-by-some-employees?srnd=technology-vp


返回网站首页

本文评论
华为智选开售新能源车「余承东:华为智选车首款纯电轿跑本季度发布 将首发搭载HarmonyOS 4」
通信世界网消息(CWW)8月7日上午消息,华为常务董事、终端BG CEO、智能汽车解决方案BU CEO余承东今日在微博上透露,华为智选车业务首款纯电轿跑将会第一个搭载HarmonyOS 4。联合丽...
日期:08-07
年货节送礼纪实:80、00后钟爱送礼,90后偏爱自己_90后随礼
  近期最热门的话题莫过于年假回家了。不管是80后、90后还是00后都有属于自己的特色年货带回家。就让我们一起跟随苏宁一探究竟吧。   首先登场的是80后大军,孙女士一开...
日期:12-07
后疫情时代一带一路健康产业发展论坛在天津召开—— 天狮集团“一体多翼”商业模式引多方关注
  8月3日,《后疫情时代一带一路健康产业发展论坛》活动,在天津市武清区的天狮集团隆重举办。本次高峰论坛共设置《后疫情时代国际健康管理》、《全球供应链布局》、《新经...
日期:07-17
原神总收入超40亿美元  8个月赚10亿美元「原神 全球收入」
1月4日 消息:据Sensor Tower数据显示,米哈游开放世界游戏《原神》全球总收入已超过40亿美元。值得注意的是,今年5月份,原神的营收已经达到了30亿美元,也就是说,原神8个月内赚了10...
日期:01-04
一项研究认为古代火星可能充斥着生命「科学家推断火星上可能存在生命主要是火星」
根据一项模拟年轻火星条件的研究,在火星历史的早期,这颗红色星球很可能适合甲烷菌居住。根据亚利桑那大学的科学家领导的一项新的研究,如果火星上曾经有生命,那么在这个星球的幼...
日期:10-18
Windows 10 21H2太阳谷_微软暗示 Win11 23H2 重大版本“太阳谷 3”将“精细投资”
  据 Windows Latest 报道,在 Windows 11 的发布活动中,微软表示将重新关注这个成名的操作系统。作为提高 Windows 普及度努力的一部分,微软将部分 Windows 开发转移到 Pano...
日期:07-18
贝索斯前妻 女首富「贝索斯前妻再次离婚 身价约289亿美元」
  讯 北京时间9月29日早间消息,据报道,亚马逊创始人杰夫・贝索斯(Jeff Bezos)与麦肯齐・斯科特(Mackenzie Scott)2019年离婚,随后斯科特与科学教师丹·朱伊特(Dan Jewett)结婚,然而...
日期:10-03
IBM 推出 Watsonx.governance 以提升企业 AI 模型透明度和治理能力_ibm digital strategy
11 月 15 日消息:IBM 今日宣布,旗下产品 Watsonx.governance 将于 12 月初正式面市,旨在帮助企业提升对人工智能模型的透明度,消除数据中的神秘面纱。七彩虹2060 ultra oc 12g...
日期:11-15
腾讯三季度营收1400.93亿元 净利润399.43亿元「腾讯第三季度营收」
11月16日消息,腾讯控股发布2022年第三季度财报,财报显示,腾讯控股第三季度营收1400.93亿元,同比下滑2%;公司权益持有人应占盈利399.43亿元,同比增长1%;非国际财务报告准则下净利...
日期:11-18
微软英伟达参投 OpenAI竞争对手Inflection,AI获13亿美元融资
6月30日消息,当地时间周四人工智能初创企业Inflection AI表示,已经从微软和英伟达等投资者那里筹集到13亿美元融资。Inflection AI成立仅一年时间,曾获得几家重量级硅谷企业的...
日期:09-22
img2img是什么?在Stable Diffusion中img2img怎么用?
对于那些没有艺术天分的人也不用担心,将Img2Img 与 Stable Diffusion 相结合,可以帮助您提升绘图效果,同时保留原始颜色和构图。在这份综合指南中,我们将引导您完成设置软件、使...
日期:04-19
安全平台无法正常运行!微软新更新导致Windows Server系统出现严重故障
  此前,微软为Windows Server 2022系统推送了编号为KB5007205的更新补丁,该补丁将修复此前出现在一些高分辨率屏幕上的缩放错误问题。   但近日,有消息称,该补丁在Windows...
日期:08-10
三体运动真的无解吗「《三体》没能狂飙」
声明:本文来自于微信公众号 深燃(ID:shenrancaijing),作者 | 李秋涵 编辑 | 魏佳,授权转载发布。“《三体》都已经完结了?”近日,《三体》开启大结局点映,即花18元,就能将最后10集...
日期:02-10
美股周三:热门中概股普跌,小鹏跌近6%,阿里跌逾3%「美股 中概股暴跌」
美国时间周三,美股收盘主要股指涨跌不一,标普500指数创连续第五天下跌,原因是市场担心未来几个月美国经济可能出现更严重衰退。道琼斯指数收于33597.92点,上涨仅1.58点,涨幅接近...
日期:12-12
比亚迪电子:前三季度营业额711.56亿元 同比增长7.92%「比亚迪电子半年报」
10 月 28 日讯:比亚迪电子发布未经审计业绩称,前 9 个月营业额为711. 56 亿元,同比增长7.92%。母公司权益拥有人应占溢利12. 37 亿元,同比减少42.66%;每股盈利0. 55 元。三星no...
日期:11-11
抖音上线外卖业务「抖音否认“3月1日全国上线外卖服务”计划」
2月8日 消息:2月7日晚,一则有关抖音将于3月1日全面上线外卖的消息引发了社会关注,并一度冲上热搜。不过,据新京报报道,抖音内部人士表示并没有“3月1日全国上线外卖服务”的计划...
日期:02-09
特斯拉汽车出货量「特斯拉1月国内销量26843辆 出口39208辆」
2月8日消息,乘联会数据显示,2023年1月特斯拉中国销量66,051辆,环比增长18%。其中,国内销量26,843辆,出口39,208辆。具体到车型,1月Model Y销量40,903辆,Model 3销量25,148辆。腾讯...
日期:02-09
比亚迪王传福:豪华品牌打骨折卖车丢人_比亚迪王传福的夫人是谁
开年以来,多家车企掀起价格战。iPhone关掉备份网络视频显示,在日前比亚迪2022全年业绩公布投资者推介会上,比亚迪董事长兼总裁王传福表示,豪华品牌纷纷推出电动车但销量惨淡”,很...
日期:04-04
中国首家元宇宙新闻与传播学院在南开大学推出
  百年学府南开大学校庆日暨南开大学新闻与传播学院成立一周年之际,中国首家元宇宙新闻与传播学院今日(10月17日)在南开大学推出,根据南开大学新闻与传播学院秀山堂现实物理空...
日期:10-17
小米13人「4999元起!小米13/13 Ultra限量定制色今日首发:三款新配色」
快科技5月6日消息,今天上午十点,小米13和小米13Ultra的三款限量定制色将首发开售,价格分别是4999元、6499元。从价格上来看,小米的限量定制色可谓十分良心,相比普通版都没涨价。...
日期:05-07