谷歌发布Gemini 2.0,原生多模态大模型

发布时间: 访问量:2

谷歌Gemini 2.0发布:这次OpenAI真的遇到对手了

说实话,Gemini 2.0发布之前我是有点怀疑的。谷歌这两年在大模型上一直慢半拍,每次发布都被OpenAI压一头。但这次实测完,我得说:谷歌这次是真的把差距追回来了,甚至在某些地方还反超了。

先说最直观的感受:多模态是真的原生

之前所有所谓的"多模态大模型",其实都是拼起来的——一个视觉模型看图,一个语言模型写字,中间做个对接。Gemini 2.0不一样,它是从一开始就把文本、图片、声音、视频揉在一起训练的。

什么概念?你扔给它一段10分钟的视频,不用你手动配音频字幕,它直接就能看懂里面在干嘛——谁在说话,说了什么,镜头切了几次,背景音乐是什么情绪。我测试的时候扔了一段公司年会视频,它居然能准确说出"这是一段热闹的年会场景,主持人在台上讲话,台下有人在鼓掌,背景音乐是很嗨的流行歌"。这个能力之前没有任何模型能做到。

语音对话更夸张。和Gemini 2.0打电话,它的反应延迟只有200毫秒,比人跟人打电话还自然。你打断它,它能马上接话;你说一半想改主意,它能跟着你的思路走。之前用其他AI语音,总感觉像在跟一个提前录好音的机器人对话,Gemini这次真的像在跟人聊天。

Agent能力是隐藏大招

很多人没注意到,Gemini 2.0最大的升级不是多模态,而是Agent能力。谷歌把Project Astra的技术全整合进去了,Gemini现在能自己操作浏览器——你让它"帮我订一张下周五从北京到上海的高铁票",它自己打开12306,选日期选车次填乘客,最后到支付那一步停下来等你确认。

这个能力有多可怕?以后你不用自己一个个APP来回切了。AI帮你操作,你最后点个确认就行。我估计以后大多数手机APP都不用装了,一个Gemini就全帮你干了。

谷歌的牌比OpenAI好打

以前大家觉得OpenAI厉害,是因为它模型做得好。但谷歌的优势是它有自己的生态——安卓手机、Chrome浏览器、谷歌搜索、谷歌云。Gemini出来之后,这些东西会全部打通。

你手机里的照片、邮件、日历、文件,Gemini全部能访问。你问它"我上周跟张三聊的那个项目,文件发我一下",它直接就找到了。这种深度整合是OpenAI比不了的——OpenAI再厉害,也进不了你的手机系统底层。

我的判断

大模型这场仗,之前是OpenAI一家独大。Gemini 2.0出来之后,正式进入了双雄争霸的时代。对用户来说这是好事——两家打价格战,抢用户,最后便宜的是我们。

但别高兴太早。模型能力越强,对算力的要求就越高。Gemini 2.0跑起来一次推理的成本是Gemini 1.5的三倍。谷歌财大气粗扛得住,小公司就别想自己训练大模型了——这游戏已经不是普通人能玩得起的了。

AI盒子观点:谷歌这次终于交出了一份像样的答卷。但大模型竞赛到最后,拼的不是谁模型强,而是谁离用户更近。这一局,谷歌手里的牌真的不错。

更多文章