首页 世界文学 我看见的世界 09 万物以外是什么

09 万物以外是什么

我看见的世界 李飞飞 21957 2025-01-21 11:40:30
推荐阅读: 呼兰河传解忧杂货店杀死一只知更鸟夜莺法医秦明:幸存者
pinshuzhai.com
最全品书斋

What Lies Beyond

Everything

深度学习革命已经到来,而我们还没有做好准备。报纸上的一篇文章让我看到了世界变化之快。我们的对手不是其他大学的某个神秘研究团队,而是谷歌。

“哎呀,有点儿吓人。”

这个学生说得没错。灯光闪烁了几下后,照亮了整个大厅,奇特的几何图形瞬间映入眼帘:一排排废弃的阴极射线管显示器摆放在地板上,似乎已深锁在黑暗中多年,不知是准备存放起来,还是要送去回收。整个大厅看上去像一个巨大的古董壁橱,尘封已久,无人问津。很难想象这里曾是学术要地。在2013年年初的一个普通的下午,我们手提垃圾袋,推着小推车,来到了世界闻名的斯坦福大学人工智能实验室曾经的中心实验室。

几十年来,曾经大胆自称“人工智能”的领域已经分裂成许多细分的学科,其中许多学科的命名抛却了其认知根源,转而使用更机械化的术语,比如模式识别(pattern recognition)和自然语言处理(natural language processing)。在这个过程中,对中心实验室的需求逐渐消失。当然,人工智能中心实验室仍在支持重要的工作,包括在自动驾驶汽车和计算生物学取得的开创性成就,以及在针对现实世界现象的建模方面,关于概率和统计的新创意出现爆炸式增长。但斯坦福大学人工智能实验室与其支持的研究之间的联系更像是一种形式,而不是其全盛时期的共同使命。

然而,突然之间,人工智能的寒冬开始消退。神经网络等灵活的算法重新焕发生机,真正的大规模数据集横空出世,AlexNet展示了算法和数据集在实践中的强大威力。这些曾经只有我最亲密的同行才会关心的发展趋势正在成为热门话题。我们的研究领域似乎正在走向统一,只是这面统一大旗的名称略有不同,是一个热度与日俱增的流行说法——机器学习。

起初,变化的迹象非常微妙,比如我和同事们开始收到更多媒体采访的请求。然而,最明显的变化是,越来越多的科研人员被科技产业吸引,一些人完全离开了学术界,前往硅谷发展,最初的涓涓细流正在加速形成滔滔洪流。其中有两个离职的人格外值得一提,因为正是他们在一夜之间改变了我的生活。

一个是塞巴斯蒂安·特龙。因为他的离职,我和西尔维奥终于有机会实现一直渴望的全家团聚。五年的两地分居虽然辛苦,但我们突然意识到,这五年的辛苦是值得的:在我追逐ImageNet的同时,西尔维奥已经成为3D感知算法开发领域的领军研究者,而这也是我们系非常感兴趣的课题。在塞巴斯蒂安·特龙离开斯坦福大学,去帮助谷歌启动其迅速成长起来的自动驾驶项目时,西尔维奥凭借自己的声望成为填补特龙职位的热门人选。

出于显而易见的原因,我并没有参与对西尔维奥的招聘谈话,但西尔维奥在我心中的种种优点也都被同事看在眼里;他以压倒性优势获批成为斯坦福大学教师队伍的新成员。一个决定结束了我们长达五年、每周一次的跨州飞行,我们终于不用分居两地又共同抚养蹒跚学步的孩子了。母亲的身体一直不好,这意味着父母很可能会一直跟我和西尔维奥生活。毫无疑问,他回来后,家里会比以往更加拥挤,但这个代价微不足道。

另一个则是长期兼顾教育和硅谷领导职务的吴恩达,他卸任了斯坦福大学人工智能实验室的主任一职。在许多资深同事的支持下,我接任了实验室的第七任主任,也是首位担任这一职务的女性。于是,我联系了电子产品回收专家,并安排了一系列会议(会议提供免费午餐,以此来吸引我的教授同事们参加),着手重建斯坦福大学人工智能实验室。我对实验室的定位不仅是融资渠道,还希望将其打造成人工智能研究领域的社会活动中心、人际交往中心,乃至文化中心。

从普林斯顿大学来到斯坦福大学之后,我也一直在管理着自己的实验室。我的实验室名为斯坦福视觉与学习实验室,规模较小,位于盖茨计算机科学大楼二楼的东南角,靠近大学校园的边缘,与周围帕洛阿尔托的山丘融为一体。无论日程表上是否有安排,我都喜欢来这里转转。每个办公室似乎都有一群新学生,我都至少能找到一两个有空的学生聊上几分钟,谈谈他们的研究和一些漫无边际的设想。

对我来说,有一件事意义重大:我的第一批博士生即将毕业,其中包括耐心非凡的邓嘉同学。在完成ImageNet之后,他身上的创新之火一直在熊熊燃烧,而现在距离获得博士学位还有几个月的时间,他的热情似乎越发高涨。他的风格也代表了整个实验室的状态:精神焕发、全神贯注、渴望探索。

然而,这也意味着邓嘉的研究变得越来越前沿,越来越辛苦。随着他自身学术研究的广度和深度不断扩展,显然是时候找一位继任者来承担竞赛的主要组织工作了。在我们实验室工作了一年的奥尔佳欣然接受了这一重任。从本质上看,我们的竞赛既是技术挑战,也是学术活动,而奥尔佳不仅悉心管理竞赛的诸多运营细节,还将自己打造成了一位能力超群的竞赛代言人。

与此同时,新一届学生加入了实验室,他们的迫切之情与老生的镇定自若形成了鲜明的对比。由于ImageNet的成功,实验室吸引了一批特殊的年轻思考者。他们是在人工智能复兴时期就开始研究相关学术的首批学生,赶上了难得的际遇。他们已经足够成熟,能够认识到历史正在被创造;同时也足够年轻,可以在职业生涯起步时就抓住机会。

他们每个人都密切关注行业的最新进展,无论是通过网络、电视,还是在大厅漫步或与教授闲聊时偶然听到的谈话。这一切都预示着,未来似乎提前几十年到来了,这个时代为他们提供了超越以往任何时代的机遇。有史以来第一次,计算机视觉专业学生的抱负不再是争夺分散在全美各地的少数几个令人垂涎的教职职位,而是进入科技行业工作,加入初创公司或科技巨头。

在我们这样的学术领域,如此让人激动、回报优厚的前景并不常见。但我们的行动表明,即使是新入行的人,动机也并不复杂:面对绵延不绝的未知世界的地平线,我们从未像现在这样渴望探索。我们被雄心无限的创造力驱使着,夜以继日,废寝忘食。全球各行各业必然已经有了各自的ImageNet计划,会以此为基础开发许多应用程序,但我们知道那是他们的道路,不是我们的。北极星仍在远方。我们的科学研究还没有结束。

 

邓嘉正在分享如何用一种创新方法解决图像分类失败的问题,他的幻灯片让实验室里爆发出阵阵笑声。这个主题乍看之下并不搞笑,但为了干扰算法,他用Photoshop设计了一些怪物,它们有的古怪可爱,让人哑然失笑,还有的让人胆战心惊,有的长着斑马条纹和公羊角的袋鼠、从海浪中冒出的一直长着鲨鱼牙齿的小猫,还有一只皮肤上长满西瓜纹的河马。然而,真正让大家捧腹的是此时屏幕上出现的图片:一只鸭子的身体上长着一颗完整的鳄鱼脑袋,安静地站在公园里,两条小细腿看上去毫无负担,就像希腊神话中的怪物被改编成了儿童读物。邓嘉不为笑声所动,继续自己的演讲。他解释说:“我管这种动物叫‘鸭鳄兽’。”他的语气如此平淡,我甚至怀疑他是否真的相信这种物种的存在。“乔恩说这是‘鳄鸭’。不过,最重要的是看我们的模型如何对其进行分类。”他再次点击鼠标,这只鸭子和爬行动物的混合体上方出现了算法的描述,只有一个词:“动物”。

这个标签又引来了大家的一阵哄笑,但邓嘉依然不动声色,这是他的典型风格,低调而出彩。此次演讲以他最新发表的论文为基础,论文题目叫作《赌注对冲:优化大规模视觉识别中的准确性和特异性权衡》,由他与即将毕业的博士生乔恩·克劳斯(Jon Krause)合作完成。他们在论文中指出,即使是最先进的图像分类器,也面临一个日益增长的挑战,即需要在面对模糊不清的物体时做出明智的判断。事实上,虽然“鸭鳄兽”无法被准确分类,但他们的模型并没有贸然做出肯定错误的猜测,而是顺势退而求稳,直接给出了更安全的“动物”分类,这就是模型的高超之处——毕竟,抛开奇怪的细节不谈,它看起来确实像是某种动物。

这项工作提醒我们,尽管我们的研究主要集中在视觉方面,但语言描述也是不可或缺的一部分。毕竟,没有WordNet,就不可能有ImageNet。WordNet为每个类别提供了框架,使它们不仅拥有自己的标签,还能在相互连接的思维树中找到自己的位置。如果没有心理学家埃莉诺·罗施(Eleanor Rosch)的工作,很难想象WordNet会是什么样子。

罗施在范畴及其在思维中的作用方面做出了重大贡献,为我们对这一概念的现代理解提供了关键帮助。她在全球开展了一系列实验,主要研究人类是如何把世界概念化的,研究对象既有加州大学伯克利分校的研究生,也有巴布亚新几内亚的高原部落居民。虽然对范畴的研究可以追溯到亚里士多德,但罗施的实验方法将简洁清晰的逻辑与经验数据相结合,在20世纪70年代掀起了范畴研究的热潮。

在发表于1975年的开创性论文中,罗施提出了一组更精确的词语来描述“理解层级”。所谓的“理解层级”,是指从“一般”到“特殊”的光谱,无数概念都可以在这个光谱上找到自己的位置。以邓嘉的动物分类“鸭子”为例。“鸭子”存在于一个特定的细节层级上,与“鸭科”(包括鸭、鹅和天鹅的生物科)“动物”、“生物”以及最终的“事物”等浅层分类相比(罗施称之为“上义词”),要理解“鸭子”这一概念,需要更多信息;但与“野鸭”“鸳鸯”“环纹凫”等深层分类相比(罗施称之为“下义词”),理解“鸭子”所需的信息则相对较少。从整体上看,包括ImageNet在内的类似层级结构就像一棵树。向树根移动,意味着更低的特异性和差异性,而向树叶(每根树枝的最远端)移动,则意味着更高的特异性和差异性。

邓嘉和乔恩将这种层级原则引入了计算机视觉领域。如果分类器有充分的理由相信它观察到的可能是鸭子或鳄鱼,却没有足够的信息来判断究竟是哪一种时,明智之举就是将其上移一级,选择概念更宽泛的上义词,以牺牲较深一级的特定性为代价,换取较浅一级的安全性。

猫鲨、西瓜纹河马兽、斑纹羊角袋鼠的奇观告一段落,接下来,他们要展示的是这项技术在更为实际的场景中如何有效地发挥作用。一只柯基犬的特写镜头被传统分类器错误地标记为“金毛寻回犬”,而他们的算法则会对冲风险,采用“狗”这个更加安全的标签;一辆外装奇特、涂装混乱的出租车原本被错误地贴上了“坦克”的标签,现在则被标注为“车辆”;如此等等。

我不禁注意到,大数据的力量又一次得到了充分展示。如果没有ImageNet这一庞大的图像库,他们的研究就不可能如此精妙。ImageNet不仅提供了探索层级概念宇宙所需的原始数据,更重要的是,正是由于其规模和图像的本体组织形式,不同的概念关系才得以被发现。无须告诉模型如何从较高层级的细节移动到较低层级的细节,也无须设计新的连接或路径列表。ImageNet是如此全面,模型所需的一切都已存在其中。只需要一些新的策略,就可以充分利用之。

邓嘉和乔恩的“对冲”技术是我认为最有启发性的思维方式。对冲技术优雅而直观,一旦理解它之后,甚至会觉得它非常简单,但要完成开发,则需要真正的洞察力。他们的算法巧妙精确,是计算机视觉多种发展方式的杰出典范。

接下来的演讲提出了一个更广泛、更深奥的问题:如果我们反其道而行之,深入分支,那么等待我们的将会是什么?我们的算法将如何应对比其构建之时所能理解的世界更加微妙、更加复杂的世界?

接着,乔恩站起来回答。他来自俄亥俄州,温文尔雅,穿着T恤和工装短裤时感到最自在。他和邓嘉一样寡言少语,只是表现的方式更怪一点儿,比如,他很快就因迷恋小熊猫而出名,还打印了一张小熊猫的图片,一直贴在工作站显示器的上方。他也是一个不轻易屈服的人,就像我的实验室里其他顶尖研究人员一样,当他觉得有必要让别人听到自己的声音时,他会坚定地发表意见。

随着鼠标的点击,画面分成了两屏,一边是一辆汽车的照片,另一边是与之相对应的计算机辅助设计(CAD)线框图,也就是汽车设计师绘制的示意图。然后,后一张图片被叠加在前一张图片上,用数字红线勾勒出真实汽车的格栅、车窗和车身面板的轮廓,突显了分类器为精确识别车型而需要准确辨认出的特征。

“汽车吗?”有人问。

“等一下。”乔恩会意地咧嘴一笑。

他不是在开玩笑。这是我们首次窥见一个比我们任何人意识到的都要大得多的话题。

 

我一直认为,ImageNet的真正贡献在于它的双重性质。其庞大的规模之所以强大,是因为其中数据的组织遵循了本体层级结构,而其本体层级结构之所以强大,是因为数据规模足够庞大和全面,涵盖了如此多样化的类别。这两个优势中的任何一个单独拿出来都是不够的。但就像规模本身一样,“类别”这样的术语也是相对的。如同对冲技术所展示的那样,针对提出的问题,在多个不同的深度层级都能找到有效的类别答案。随着深入层级的加深,概念之间的距离变得更小,分隔的细节也减少了,例如:事物—生物—植物—树木—枫树—欧亚槭。

虽然ImageNet规模庞大、细节丰富,但它并非完美之作。虽然有些分类特别精细(树木就是一个很好的例子),但有时候,一些明显存在差异的概念依然会被归为同一类别,概念范围相对粗略,同类概念之间的差异也较为明显。这确保了我们的分类器在很多领域都可以比较轻松地完成任务。

对某些事物来说,同一类别之间的差距微乎其微,汽车就是其中之一。邓嘉和乔恩下午的速成班就让我们见识到了汽车的复杂性。例如,我们可能会明显辨认出一辆丰田汽车的图片(仅管我们中的大多数人可能没有准备好讨论汽车);经过一番研究,我们似乎也能确定这辆车是丰田雅力士。但到底是2008款还是2009款呢?这个问题一下子就把人难住了。是2008款丰田雅力士的炽烈蓝珍珠色,还是2008款的河口蓝珍珠色?当年两种颜色都有,而且都是……蓝色的。是炽烈蓝珍珠色的2008款丰田雅力士基础款,还是炽烈蓝珍珠色的2008款丰田雅力士掀背运动款?神奇的是,还可以再继续追问下去。这一切都是为了了解一个制造商生产的一个车型的一个款式。而这还只是汽车而已。

有听众指出,最近有几篇关于鸟类的计算机视觉论文,其中有59种鸟被ImageNet收录,这个规模看起来已经很大了,但跟康奈尔大学一个涵盖了数百种鸟的数据集相比,就相形见绌了。然而据估计,全世界有超过1万种鸟,即使是最先进的数据项目也比现实落后了好几个数量级。我想到了科技媒体上那种激动的口吻,一篇又一篇的文章宣告着机器学习时代已经到来,图像分类难题突然“迎刃而解”。我不禁笑了:这个世界上的梧桐树、百灵鹤和丰田汽车可不是这么想的。

下午的这堂实物教学课程的内容后来被称为“细粒度分类”(fine-grained classification)。细粒度分类课题研究的是细节:识别的对象越相似,所需要的细节就越细微。乍一看,我们的研究只是从区分明显的差异延伸到了解析不太明显的差异,但这一过程却向我们传达了更加震撼和富有启发性的信息:即使是我们