中文深度讲稿 / AI reviewed
Huberman Lab - Using AI to Increase Your Intelligence & Enrich Humanity | Dr. Fei-Fei Li
2026-08-13 · 5,376 字 · 8 章节
今天我们要讲的,是 Andrew Huberman 与人工智能和计算机视觉学者李飞飞的一场长谈。
如果要用一个问题概括整场对话,那就是:AI 到底应该让人变得更有能力,还是让人逐渐失去能力?
这不是一场单纯预测未来产品的谈话。两人从视觉和大脑讲起,经过 ImageNet、Transformer、创造力、医疗、教育和机器人,最后落到一个更根本的命题:技术能做什么固然重要,但人希望它做什么、谁有权决定、它是否保留人的能动性,可能更加重要。
以下内容仅按访谈表述整理。其中的历史数字、案例和未来判断没有在这里做外部核验;医疗部分也只是技术讨论与个人经历,不是医疗建议。
讨论框架:以人为中心的 AI
李飞飞说,视觉是智能的基石。
为什么?先看演化。按她在访谈中的说法,大约五点四亿年前,早期海洋动物开始感知光。随后大约一千万年里,寒武纪出现物种大爆发。感光的意义,并不只是“看见了”。一旦能发现食物、捕食者和配偶,动物就能依据环境采取行动,整个生存方式都改变了。
到了人类,视觉相关活动约占一半皮层活动。儿童也是先能看,后来才发展语言。所以,视觉不是智能边缘的一项功能,它参与塑造了我们怎样认识世界。
人工智能的发展有一条平行路径。自一九五零年代起,研究者从哺乳动物视觉系统的层级结构获得灵感:先处理简单局部信息,再逐层形成复杂表征。这启发了早期神经网络。不过,李飞飞提醒,今天的模型已经有数千亿乃至万亿参数,不能再把它简单当成大脑的复制品。
接下来,现代 AI 的一个关键转折出现了。
大约在二零零六年,计算机视觉领域长期进展有限。常见想法是算法还不够聪明,但李飞飞团队追问了另一个问题:会不会是机器看过的世界太少?
一个六岁孩子已经拥有海量视觉经验,能理解数以万计的物体类别。机器如果只接触少量、精心挑选的图片,怎么可能形成类似能力?
于是,团队建立 ImageNet,收集约一千五百万张日常物体图像,让机器学习识别麦克风、杯子、椅子等对象。
这背后是一条非常重要的推理链:人的智能依赖大量经验;当时机器缺的不只是一套更好的规则,也缺规模足够大的经验;数据规模改变后,旧算法可能表现出新能力;再加上 GPU 计算,现代图像识别才迎来突破。
从二零一零年起,ImageNet 挑战提供统一考场。系统要在覆盖一千类的百万级统一数据基准上,从一千个类别中说出主要物体是什么。随机猜中的概率只有千分之一。二零一二年,误差率突然大幅下降,成为一个清晰拐点。大约三年后,机器在这项特定任务中超过了特定的人类图像分类基准。
这里必须加上限定:这不是说机器拥有了完整的人类视觉智能。测试本身要求分辨相似犬种等细粒度类别,人也会受记忆和类别相似性影响。机器超过人的,是一个明确、封闭的千类命名基准。
真正重要的是,GPU、成熟神经网络和大数据在这里完成了汇合。
视觉、ImageNet 与现代 AI 的转折
ImageNet 之后,这套配方迅速扩散。语音识别、声音分析、自然语言处理都获得推动。李飞飞举了一个很有画面的例子:研究者开始用机器学习研究鲸歌。
二零一七年,Transformer 架构公开出现。更强的网络架构,遇上互联网上更丰富的文本,再加上更强的 GPU,推动自然语言处理进入下一阶段。从二零一七年到二零二二年,又经过大约五年,才走到 ChatGPT 的公众时刻。
这段历史提醒我们,所谓“一夜之间改变世界”,背后通常是算法、数据、算力和多年积累共同作用。
可是,机器虽然能从海量数据中学习,人类儿童却展示了另一条令人困惑的道路。
假设书架后露出一截尾巴。一个孩子会结合室内环境,猜它更可能是猫而不是狐狸。
旧一代算法可能会先识别家具,确认这是室内,再从十个候选动物里逐步排除。现代模型则通过海量训练,把猫尾、室内场景和其他局部线索变成参数空间中的模式,于是直接给出更接近“猫”的判断。
机器在这里很强,但儿童更神秘。孩子也许只见过三到十只猫,就能在遮挡、新角度和运动中认出猫。他们不需要下载整个互联网的猫图。
所以,完成同一种判断,并不代表使用了同一种学习机制。机器依赖大规模样本形成的权重;儿童的少样本学习和对象恒常性,则提示人脑里还有很多机制没有被解释。
视频又给机器增加了时间。静态图片只能告诉模型“这是什么”,视频让它看到“接下来发生什么”:猫怎样走,苹果怎样落。大约十年前开始加入视频训练后,模型逐渐学习帧与帧之间的一致性和世界的动态模式,视频生成由此发展。再往前一步,研究者希望机器不只模仿苹果下落,还能逼近背后的物理规律。但李飞飞也明确说,这些能力仍不完美。
机器学习、人脑学习与互联网数据的边界
当前 AI 的力量,很大程度来自互联网。那里有数十年的文本、图像、声音、音乐和视频,像一个巨大、多模态的人类知识库。
但互联网不等于全部人类认知。
如果一个念头从没说出口,一种情绪从没被传感器记录,一段记忆只存在于某个人心中,它就没有进入训练数据。抽象艺术带来的不可言说体验、童年故居引发的怀旧,或者艺术家心中突然形成的独特表达,都属于这种私人经验。
李飞飞的说法有一个重要限定:她讨论的是当前 AI 的数据入口,而不是断言未来永远不可能。她的逻辑很直接,没有被记录的信号,今天的模型就无法直接访问。
这个边界,也决定了她怎样看 AI 创造力。
李飞飞用 AlphaGo 的第三十七手说明机器可以表现出一种特殊创造力。她谈到与李世石的五局比赛,并指向第二局中的第三十七手。围棋拥有明确规则和目标,AI 可以用计算和记忆保存、搜索人类难以同时掌握的大量走法,于是产生让人意外的策略。
但如果问题需要发明一种从来不存在的方法呢?
以数学为例,机器可以掌握人类数百年积累的工具,而单个数学家不可能记住全部知识。这使 AI 很适合扩展搜索和组合。但某个未解问题如果恰恰需要尚未被发明的新方法,仅仅检索旧工具就不一定够。
因此,李飞飞更看好“混合创造力”:机器扩展计算、记忆和搜索,人类贡献问题意识、价值判断,以及来自私人记忆与情绪的表达。
这不是在争论人和机器谁更有创造力,而是在寻找两者怎样组合得更强。
创造力、能动性与不可轻率拟人化的人类经验
主持人提出一个未来设想:也许在五到十年内,非侵入式传感器能读取更多脑活动、心率和生理状态,让 AI 更理解个人情绪。
李飞飞没有简单回答“好”或“不好”。她强调,技术能不能做,与人愿不愿意使用,是两回事。
她反对把 AI 描述成一种必然替代人的力量。因为一旦接受这种叙事,人就像提前放弃了自己的能动性。技术更合理的目标,应该是增强人的动机、能动性和尊严。
她用血液检测打比方。专家可以解释工具和风险,但不能因为普通人不懂技术,就替他们垄断所有价值判断。公众越理解技术,就越能减少无谓恐惧,做出知情选择。
同样,科学传播也不能只说“相信专家”。面对快速发展的科学和 AI,公开不确定性、解释过程、让不同背景的人发声,反而更有利于信任。模型依赖给定的数据和规则;如果新证据改变了教科书规则,模型能够推断的空间也会改变。主持人以约十二年前对动作电位形状的认识为例,又假设它可能有一百种形状,想说明科学并不是一套永不改变的封闭答案。
AI 有一种人类很难具备的能力:同时保存并综合跨学科海量知识。单个研究者受专业和记忆边界限制,机器却可能把不同领域的方法放在一起搜索。李飞飞用大约一百五十年前电力带来的变化作类比,认为 AI 可能重写科学发现和医疗信息流。
主持人还谈到自己曾用 AI 帮忙区分眩晕和低血压相关症状。这种系统可以辅助整理可能性、帮助人提出问题,但不等于自动完成临床判断。
手术案例更能说明边界。李飞飞转述了父亲接受机器人辅助肝脏手术的经历。手术由外科医生操控 Da Vinci 系统完成;据她在节目中的个案描述,父亲的失血量约为典型手术的十分之一。这个私人案例不能外推为机器人手术的一般疗效。
关键在“外科医生操控”。肝脏高度血管化,而且不同人的结构差异很大。李飞飞说,即使假设全球积累了一百万台手术数据,也未必覆盖所有罕见情况。数据不足、分布不全,就会限制自动系统的可靠性。
所以当前更稳妥的方向,不是让机器单独接管高风险医疗,而是专家与 AI、机器人协作。
科学发现、医疗协作与多方治理
有些直觉可以说出来,AI 就能通过提示帮助分析。有些状态可以被传感器捕捉,机器也能参与判断。
但生活中还有另一种直觉:你看见一个熟人,觉得他今天不对劲,却说不清为什么。如果这个信息只存在于你的个人经验里,没有被语言或传感器捕获,模型就没有入口。
动机、恐惧、爱和同理心也是如此。工程师可以让机器人搜索得更深、行动优先级更高,看起来像是“更着急了”。可这只是数学目标发生变化,不等于机器体验了人的紧迫、恐惧或爱。
把优化行为拟人化,会混淆计算和主观体验。人的同理心可能来自自己的痛苦记忆,而机器没有相同的私人经历来源。
不过,这并不意味着机器无用。恰恰相反,人机结合可能更强:机器处理被记录的信息,人负责情境判断和对他人的关切。
李飞飞给出一个极端但清楚的例子:汽车当然可以被编程为在某个时间自动关闭刹车,但没有社会会因为技术可行就允许它。
这句话划出了 AI 治理最重要的边界:从“能不能做”到“应不应该做”,中间还有法律、道德、社会规范和专业规范。
她主张多方参与。研究者、企业、政府、公众,以及医疗和教育等应用领域的专业人士,都必须进入决策,而不是由单一技术团队包办。她提到二零一八年前后推动以人为中心的 AI 工作,也用生物医学作类比:修改狂犬病毒用于果蝇实验,即使研究者假设安全性达到百分之一百,仍要接受专业规范;人类受试研究需要 IRB;AI 与生物医学交叉的高风险应用,也可以考虑 FDA 一类监管路径。
她给出的答案不是“监管压倒创新”,而是教育、专业伦理和高风险监管同时推进。
年轻大脑、提示能力与教育者支持
谈到年轻大脑,李飞飞指出两个最坏方向。
一个是彻底放任。AI 和被动内容消费如果拿走年轻人的学习动机,他们可能只接受答案,避开学习中必要的时间、努力,甚至痛苦。这样不仅影响知识,也可能妨碍脑和行为发展。
另一个是彻底禁止。因为担心作弊就不让学生接触 AI,也会让他们错过深入学习的工具。
理想状态是什么?学生保留自己的问题意识和努力,把 AI 当作随时可追问的学习伙伴。例如学习有机化学时,可以反复追问分子结构和方向,补足助教数量和办公时间的限制。AI 应该“超级赋能”学习者,而不是替学习者完成学习。
这里还引出一种新素养:会提问。
高质量提示不是一句魔法口令,而是需要教育和练习的技能。一个人知道得越多,越能提出好问题,也越能判断回答是否可靠。好的提示过程类似苏格拉底式追问:不是直接要最终答案,而是让 AI 出题、反问、逐步推进,让学习者继续思考。
具身 AI 的意义,是让智能从语言和屏幕走进物理世界。系统不仅回答问题,还能感知并行动。
访谈谈到,脑机接口和数字化身可能帮助瘫痪者在多年后重新交流;机器人则可以搬运、取物、采购杂货、辅助照护,或者进入山火等危险环境救援。
李飞飞更看好这些方向,而不是用机器人取代家庭关爱。护士一个班次可能行走数英里。如果机器人承担重复搬运,医护人员就能把时间留给判断、沟通和照护。家庭中,一个能完成多种任务的机器人,也可能比摆满单功能设备更容易被接受。谈话还用照顾六个月大幼犬作了生活化类比。
但硬件比软件慢。面对未来十二个月的预测,她保持谨慎,并认为两三年也太快;在被追问时,她以三十年作为机器人观察尺度。这是节目中的预测,不是确定时间表。实体机器人要面对安全、机械和不可控环境,不能简单照搬聊天软件的迭代速度。
具身 AI 与公众参与
如果技术总由少数人先造完,公众最后只能选择接受或拒绝,人的能动性仍然很弱。
李飞飞认为,公众应该更早参与,提出自己希望 AI 解决的问题。比如,能不能有一种保护孩子步行上学的智能伙伴?能不能帮助个人安全?这里不是说这些产品已经成熟,而是在强调设计顺序:从人的需要出发,而不是先有能力,再寻找使用场景。
她也反对两种极端叙事。末日论放大恐惧,乌托邦叙事掩盖风险。受十二到二十四小时媒体周期驱动,两种说法都很容易传播,但都会削弱公众参与。
更有价值的传播,是具体讲述 AI 如何改善健康和生活,例如帮助处理宠物或儿童疾病,并让理解人性、社会和伦理的人进入技术决策。
语言智能不是 AI 的终点。李飞飞认为,下一阶段的重要方向是空间智能和物理智能。
她提到自己在二零二四年初创办 World Labs,希望构建能生成三维、四维世界和交互环境的基础模型。系统既可以学习手机、相机采集的现实世界,也尝试把一句话、一张图片或一幅草图中的“心中世界”,转化为可以进入和操作的环境。
这类环境可能用于创作、机器人训练、设计、医疗和教育。她用电影工作流举例:过去十五到二十年,数字工具已经让脚本逐步变成图片和视频;下一步,想象或许会被转化为可交互世界。
但技术进入影视行业,也必然改变工作。
空间智能、影视创作与工作转型
节目讨论时,AI 已能从脚本生成镜头和短片,也有人设想把这些能力用于更长内容的组装;但访谈没有确认一部成功的全 AI 长片已经完成。
李飞飞强调,一部作品独特的情感、视角、运镜和人物塑造,仍来自人类创作者。她与 Ben Affleck 讨论 AI 电影制作时,把问题拆成两部分:模型能做什么,以及行业里的人会受到什么影响。
岗位确实会改变,有些损失也是真实的。关键不是假装变化不存在,而是让技术人员和行业内部人士共同设计工具。前者理解模型能力,后者理解文化、流程和审美。只有双方合作,AI 才更可能增强创造力,而不是拿走创造者的控制权。
她用胶片相机店在数码化后转型作类比。技术变迁会带来损失,也会产生新机会;行业将重新组织,劳动者需要再技能化和技能升级。
谈话最后回到开场。
李飞飞说,人类总会看到上一代哀叹下一代无知、粗鲁、遗忘过去。但从历史长弧看,人类总体还是向更好的方向前进。她并不否认暴行、倒退和挫折,只是不愿先验认定年轻一代会因为新技术而退化。
孩子当然会用技术娱乐,但他们也好奇,也已经开始主动使用 AI。
她真正担心的是教师和家长。社会,尤其是硅谷,没有给他们足够的信息、资源和尊重。人们热烈讨论七到二十岁学生怎样用 AI,却很少认真支持基础教育阶段,乃至从基础教育到大学阶段的教育者。
ChatGPT 在二零二二年十一月发布后,她首先联系孩子所在的小学,希望直接向学生和教师解释变化。这个动作表达了一个朴素问题:为什么技术圈很少把身边的教师当作第一响应对象?
作弊等问题当然真实存在。但答案不应该是训斥教师、绕开教师或简单封禁,而应该和教师共同设计新的教学和评估方式。支持教师和家长,才可能真正帮助孩子正确使用 AI。
人脑启发了神经网络和机器视觉;机器如今又反过来帮助我们理解、补充和扩展人脑能力。
这场访谈把当下称为一个文明级时刻。所谓谨慎乐观,至少包含三层意思。
第一,承认 AI 的能力,也承认数据、硬件、风险和私人经验构成的边界。
第二,始终把人的动机、能动性、尊严和选择权放在中心。
第三,不让少数技术人员独自决定未来,而是让教师、家长、专业人士、政府和公众共同参与。
AI 是否丰富人类,不只取决于模型有多大,也取决于人是否继续提出问题、承担判断,并主动塑造工具的方向。