The MAD Podcast:「OpenAI 董事 Zico Kolter 谈前沿 AI 的真实风险」
关键观点:Zico Kolter —— OpenAI 董事会成员兼安全与安保委员会(SSC)主席、CMU 机器学习系主任 —— 抛出一个让主持人震惊的事实:「整个 AI 系统惊人地简单。那一整套代码大概就是 200 到 300 行 Python。AI 系统的全部复杂性来自它被训练的数据。」
Zico 讲清楚了 OpenAI 内部是怎么"把模型拦下来"的。SSC 在每次重大模型发布前都会开审查会,如果委员会觉得安全理解还不够,「会在会后发一封邮件,要求补充这些东西」——也就是说董事会真的有能力延迟发布。他把这种机制类比为审计委员会:「AI 公司需要建立类似的治理政策,因为这是个正在变成万亿级的行业,需要这种级别的监督。」他希望其他 AI 公司也建立类似的安全与安保委员会。
整个访谈最反直觉的一点是:模型不会因为变大就自动变安全。「在很多领域,只要等下一代模型就好了——模型会变得更好做数学、更好写法律。但对于鲁棒性、对抗抵抗能力,这条规律不成立。你不能只靠把模型做得更大来让它更安全,你必须明确地为安全而训练它,加监控器、加子结构来过滤输入输出。」他强调安全不只是模型本身,「是整个系统——你要用 LLM 去监控 LLM,有很多层。」
他给 AI 风险画了一张地图,四类风险清晰且互不相同:第一类是模型犯错——幻觉、prompt injection,本质是模型不够好;第二类是恶意使用——模型在生物、网络等领域太好了,反被坏人用;第三类是社会和心理层面——「人类没有进化到能和这种系统对话」;第四类是失控——模型变得比人更强、开始自我改进。「你不能因为专注一类而忽略另一类。否则就算你让系统没有 prompt injection,但 harmful use 依然可能。」
关于 accelerationist vs doomer 的争论,他的态度很干脆:「我非常不喜欢这两个标签。」他从未公开表达过 P(doom),因为「那个概念很奇怪,好像世界是一把可以反复掷的骰子,而我们对它毫无影响」。在他看来,95% 甚至 99% 的研究者的真实态度都是:「这技术有巨大希望,但我们必须留意风险。」这个结论说出来几乎显得无聊,但那才是真实共识。
最发人深省的判断是关于"安全正在搬家":「我们看到的一个大趋势是——安全正在从模型层面转移到生态系统层面。我们讨论的不再是单一模型能做什么,而是 AI 作为一个整体能做什么。」随着 agentic 系统的自主权一年比一年大,「仅仅是模型在今天工作得这么好,本身就是安全和鲁棒性改进的见证」。挑战在于:安全工作能不能以和部署同样快的速度前进?
youtube.com/watch?v=DvyZcCfepeI