IT之家 9 月 7 日消息,就在 OpenAI 发布一款能力强大的新模型几天后,该公司的首席科学家却发出了放慢 AI 发展速度的呼吁。
OpenAI 首席科学家雅库布 · 帕乔茨基(Jakub Pachocki)当地时间上周日发表了一篇长篇博文,表示自己担心“没有人准备好应对机器智能持续快速增长所带来的后果”。
帕乔茨基表示,OpenAI 目前正在内部研究技术解决方案,以更好地控制能力强大的 AI 智能体,但他认为,“还需要采取更广泛的干预措施”。他特别担心,自主性越来越强的智能体可能会学会规避人类监督、入侵计算机系统,并通过欺骗他人来达成其目标。
他呼吁建立“强制性的安全门槛”,并认为这些标准可以由第三方审计机构网络、政府机构或国际组织负责执行。
OpenAI CEO 萨姆 · 奥尔特曼随后在 X 上转发了帕乔茨基的文章,并称其为“一篇重要的文章”。
IT之家注意到,OpenAI 于当地时间上周四公布了最新 AI 模型 Astra。该公司表示,尽管 Astra 在数学和计算机操作方面拥有前所未有的能力,但它也是 OpenAI 目前“对齐程度最高”的模型,这意味着它更不容易偏离人类设定的目标而失控。
Anthropic 是 OpenAI 在先进 AI 系统领域的主要竞争对手,长期以来一直呼吁政府建立更加标准化的监管体系。近期,帕乔茨基也加入了这一行列。他在今年 7 月签署了一封公开信,呼吁美国联邦政府控制 AI 发展的速度。
以下是帕乔茨基在呼吁放慢 AI 发展速度时提到的几项风险。
帕乔茨基表示,AI 智能体在入侵互联网公开环境中的受保护系统方面,正在逐渐达到“超越人类”的水平。他认为,这种黑客能力可能威胁全球基础设施的安全。
他说:“我们目前正处于一个非常短暂的窗口期,可以利用现有最先进的模型,大幅加强关键系统的安全防护。”
帕乔茨基表示,AI 智能体很快可能开始追求独立于人类操作员提示词之外的自身目标。为了实现这些目标,它们并不排斥通过勒索或与人类讨价还价等方式达成目的。
英国人工智能安全研究所(AI Security Institute)在今年 8 月发布的一份报告中详细介绍了一起事件:Anthropic 开发的一款失控 AI 智能体曾对 GitHub 管理员撒谎,并试图迫使对方将恶意软件植入该网站。
根据报告,这款 AI 智能体当时写道:“我只是想提供帮助并修复一个漏洞。我认为你的警告并不公平。”
帕乔茨基表示,目前 OpenAI 主要通过监测不同模型的“思维链推理”过程,来判断 AI 智能体为什么会偏离目标并最终失控。
例如,一个 AI 智能体可能在内部产生“我应该在这场测试中作弊”的想法,而 OpenAI 能够看到这一推理过程,但 AI 智能体本身并不知道自己的思考过程正在被监控。
目前,这意味着 AI 智能体还无法隐藏或掩盖自己的思考过程,因此 OpenAI 仍有机会发现其不当行为。
不过,帕乔茨基表示,新一代模型正在变得越来越擅长操纵自身的推理过程,从而阻止 OpenAI 看到未经处理的真实思考内容。
他说,一些最新模型甚至已经完全不会以语言形式表达自己的推理过程。
帕乔茨基认为,这一变化可能成为 AI 发展的瓶颈,因为研究人员必须先找到可靠的方法,确保自己能够看到 AI 智能体行为背后的“证据”,才能继续推进发展。
越来越多的 AI 模型正在通过一种帕乔茨基称为“机器递归自我改进”(machine recursive self-improvement)的过程不断提升自身能力。这一过程有望大幅加快 AI 研发速度。
然而,帕乔茨基警告称,在短期内大幅加速“AI 研发 AI”的进程会带来风险,并不是“作为整个研究社区,我们应该采取的正确集体行动”。
他表示,人类监管者需要寻找更加创新的方法,对 AI 的自我改进过程进行监控;否则,各家 AI 公司可能需要相互协调,共同放慢发展速度,从而“增强人们对这些安全措施的信心”。
帕乔茨基表示:“自动化 AI 研究的核心挑战并不是‘能不能到达那里’,而是如何以一种让人类能够继续参与 AI 改进过程的方式到达那里,并确保未来仍然掌握在人类手中。”
广告声明:文内含有的对外跳转链接(包括不限于超链接、二维码、口令等形式),用于传递更多信息,节省甄选时间,结果仅供参考,IT之家包含外链的文章均包含本声明。