GPT-2:曾被认为太危险而推迟发布(2019)
- #GPT-2
- #OpenAI
- #AI安全
- #语言模型
- #技术历史
GPT-2 是 GPT-1 的直接放大版,拥有更多的参数并在更多数据上训练。然而,它曾因过于危险而被 OpenAI 推迟发布:出于对技术恶意应用的担忧,我们不会发布训练好的模型。作为负责任披露的实验,我们只发布了一个小得多的模型供研究人员实验,以及一篇技术论文。
GPT-1 发布时没有引起如此严重的担忧。因此,上述声明让公众好奇 GPT-2 在生成类人文本方面究竟有多强大。而且,GPT-1 和 GPT-2 的区别是什么?
1. 区别:GPT-1 vs. GPT-2
在 GPT-1 论文中,他们实验了模型在零样本任务迁移上的表现,即直接使用预训练模型结合启发式解法来执行特定任务。实验成功表明,无需监督微调,语言模型已经包含执行特定任务所需的信息。所有这些知识都存储在网络参数(权重和偏置)中。
换句话说,更多的参数应该会提高语言模型的能力,使其对这些特定任务更加鲁棒。从这个意义上说,微调只是为模型针对特定任务做了最后的修饰,因此 GPT-1 的主要优势在于预训练。所以,用更多参数预训练这样的模型应该能进一步提升性能。
因此,GPT-2 是 GPT-1 的直接放大版,拥有更多参数并在更多数据上训练。实际上,GPT-1 和 GPT-2 在架构上没有区别,两者都基于 Transformer 的解码器。但它们的主要区别在于参数数量以及训练文本的数量和多样性,这使得神经网络能够获取更多的语言知识和理解,并将其吸收到参数中。
GPT-2 的最大模型(2019年2月未发布)拥有 15 亿参数,是 GPT-1 的 10 倍。他们在 40GB 的网络文本上训练该模型,并在各种语言建模、阅读理解、问答和摘要基准上取得了最先进的结果。
2. GPT-2:1.5B 模型发布
GPT-2 论文解释了共有四种配置。最大的 GPT-2 使用 15 亿参数,包含 48 个解码器块,d_model = 1600。考虑到原始 Transformer 使用 6 个解码器块,嵌入维度(d_model)为 512,这么大的 GPT-2 模型是非常庞大的。成功训练这样一个巨大的模型本身就是一个重大成就。
在最初宣布 GPT-2 九个月后,OpenAI 决定发布包含代码和模型权重的 15 亿参数 GPT-2:我们希望这个案例对未来的强大模型开发人员有用,并且我们正在积极与 AI 社区就负责任的发布进行对话。……过去九个月使用 GPT-2 的经验让我们对在 AI 领域建立负责任的发布规范的挑战和机遇有了宝贵的见解。
他们总结了九个月的发现:人类认为 GPT-2 的输出令人信服。GPT-2 可以被微调用于滥用。检测具有挑战性(使用 RoBERTa 检测 1.5B GPT-2 生成的文本,检测率约为 95%)。到目前为止,我们没有看到滥用的有力证据。我们需要研究偏见的标准。所有这些观点都是合理的,OpenAI 在早期阶段识别潜在风险(尤其是滥用和偏见)方面做得很好。
3. GPT-2 vs. ChatGPT
今天(2022年12月),我们已经看到了 ChatGPT 的表现有多好。所以,GPT-2 看起来并没有那么有害。我可以看到他们将学到的经验应用到 ChatGPT 中以防止滥用,例如不冒充他人。然而,许多其他滥用行为,例如学生让 ChatGPT 做作业,更难防止。随着研究人员提高 AI 能力,这些问题可能会持续存在并变得普遍。老师们能用检测模型发现学生是否作弊吗?这越来越难了。
4. 参考资料
- GPT-1: Generative Pre-Trained Transformer (2018)
- GPT-2: Better Language Models and Their Implications 论文、代码
- OpenAI ChatGPT: Optimizing Language Models for Dialogue
评论