GPT的T就是Tranformer,可以说Google的transformer是如今大模型的基础,但是大语言模型(LLM)按照 Transformer 架构大致可以分三类:

而OpenAI抛弃掉了Encoder,选择了Decoder-only LLM,并且最终胜出成为了现在大模型的主流。为什么 Decoder-only 最终赢了?

这是 LLM 发展最关键的问题。

  1. 原因1:训练目标简单
  2. 原因2:规模化效果更好
  3. 原因3:接口统一

以前:

任务:

  • 翻译模型
  • 摘要模型
  • 问答模型
  • 代码模型
  • 分类模型

多个模型。

GPT:

全部变成:

Prompt

↓

Next Token Prediction

计算机非常擅长的就是简单重复的事情(比如GPU),Scaling Law可以说是当前大模型最重要的定律,也是激发计算机潜力的最好的方式。所以,简单、重复 非常重要,这个哲学在生活实践中也非常有效,产品设计、动员群众往往靠的不是复杂的理论,而是足够简单,通过规模效应产生力量。

这并非否定复杂的力量,设计、构思、实验层面往往需要深思熟虑的全面、复杂,最终的输出形态要规约成简单,这种简单是由复杂诞生出来的,就像物理公式都简洁优雅一样,但其背后过程往往复杂深刻。简单是目标和产品。