GPT 是“生成式預訓練 Transformer”的縮寫,是由致力於以安全有益的方式開發和推廣人工智能的研究機構 OpenAI 開發的一種語言模型。

GPT 模型基於 Transformer 架構,這是一種特別適合處理語言等順序數據的神經網絡。GPT 模型是“預訓練”的,這意味着它們首先在大量文本數據上進行訓練,然後針對特定任務(例如語言翻譯或文本完成)進行微調。

預訓練過程包括將模型暴露於大量文本數據(例如書籍、文章和網頁),並訓練它預測給定上下文的下一個單詞或單詞序列。通過這樣做,模型學會捕捉語言中的統計模式和關係,這使得它在給出提示時能夠生成連貫流暢的文本。

GPT 模型已用於各種應用,例如文本補全、聊天機器人和語言翻譯。迄今爲止最先進的 GPT 模型是 GPT-3,它擁有 1750 億個參數,並在一系列語言任務上表現出色。