谷歌的 DeepMind 開發人員推出了「Promptbreeder (PB):透過加速進化來實現自我參照自我完善」。這一開創性的發展有望提供一種新方法,透過利用加速進化的力量來增強大型語言模型(LLM)的能力。
相關:ChatGPT 注入,或如何從機器人獲得最佳反應
這項創新的核心在於認識到大型語言模型的智慧與其接收的文本線索的品質密切相關。從本質上講,線索越智能,模型的反應就越智能和準確。因此,目前的關鍵任務是製定最佳提示策略來有效地指導這些模型。
傳統的提示策略,例如思維鍊或計劃和決策方法,無可否認地提高了法學碩士的推理能力。然而,這些策略通常是手動設計的,可能無法達到最佳效能。
因此,Promptbreeder 不斷得到改進。這是一個以自然語言為基礎的自我完善、自我參照的循環。不需要對神經網路進行微調。該過程會產生針對特定應用程式進行最佳化的客製化提示。
Promptbreeder 是一種使用演化機制迭代來完善提示策略的解決方案。 PB 的獨特之處在於它不僅能夠改進提示,還能夠在每一代新產品中改進其自身的提示增強功能。
Promptbreeder 演化方案的運作方式如下:
在法學碩士的指導下,Promptbreeder 產生了一組演化單元,每個演化單元包含兩個「解決方案提示」和一個「突變提示」。
接著採用二元錦標賽遺傳演算法根據訓練集評估這些突變體的適應度,從而辨識出表現較好的突變體。
這個循環過程不斷地回到步驟 1,最終導致一代又一代「提示解決方案」的演變。
經過幾個世代的發展,Promptbreeder 使用了五種不同類別的變異算子來變異「解決方案提示」和「變異提示」。該方案的出色之處在於,這些變異的「提示解決方案」逐漸變得更加聰明。 「突變提示」在這裡至關重要,它提供瞭如何突變以增強「解決方案提示」的說明。
Promptbreeder 本質上是一個在自然語言領域內運作的自我改進、自我參考的系統。至關重要的是,它不需要對神經網路進行複雜的微調。相反,它會產生針對特定應用程式精心優化的客製化提示。
初步實驗已經取得了有希望的結果。 Promptbreeder 在數學、邏輯、常識任務和語言分類(包括識別仇恨言論)方面優於所有其他當代提示方法。
展望未來,Promptbreeder 正在對其建構整個思考過程的可行性進行嚴格的測試。這涉及探索 N 提示策略,即有條件地應用提示,為參與對抗性蘇格拉底式對話的法學碩士政策預先編程的開發鋪平道路。
與人類思考過程的擴展性相比,Promptbreeder 仍有其限制。提示拓樸保持固定,Promptbreeder 主要適應提示內容,而不是提示演算法本身。人類思維涵蓋了語言以外的多方面,包括語調、圖像和多模態系統,而這些都是 Promptbreeder 尚不具備的。
閱讀更多相關主題:
希波克拉底人工智慧 (Hippocratic AI) 獲 5,000 萬美元資助,推出以安全為中心的語言模型
谷歌針對 26 億美元歐盟反壟斷罰款的最終立場將提交給歐洲最高法院
谷歌宣布首個自我改進的人工智慧模型 Promptbreeder 的進化速度比人類快數十億倍,這篇文章首先出現在 Metaverse Post 上。
