今年早些時候,Roblox 公佈了一項雄心勃勃的計劃,即將生成式 Roblox AI 添加到其平臺中,旨在讓所有用戶的內容創作更加簡化。生成式 AI 的最新發展,尤其是大型語言模型 (LLM) 的發展,爲增強沉浸式體驗開闢了新視野。這些進步不僅加快了創作過程,而且還確保了更安全的環境,同時控制了計算需求。
人工智能的一個顯著趨勢是多模態模型的興起。這些模型擅長處理各種內容形式,從圖像和文本到 3D 模型和音頻,正在重新定義創作工具。它們能夠生成結合多種模式的輸出(例如,文本與相應的視覺效果),這是一項重大創新。對於 Roblox 來說,這代表了雙重優勢:
它提高了經驗豐富的內容創作者的生產力。
它使創作過程民主化,使更廣泛的用戶能夠在平台上實現他們的想法。
在最近舉行的 Roblox 開發者大會 (RDC) 上,該公司宣布推出多種將生成式 AI 融入 Roblox Studio 的工具。這些工具旨在促進專案更快擴展,加速迭代過程,並增強使用者的創造力,確保一流的內容生成。
Roblox 人工智慧助手
Roblox 始終為其創作者提供必要的資源來打造詳細的 3D 體驗。然而,許多創作者轉向第三方生成和對話式人工智慧工具尋求協助。儘管有利於減輕一些負擔,但這些通用版本並不是針對 Roblox 獨特的工作流程或其獨特的程式碼、行話和白話量身定制的。因此,創作者在嘗試將這些工具與 Roblox 內容整合時遇到了巨大的挑戰。認識到這一差距,Roblox 宣佈在 RDC 期間將這些工具的優勢直接整合到 Roblox Studio 中,並推出了名為「Assistant」的工具的早期版本。
「Assistant」是 Roblox 的內部對話式人工智慧,旨在簡化創作者的創作過程,無論他們的經驗水平如何。它的目的是盡量減少花在日常任務上的時間,讓創作者專注於故事情節、遊戲玩法和整體設計等領域。憑藉其龐大的公共 3D 模型庫以及將模型與平台 API 合併的能力,Roblox 成為為複雜的 3D 宇宙開發此類 AI 模型的主要候選者。借助 Assistant,創作者可以使用簡單的語言提示來設計場景、修改 3D 模型以及為物件注入互動特徵。該工具涵蓋三個關鍵的創建階段:理解、編程和建構:
理解性:無論是新手還是 Roblox 專家,Roblox AI Assistant 都可以使用簡單的語言輕鬆回答各種查詢。程式設計:在現有的「Code Assist」功能的基礎上,Assistant 可以增強編碼、闡明某些程式碼段並提供偵錯解決方案。建構:創作者可以迅速將概念轉化為有形的模型。透過輸入「用路燈照亮這條路」或「建造一個多樣化的森林並用灌木和花朵裝飾」之類的命令,整個場景都可以實現。與助理的互動被設想為一個動態的雙向過程,讓創作者提供回饋並完善結果。這類似於與經驗豐富的共同創作者合作,促進腦力激盪和想法優化。
在 RDC 期間,Roblox 也發布了有關其新 Roblox AI 工具 Assistant 的公告。開發人員有機會貢獻他們的匿名 Luau 腳本數據,以提高 Roblox AI 工具(例如 Code Assist 和 Assistant)的效率和功能。透過這樣做,他們不僅可以幫助 Roblox 開發者社區,而且如果他們選擇將貢獻擴展到 Roblox 之外,還可以幫助更廣泛的 Luau 開發者社群。這是因為共享的腳本資料將合併到第三方可存取的資料集中,旨在改進他們的人工智慧聊天工具,以改善 Luau 程式碼建議。
簡化頭像設計
Roblox 的願景是讓其 6550 萬日常用戶中的每一位都擁有一個真正反映和傳達其身份的化身。雖然最近為 UGC 計劃成員引入了設計和行銷化身身體和獨立頭部的功能,但目前的設計過程涉及導航 Studio 或 UGC 計劃。再加上必要的高級技能水平和幾天的時間來整合面部表情和 3D 綁定等功能,頭像創建成為一項長期的工作。因此,頭像選項仍然有限。然而,Roblox 的願景是超越這些限制。
為了幫助所有 Roblox 用戶獲得獨特的動態頭像,該公司旨在簡化頭像創建過程。 RDC 宣布將於 2024 年推出革命性工具。這項創新將允許將一個或多個影像轉換為自訂頭像。任何隸屬於 Studio 或 UGC 計劃的創作者都可以使用此工具,上傳圖像並隨後個性化生成的頭像。 Roblox 的長期願望包括將這些 Roblox AI 功能直接嵌入 Roblox 體驗中。
為了實現這一目標,Roblox 正在將精力投入到 AI 模型中,並以平台的頭像設計和一系列 Roblox 特定的 3D 頭像模型為基礎。正在考慮的技術包括從 2D 視覺效果生成 3D 化身、透過 2D 生成策略強化有限的 3D 數據,以及採用生成對抗網路 (GAN) 進行 3D 生成。此外,ControlNet技術也被用來疊加預設姿勢,增強多角度虛擬形象的視覺效果。
創建 3D 化身結構後,將利用根據化身姿勢提供的高級 3D 語義分割。該程式完善了最初的 3D 設計,融入了獨特的臉部元素、結構和紋理,最終將基本的 3D 形式轉變為真實的 Roblox 化身。隨後,使用者可以使用網格編輯工具進行進一步定制,使頭像與他們設想的概念保持一致。值得注意的是,Roblox AI 可以在短短幾分鐘內完成此過程,從而使頭像能夠立即整合到 Roblox 體驗中。
調節語音通信
Roblox AI 超越了單純的內容創作;它也可以作為一個強有力的機制來大規模地培育多樣化、安全和相互尊重的社區。隨著語音聊天、Roblox Connect 和 RDC 新發布的 API 等新穎語音功能的引入,調節即時語音內容成為一項新的挑戰。業界流行的解決方案是自動語音識別 (ASR),其功能是將音訊檔案轉換為文本,然後檢查是否存在潛在的不當內容或特定關鍵字。
雖然對規模較小的實體有效,但為 Roblox 龐大的用戶群部署 ASR 卻暴露出效率低下的問題。它不僅無法捕捉語氣和音量等細微差別,而且跨越多種語言的日常對話數量之大也使其變得很麻煩。認識到這些挑戰,Roblox AI 開創了一種更簡化的程序,可以直接從現場音訊中識別政策違規行為。
這種最先進的語音偵測機制是內部開發的。 Roblox AI 使用 ASR 對其專有語音資料集進行分類,然後利用分類資料進行系統訓練。培訓過程首先將音訊轉換為文字記錄,然後由 Roblox 的文字過濾系統進行評估,該系統已經擅長識別 Roblox 特定的術語和潛在的違規行為。因此,Roblox 現在擁有一個能夠直接從音訊串流即時偵測策略違規行為的模型。
Roblox 人工智慧系統雖然擅長識別明確的關鍵字,但也意識到政策違規通常取決於更廣泛的背景。在一種情況下令人反感的詞在另一種情況下可能是良性的。為了提高上下文理解,Roblox 整合了基於 Transformer 的架構,擅長序列分析。該框架保留了擴展的音訊序列,使系統能夠識別單字、上下文和語調。結果是一個根據政策遵守情況對音訊進行分類的系統,其中考慮了關鍵字、語氣、情緒和整體背景。令人印象深刻的是,這種創新系統所需的運算能力比傳統 ASR 低得多,這符合 Roblox 擴展可擴展性的願景。
