Velvet Flash 0.1 畫出一條關鍵的線:一種能談論加密貨幣的模型,並不等於一種能執行加密貨幣操作的模型。
@velvet_capital 正在評估:人類意圖能否變成精確、特定平臺的金融行動。
測試會給模型一份平臺技能文檔以及一條自然語言請求。它必須選擇正確的指令,提取精確金額、代幣、鏈和地址;識別高風險請求,並在資金移動之前進行確認。 這項工作與“給出一段聽起來聰明的回答”完全不同。
Flash 是一個 4B 模型。在 Velvet 的內部加密“技能”基準測試中,它相較基礎模型的 23 分,拿到了 50 分;同時安全性從 28 提升到 61。重要的並不是排行榜。真正受到懲罰的是基準測試背後的邏輯:錯誤參數、不安全的資金移動、糟糕的路由,以及當請求不應該繼續時卻未能停止。
核心覆蓋 Minara、Binance Spot、OKX DEX、Uniswap、GMX 和 MetaMask,並在另外 31 個平臺上進行更廣泛的評估。每個平臺都有自己的操作語法。所以更深層的問題是:互操作性——一條來自人類的請求,能否在不同指令、參數和安全規則之間完成“翻譯”後仍不丟失其含義?
Flash 0.1 仍是首個版本,這也是 Velvet 自身的基準。它並不能證明在這 31 個平臺上完全沒有錯誤、必然盈利,或已具備全面的生產級支持。但方向比一次模型發佈更重要:當我能夠可靠理解你的意思,並且把它穩定地變成“我確切知道你指的是哪種操作”,以及“我什麼時候不應該執行它”——金融 AI 纔會真正變得有用。
@velvet_capital 正在評估:人類意圖能否變成精確、特定平臺的金融行動。
測試會給模型一份平臺技能文檔以及一條自然語言請求。它必須選擇正確的指令,提取精確金額、代幣、鏈和地址;識別高風險請求,並在資金移動之前進行確認。 這項工作與“給出一段聽起來聰明的回答”完全不同。
Flash 是一個 4B 模型。在 Velvet 的內部加密“技能”基準測試中,它相較基礎模型的 23 分,拿到了 50 分;同時安全性從 28 提升到 61。重要的並不是排行榜。真正受到懲罰的是基準測試背後的邏輯:錯誤參數、不安全的資金移動、糟糕的路由,以及當請求不應該繼續時卻未能停止。
核心覆蓋 Minara、Binance Spot、OKX DEX、Uniswap、GMX 和 MetaMask,並在另外 31 個平臺上進行更廣泛的評估。每個平臺都有自己的操作語法。所以更深層的問題是:互操作性——一條來自人類的請求,能否在不同指令、參數和安全規則之間完成“翻譯”後仍不丟失其含義?
Flash 0.1 仍是首個版本,這也是 Velvet 自身的基準。它並不能證明在這 31 個平臺上完全沒有錯誤、必然盈利,或已具備全面的生產級支持。但方向比一次模型發佈更重要:當我能夠可靠理解你的意思,並且把它穩定地變成“我確切知道你指的是哪種操作”,以及“我什麼時候不應該執行它”——金融 AI 纔會真正變得有用。