文章轉載來源:AI之勢

原文來源:量子位

圖片來源:由無界 AI生成

GPT-4解決網絡名梗“吉娃娃or藍莓鬆餅”,一度驚豔無數人。

然鵝,現在它被指出“作弊”了!

全用原題中出現的圖,只是打亂順序和排列方式。

結果,最新版全模式合一的GPT-4不但數錯圖片數量,原來能正確識別的吉娃娃也識別出錯了。

那麼爲什麼GPT-4在原圖上表現的這麼好呢?

搞這項測試的UCSC助理教授Xin Eric Wang猜測,原圖在互聯網上太流行,以至於GPT-4在訓練時多次見過原答案,還給背了下來。

圖靈獎三巨頭中的LeCun也關注此事,並表示:

警惕在訓練集上測試。

泰迪和炸雞也無法區分

原圖究竟有多流行呢,不但是網絡名梗,甚至在計算機視覺領域也成了經典問題,並多次出現在相關論文研究中。

那麼拋開原圖的影響,GPT-4能力究竟侷限在哪個環節?許多網友都給出了自己的測試方案。

爲了排除排列方式太複雜是否有影響,有人修改成簡單3x3排列也認錯很多。

有人把其中一些圖拆出來單獨發給GPT-4,得到了5/5的正確率。

但Xin Eric Wang認爲,把這些容易混淆的圖像放在一起正是這個挑戰的重點。

終於,有人同時用上了讓AI“深呼吸”和“一步一步地想”兩大咒語,得到了正確結果。

但GPT-4在回答中的用詞“這是視覺雙關或著名梗圖的一個例子”,也暴露了原圖確實可能存在於訓練數據裏。

最後也有人測試了經常一起出現的“泰迪or炸雞”測試,發現GPT-4也不能很好分辨。

但是這個“藍莓or巧克力豆”就實在有點過分了……

視覺幻覺成熱門方向

大模型“胡說八道”在學術界被稱爲幻覺問題,多模態大模型的視覺幻覺問題,已經成了最近研究的熱門方向。

在EMNLP 2023一篇研究中,構建了GVIL數據集,包含1600個數據點,系統性的評估視覺幻覺問題。

研究發現,規模更大的模型更容易受到錯覺的影響,而且更接近人類感知。

另一篇剛出爐的研究則重點評估了兩種幻覺類型:偏差和干擾。

  • 偏差指模型傾向於產生某些類型的響應,可能是由於訓練數據的不平衡造成的。

  • 干擾則是可能因文本提示的措辭方式或輸入圖像的呈現方式造成去別的場景。

研究中指出GPT-4V一起解釋多個圖像時經常會困惑,單獨發送圖像時表現更好,符合“吉娃娃or鬆餅”測試中的觀察結果。

流行的緩解措施,如自我糾正和思維鏈提示並不能有效解決這些問題,並測試了LLaVA和Bard等多模態模型存在相似的問題。

另外研究還發現,GPT-4V更擅長解釋西方文化背景的圖像或帶有英文文字的圖像。

比如GPT-4V能正確數出七個小矮人+白雪公主,卻把七個葫蘆娃數成了10個。

參考鏈接:[1]https://twitter.com/xwang_lk/status/1723389615254774122[2]https://arxiv.org/abs/2311.00047[3]https://arxiv.org/abs/2311.03287