
更新日期:2024年10月11日
人工智能(AI)的發展正面臨一個驚人的矛盾:模型越大、越複雜,反而更容易產生錯誤信息。最新發表在《Nature》上的研究顯示,參數量更大的AI大模型,在回答高難度問題時的錯誤率竟超過60%。更令人擔憂的是,10%-40%的用戶可能會錯誤地相信AI chatbot的回答。
這項發現不僅挑戰了我們對AI發展的認知,也為AI的可靠性和未來應用帶來了嚴峻的考驗。
目錄
Toggle《Nature》最新發表的研究結果令我感到震驚。過去兩年,我們見證了ChatGPT、Claude等大型語言模型(LLM, Large Language Model)的驚人進步,它們似乎能解答各種複雜問題,甚至通過專業考試。然而,這項新研究指出,這些看似更強大的AI模型可能比我們想像的更不可靠。
研究團隊對OpenAI的ChatGPT、Meta的Llama以及BigScience的BLOOM等主流AI大模型進行了數千次測試。測試內容涵蓋算術、字謎、地理和科學等領域,還包括「將列表按字母順序排列」等任務型問題。
研究人員巧妙設計了不同難度的問題,如詢問加拿大多倫多和墨西哥小鎮Akil的信息,以測試AI對不同難度問題的表現。
參考:研究論文:《參數量更大且學習能力更強的大語言模型的可靠性降低(Larger and more instructable language models become less reliable)》
結果顯示,這些模型在參數量增加、版本更新後,雖然整體表現提升,但面對高難度問題時,錯誤回答比例竟超過60%。更令人擔憂的是,這些AI模型變得更「自信」—它們傾向回答每個問題,而非像早期版本在不確定時承認「不知道」。
西班牙瓦倫西亞AI研究所的José Hernández-Orallo教授解釋:「現在這些AI大模型基本上有問必答,這意味著生成更多正確答案的同時,錯誤答案也更多了。」
他指出,即使是最新的OpenAI o1大模型,在執行兩個大數字乘法時,也給出了錯誤答案。
這種現象被專家形容為AI的「腦霧」(AI brain fog)或「胡扯」(bullshitting)。英國格拉斯哥大學(the University of Glasgow)的科學與技術專業哲學家Mike Hicks將其稱為AI「越來越擅長不懂裝懂」。
更令人不安的是,研究發現人類通常難以識別AI回答中的錯誤。參與者在判斷AI回答是否正確時,無論問題難度如何,經常將不精確答案誤判為正確。這種誤判頻率在10%到40%之間。
Hernández-Orallo警告:「人類自身無法有效監督這些AI大模型的演化。」他認為,用戶可能過分高估和信任AI chatbot的能力,這會帶來危險後果。
針對這個問題,研究人員提出了一些解決方案。Hernández-Orallo建議,AI開發者應著重提升AI在處理簡單問題時的整體表現,並引導AI拒答較難問題。他提議設定閾值,當AI遇到超出閾值的複雜問題時,直接回覆「我不知道」。
一些針對專業領域的AI chatbot已採取類似方法。哥倫比亞南卡羅萊納大學(the University of South Carolina)的電腦科學家Vipula Rawte指出,包括醫療AI在內的專業chatbot,回答機制更嚴謹,避免亂答超綱問題。
然而,Rawte補充說,通用AI chatbot的開發者可能不會選擇這種保守機制作為賣點。
面對AI大模型越大反而越不可靠的矛盾現象,我們作為使用者需要採取更謹慎的態度。這項研究結果提醒我們,不能盲目信任AI的輸出,無論它看起來多麼令人信服。
作為AI時代的使用者,我們應該:
在這個信息爆炸的時代,辨別真偽的能力比以往任何時候都更重要。讓我們在享受AI帶來便利的同時,也保持清醒和獨立思考的能力。只有這樣,我們才能真正從AI與人類智慧的結合中受益,共同尋找通往真知的道路。
本文將持續關注AI可靠性研究的最新進展,並在有重要突破時及時更新內容。我們鼓勵讀者保持好奇心,不斷學習和適應這個快速變化的AI世界。
研究發現,隨著AI模型參數量增加,它們變得更「自信」,傾向於回答每個問題而不是承認不知道。這導致在面對超出其知識範圍的問題時,產生錯誤回答的可能性增加。
保持批判性思維很重要。始終交叉檢查重要信息,尤其是在專業或關鍵決策領域。同時,了解AI的局限性,對其回答保持適度懷疑態度。
專家建議設置閾值,讓AI在面對超出其能力範圍的問題時直接回答「不知道」。同時,開發者應該著重提高AI在處理基本任務時的準確性和可靠性。
