Apples studie visar att LLM-baserade AI-modeller är bristfälliga
En ny studie från Apples forskare inom artificiell intelligens har funnit att motorer baserade på stora språkmodeller, såsom de från Meta och OpenAI, fortfarande saknar grundläggande resonemangsförmåga. Gruppen har föreslagit ett nytt riktmärke, GSM-Symbolic, för att hjälpa andra att mäta resonemangsförmågan hos olika stora språkmodeller (LLM).
Introduktion
I denna artikel undersöker vi Apples senaste forskning som avslöjar bristerna hos stora språkmodeller (LLM). Studien visar att dessa modeller saknar förmågan att resonera korrekt, vilket leder till inkonsekventa och opålitliga resultat. Vi kommer att dyka djupare in i forskningsresultaten och vad de innebär för framtiden för AI.
Forskningsresultat
Apples forskare upptäckte att små förändringar i formuleringen av frågor kan resultera i betydligt olika svar, vilket underminerar modellernas tillförlitlighet. Gruppen undersökte ’bräckligheten’ hos matematisk resonemang genom att lägga till kontextuell information i sina frågor som en människa skulle förstå, men som inte borde påverka den grundläggande matematiken i lösningen. Detta resulterade i varierande svar, vilket inte borde ske.
Exempel på bräcklighet
En särskild uppgift, kallad ’GSM-NoOp’, illustrerar problemet. Frågan började med den information som behövdes för att formulera ett resultat: ’Oliver plockar 44 kiwier på fredag. Sedan plockar han 58 kiwier på lördag. På söndag plockar han dubbelt så många kiwier som han gjorde på fredag.’ Frågan lade sedan till en irrelevant klausul om att ’fem av kiwierna på söndag var lite mindre än genomsnittet.’
Denna extra information borde inte påverka det totala antalet plockade kiwier, men både OpenAI:s modell och Metas Llama3-8b subtraherade de fem mindre kiwierna från det totala resultatet.
Slutsats
Studien avslutade med att det inte finns några bevis för formellt resonemang i språkmodeller. Beteendet hos LLMs förklaras bättre av sofistikerad mönsterigenkänning, vilket är så bräckligt att bara att ändra namn kan förändra resultaten.
För att läsa hela studien, besök här. För mer information om Apples maskininlärningsforskning, besök Apples maskininlärningssida.
Call to Action
Vad tycker du om Apples senaste upptäckter? Dela dina tankar i kommentarerna nedan och följ oss för fler uppdateringar om AI och teknik.