Sistematski pregled evaluacije modela velikog jezika (LLM) u kliničkoj medicini.
Pozadina Modeli velikih jezika (LLM), napredni AI alati zasnovani na arhitekturi transformatora, pokazuju značajan potencijal u kliničkoj medicini poboljšavajući podršku odlučivanju, dijagnostiku i medicinsko obrazovanje. Međutim, njihova integracija u kliničke tokove rada zahtijeva rigoroznu evaluaciju kako bi se osigurala pouzdanost, sigurnost i etičko usklađivanje. Cilj Ovaj sistematski pregled ispituje parametre evaluacije i metodologije primijenjene na LLM u kliničkoj medicini, naglašavajući njihove mogućnosti, ograničenja i trendove primjene. Metode Sveobuhvatan pregled literature sproveden je u bazama podataka PubMed, Scopus, Web of Science, IEEE Xplore i arXiv, obuhvatajući i recenzirane studije i studije pre štampe. Studije su provjerene prema unaprijed definiranim kriterijima uključivanja i isključenja kako bi se identificirala originalna istraživanja koja procjenjuju učinak LLM u medicinskom kontekstu. Rezultati Rezultati otkrivaju rastući interes za korištenje LLM alata u kliničkim okruženjima, pri čemu 761 studija ispunjava kriterije za uključivanje. Dok su LLM u opštoj domeni, posebno ChatGPT i GPT-4, dominirali evaluacijama (93,55%), LLM u medicinskoj domeni su činili samo 6,45%. Kao parametar koji se najčešće procjenjuje se pojavila tačnost (21,78%). Uprkos ovim napretcima, baza dokaza naglašava određena ograničenja i pristranosti u uključenim studijama, naglašavajući potrebu za pažljivim tumačenjem i čvrstim okvirima evaluacije. Zaključci Eksponencijalni rast LLM istraživanja naglašava njihov transformativni potencijal u zdravstvu. Međutim, rješavanje izazova kao što su etički rizici, varijabilnost evaluacije i nedovoljna zastupljenost kritičnih specijalnosti bit će od suštinskog značaja. Budući napori bi trebali dati prioritet standardiziranim okvirima kako bi se osigurala sigurna, učinkovita i pravična integracija LLM u kliničku praksu.
