Sistematski pregled / meta-analiza 2025
Opća medicina i istraživanja

Sistematski pregled evaluacije modela velikog jezika (LLM) u kliničkoj medicini.

BMC medical informatics and decision making

Bosanski prijevod

Sažetak istraživanja

Pozadina Modeli velikih jezika (LLM), napredni AI alati zasnovani na arhitekturi transformatora, pokazuju značajan potencijal u kliničkoj medicini poboljšavajući podršku odlučivanju, dijagnostiku i medicinsko obrazovanje. Međutim, njihova integracija u kliničke tokove rada zahtijeva rigoroznu evaluaciju kako bi se osigurala pouzdanost, sigurnost i etičko usklađivanje.

Cilj Ovaj sistematski pregled ispituje parametre evaluacije i metodologije primijenjene na LLM u kliničkoj medicini, naglašavajući njihove mogućnosti, ograničenja i trendove primjene.

Metode Sveobuhvatan pregled literature sproveden je u bazama podataka PubMed, Scopus, Web of Science, IEEE Xplore i arXiv, obuhvatajući i recenzirane studije i studije pre štampe. Studije su provjerene prema unaprijed definiranim kriterijima uključivanja i isključenja kako bi se identificirala originalna istraživanja koja procjenjuju učinak LLM u medicinskom kontekstu.

Rezultati Rezultati otkrivaju rastući interes za korištenje LLM alata u kliničkim okruženjima, pri čemu 761 studija ispunjava kriterije za uključivanje. Dok su LLM u opštoj domeni, posebno ChatGPT i GPT-4, dominirali evaluacijama (93,55%), LLM u medicinskoj domeni su činili samo 6,45%. Kao parametar koji se najčešće procjenjuje se pojavila tačnost (21,78%). Uprkos ovim napretcima, baza dokaza naglašava određena ograničenja i pristranosti u uključenim studijama, naglašavajući potrebu za pažljivim tumačenjem i čvrstim okvirima evaluacije.

Zaključci Eksponencijalni rast LLM istraživanja naglašava njihov transformativni potencijal u zdravstvu. Međutim, rješavanje izazova kao što su etički rizici, varijabilnost evaluacije i nedovoljna zastupljenost kritičnih specijalnosti bit će od suštinskog značaja. Budući napori bi trebali dati prioritet standardiziranim okvirima kako bi se osigurala sigurna, učinkovita i pravična integracija LLM u kliničku praksu.

Prikaži originalni naslov i sažetak na engleskom

A systematic review of large language model (LLM) evaluations in clinical medicine.

Background Large Language Models (LLMs), advanced AI tools based on transformer architectures, demonstrate significant potential in clinical medicine by enhancing decision support, diagnostics, and medical education. However, their integration into clinical workflows requires rigorous evaluation to ensure reliability, safety, and ethical alignment.

Objective This systematic review examines the evaluation parameters and methodologies applied to LLMs in clinical medicine, highlighting their capabilities, limitations, and application trends.

Methods A comprehensive review of the literature was conducted across PubMed, Scopus, Web of Science, IEEE Xplore, and arXiv databases, encompassing both peer-reviewed and preprint studies. Studies were screened against predefined inclusion and exclusion criteria to identify original research evaluating LLM performance in medical contexts.

Results The results reveal a growing interest in leveraging LLM tools in clinical settings, with 761 studies meeting the inclusion criteria. While general-domain LLMs, particularly ChatGPT and GPT-4, dominated evaluations (93.55%), medical-domain LLMs accounted for only 6.45%. Accuracy emerged as the most commonly assessed parameter (21.78%). Despite these advancements, the evidence base highlights certain limitations and biases across the included studies, emphasizing the need for careful interpretation and robust evaluation frameworks.

Conclusions The exponential growth in LLM research underscores their transformative potential in healthcare. However, addressing challenges such as ethical risks, evaluation variability, and underrepresentation of critical specialties will be essential. Future efforts should prioritize standardized frameworks to ensure safe, effective, and equitable LLM integration in clinical practice.

Autorstvo i publikacija

Autori

Shool S, Adimi S, Saboori Amleshi R, Bitaraf E, Golpira R, Tara M.

Časopis
BMC medical informatics and decision making
Vrste publikacije
Sistematski pregled, Pregledni članak, Članak u časopisu
Licenca
CC BY-NC-ND
Citiranja u Europe PMC
115
Provjerljivi identifikatori

Izvorni podaci

DOI
10.1186/s12911-025-02954-4
PMID
40055694
PMCID
PMC11889796
Provjereno
2026-07-26
Otvori cijeli rad u Europe PMC
Napomena o bosanskom prijevodu

Naslov i sažetak prevedeni su automatski i prijevod može sadržavati netačnosti ili neprecizne stručne izraze. Za sve detalje, citiranje i medicinsko tumačenje pregledajte originalnu englesku verziju članka. Ne donosite zdravstvene odluke samo na osnovu ovog prijevoda.

Pregledaj originalni članak na engleskom
Istraživački zapis služi za informiranje i istraživanje. Ne zamjenjuje medicinski savjet, dijagnozu ili preporuku liječenja.