A laboreredményektől a kezelési javaslatokig: mire képes már ma egy általános AI-modell?
- Zsigmond Varga
- jún. 21.
- 3 perc olvasás
A mesterséges intelligencia orvosi használatáról szóló szóló vitákat gyakran rosszul keretezik. A kritikusok többnyire azt kérdezik, hogy képes-e az AI már ma teljes egészében kiváltani az orvost, majd minden hiányosságot annak bizonyítékaként kezelnek, hogy a technológia klinikai szempontból még nem vehető komolyan. Ez félrevezető mérce. A valódi kérdés nem az, hogy a mesterséges intelligencia ma már önálló orvos-e, hanem hogy az AI-modellek milyen messzire jutottak az orvosi gondolkodás bizonyos részeiben.
A hétköznapi, nyilvánosan elérhető AI-modellek már most meghökkentően erősek a klinikai munka egyes területein. Egy friss, a JAMA Network Open folyóiratban megjelent tanulmány 21, általánosan elérhető nagy nyelvi modellt vizsgált klinikai elemzési feladatokon, és a modellek nyers diagnosztikai teljesítménye kifejezetten erős volt. A „nyers pontosság” azt jelenti, hogy az adott klinikai feladatokban a válaszok mekkora hányadát ítélték helyesnek. Ezek a rendszerek sok esetben képesek betegségek mintázatainak felismerésére, tünetek és valószínű kórképek összekapcsolására, laboreredmények értelmezésére, kezelési irányok javaslására, orvosi szövegek rendszerezésére, valamint olyan válaszok megfogalmazására, amelyek szerkezetükben és tartalmukban már emlékeztetnek a kompetens klinikai gondolkodásra.
A modellek különösen akkor teljesítettek jól, amikor elegendő klinikai információ állt rendelkezésükre, és a végső diagnózis, a kezelési javaslatok területén szerepeltek a legerősebben. A Mass General Brigham összefoglalója szerint valamennyi tesztelt nagy nyelvi modell több mint 90 százalékos pontossággal jutott helyes végső diagnózishoz, ha az adott esethez minden releváns információt megkapott. Ez azt jelzi, hogy az általános célú AI-rendszerek már most jelentős orvosi mintafelismerő képességgel rendelkeznek.
Ráadásul nem speciálisan kórházi használatra fejlesztett AI rendszereken teszteltek, hanem bárki által elérhető "alap" modelleken, mint például a ChatGPT. A modellek nem rendelkeztek teljes elektronikus egészségügyi dokumentációs integrációval. Nem volt mögöttük dedikált klinikai munkafolyamat. Nem kaptak kórházi szintű szakmai adatbázis-lekérdezést. Nem voltak szakorvosi területre finomhangolva.

Nézzünk egy hétköznapi példát. Kapunk egy laboreredményt, amelyen olyan értékek szerepelnek, mint a hemoglobin, CRP, vércukor, kreatinin, májenzimek, koleszterin, TSH vagy D-vitamin-szint: sok páciens ezekkel az adatokkal nem tud mit kezdeni. Lát számokat, csillagokat, referenciaértékeket, de nem érti, mi a lényeg.
Ma viszont ezeket az adatokat beírhatja a ChatGPT-be (vagy akár be is fotózhatja), és megkérdezheti: „Magyarázd el közérthetően ezt a laboreredményt. Mely értékek térnek el a normálistól? Mire utalhatnak? Mit érdemes megkérdeznem az orvosomtól?”
Egy jó AI-modell ettől még nem válik orvossá, és nem is szabad végleges diagnózist adnia, de több hasznos dolgot azonnal meg tud tenni. Lefordítja az orvosi rövidítéseket hétköznapi nyelvre, kiemeli a magas vagy alacsony értékeket. Csoportosítja az összetartozó leleteket: például gyulladásos markereket, vesefunkciót, májfunkciót, pajzsmirigyértékeket, vérszegénységre utaló paramétereket vagy anyagcsere-kockázatokat. Elmagyarázza, hogy egyetlen eltérő érték önmagában sokszor nem jelent betegséget, de bizonyos mintázatok már orvosi figyelmet igényelhetnek. Emellett strukturált kérdéslistát is adhat, amellyel a beteg felkészültebben mehet vissza az orvosához.
Például ha a CRP emelkedett, a modell elmagyarázhatja, hogy ez gyulladásra vagy fertőzésre utalhat, de önmagában nem specifikus. Ha az éhomi vércukor és a HbA1c magas, felvetheti, hogy érdemes az orvossal inzulinrezisztenciáról vagy cukorbetegségről beszélni. Ha a kreatinin magas vagy az eGFR alacsony, jelezheti, hogy a vesefunkciót ellenőrizni kell. Ha a májenzimek emelkedettek, felsorolhat lehetséges okokat — például gyógyszerhatást, alkoholfogyasztást, zsírmájat, vírusos vagy anyagcsere-eredetű problémákat — miközben világossá teszi, hogy az értelmezés függ a tünetektől, kórelőzménytől, gyógyszerektől és kontrollvizsgálatoktól.
Ez már önmagában érték. Nem azért, mert a chatbot orvossá válik, hanem azért, mert egy átláthatatlan orvosi dokumentumból érthető, rendszerezett első értelmezést készít. Segít a betegnek abban, hogy jobb kérdéseket tegyen fel, jobban értse a saját állapotát, és érdemibb konzultációt folytasson az orvosával. Ez önmagában jelentős gyakorlati áttörés.
A korlátok ugyanakkor valósak, ezek a modellek még gyengébbek a diagnosztikai folyamat elején, amikor kevés az információ, nagy a bizonytalanság, és több lehetséges betegséget kellene párhuzamosan mérlegelni. Hajlamosak lehetnek túl korán egyetlen valószínű válaszra zárni, ahelyett hogy széles differenciáldiagnózist tartanának fenn. Fejlettebb bizonytalanságkezelésre, erősebb biztonsági korlátokra, jobb klinikai kontextusra és validált orvosi tudásbázisokkal való szorosabb integrációra van szükségük.
De ez fejlesztési probléma, nem pedig zsákutca - a jövő rendszerei várhatóan erősebbek lesznek strukturált kérdezéssel, naprakész orvosi irányelvek lekérdezésével, klinikai kalkulátorokkal, képi és szöveges adatok együttes elemzésével, betegrekord-integrációval és orvosi felügyelet mellett működő munkafolyamatokkal.
Egy-két év múlva jó eséllyel már arról beszélhetünk, hogy bizonyos speciálisan finomhangolt AI modellek elérik egy-egy átlagos szakorvos tudását, képességeit.
Hivatkozások
Rao AS és mtsai: Large Language Model Performance and Clinical Reasoning Tasks, JAMA Network Open, 2026.
Mass General Brigham: AI Remains Lacking in Clinical Reasoning Abilities, According to Study of 21 Large Language Models, 2026.
Peter Attia: Can AI models reason like clinicians?, 2026.
A vizsgált modellek
A hivatkozott tanulmány 21 általánosan elérhető nagy nyelvi modellt vizsgált, többek között az OpenAI, Anthropic, Google DeepMind, xAI és DeepSeek modelljeit. A nyilvános összefoglalókban említett példák között szerepeltek olyan modellek, mint a GPT-5, Claude 4.5 Opus, Gemini 3.0 Flash/Pro, Grok 4 és DeepSeek modellek.
A GPT-5.5 nem szerepelt a vizsgált modellek között.




Hozzászólások