A mesterséges intelligencia orvosi használatáról szóló szóló vitákat gyakran rosszul keretezik. A kritikusok többnyire azt kérdezik, hogy képes-e az AI már ma teljes egészében kiváltani az orvost, majd minden hiányosságot annak bizonyítékaként kezelnek, hogy a technológia klinikai szempontból még nem vehető komolyan. Ez félrevezető mérce. A valódi kérdés nem az, hogy a mesterséges intelligencia ma már önálló orvos-e, hanem hogy az AI-modellek milyen messzire jutottak az orvosi gondolkodás bizonyos részeiben.
A hétköznapi, nyilvánosan elérhető AI-modellek már most meghökkentően erősek a klinikai munka egyes területein. Egy friss, a JAMA Network Open folyóiratban megjelent tanulmány 21, általánosan elérhető nagy nyelvi modellt vizsgált klinikai elemzési feladatokon, és a modellek nyers diagnosztikai teljesítménye kifejezetten erős volt. A „nyers pontosság” azt jelenti, hogy az adott klinikai feladatokban a válaszok mekkora hányadát ítélték helyesnek. Ezek a rendszerek sok esetben képesek betegségek mintázatainak felismerésére, tünetek és valószínű kórképek összekapcsolására, laboreredmények értelmezésére, kezelési irányok javaslására, orvosi szövegek rendszerezésére, valamint olyan válaszok megfogalmazására, amelyek szerkezetükben és tartalmukban már emlékeztetnek a kompetens klinikai gondolkodásra.
A modellek különösen akkor teljesítettek jól, amikor már elegendő klinikai információ állt rendelkezésükre. A végső diagnózisnál 61–91 százalék közötti pontosságot értek el, miközben a diagnosztikai folyamat elején, a lehetséges betegségek széles körű mérlegelésében még kifejezetten gyengén teljesítettek. Ez a különbség azt mutatja, hogy az AI már erős az ismert adatokból levonható végső következtetésben, de még nem megbízható a teljes klinikai gondolkodási folyamat önálló végigvitelében.
A GPT‑6 Astra megjelenése óta már frissebb egészségügyi adatok is rendelkezésre állnak. Az Astra a valós klinikusi feladatokra épülő HealthBench Professional teszten 63,4 százalékos eredményt ért el, szemben a GPT‑5.6 Sol 60,5 százalékával, általános hallucinációs hibaaránya pedig 12,2 százalékról 4,2 százalékra csökkent. Az új modell tehát pontosabb, megbízhatóbb, jobban kezeli a hosszú dokumentumokat és az összetett munkafolyamatokat, de az eredmények még nem bizonyítják, hogy önálló klinikai döntéshozóként helyettesíthetné az orvost.
Ráadásul a JAMA-tanulmányban nem speciálisan kórházi használatra fejlesztett AI-rendszereket teszteltek, hanem bárki által elérhető "alap" modelleket, mint például a ChatGPT. A modellek nem rendelkeztek teljes elektronikus egészségügyi dokumentációs integrációval. Nem volt mögöttük dedikált klinikai munkafolyamat. Nem kaptak kórházi szintű szakmai adatbázis-lekérdezést. Nem voltak szakorvosi területre finomhangolva.
Nézzünk egy hétköznapi példát. Kapunk egy laboreredményt, amelyen olyan értékek szerepelnek, mint a hemoglobin, CRP, vércukor, kreatinin, májenzimek, koleszterin, TSH vagy D-vitamin-szint: sok páciens ezekkel az adatokkal nem tud mit kezdeni. Lát számokat, csillagokat, referenciaértékeket, de nem érti, mi a lényeg.
Ma viszont ezeket az adatokat beírhatja a ChatGPT-be (vagy akár be is fotózhatja), és megkérdezheti: „Magyarázd el közérthetően ezt a laboreredményt. Mely értékek térnek el a normálistól? Mire utalhatnak? Mit érdemes megkérdeznem az orvosomtól?”
Egy jó AI-modell ettől még nem válik orvossá, és nem is szabad végleges diagnózist adnia, de több hasznos dolgot azonnal meg tud tenni. Lefordítja az orvosi rövidítéseket hétköznapi nyelvre, kiemeli a magas vagy alacsony értékeket. Csoportosítja az összetartozó leleteket: például gyulladásos markereket, vesefunkciót, májfunkciót, pajzsmirigyértékeket, vérszegénységre utaló paramétereket vagy anyagcsere-kockázatokat. Elmagyarázza, hogy egyetlen eltérő érték önmagában sokszor nem jelent betegséget, de bizonyos mintázatok már orvosi figyelmet igényelhetnek. Emellett strukturált kérdéslistát is adhat, amellyel a beteg felkészültebben mehet vissza az orvosához.
Például ha a CRP emelkedett, a modell elmagyarázhatja, hogy ez gyulladásra vagy fertőzésre utalhat, de önmagában nem specifikus. Ha az éhomi vércukor és a HbA1c magas, felvetheti, hogy érdemes az orvossal inzulinrezisztenciáról vagy cukorbetegségről beszélni. Ha a kreatinin magas vagy az eGFR alacsony, jelezheti, hogy a vesefunkciót ellenőrizni kell. Ha a májenzimek emelkedettek, felsorolhat lehetséges okokat — például gyógyszerhatást, alkoholfogyasztást, zsírmájat, vírusos vagy anyagcsere-eredetű problémákat — miközben világossá teszi, hogy az értelmezés függ a tünetektől, kórelőzménytől, gyógyszerektől és kontrollvizsgálatoktól.
Ez már önmagában érték. Nem azért, mert a chatbot orvossá válik, hanem azért, mert egy átláthatatlan orvosi dokumentumból érthető, rendszerezett első értelmezést készít. Segít a betegnek abban, hogy jobb kérdéseket tegyen fel, jobban értse a saját állapotát, és érdemibb konzultációt folytasson az orvosával. Ez önmagában jelentős gyakorlati áttörés.
A korlátok ugyanakkor valósak, ezek a modellek még gyengébbek a diagnosztikai folyamat elején, amikor kevés az információ, nagy a bizonytalanság, és több lehetséges betegséget kellene párhuzamosan mérlegelni. Hajlamosak lehetnek túl korán egyetlen valószínű válaszra zárni, ahelyett hogy széles differenciáldiagnózist tartanának fenn. Fejlettebb bizonytalanságkezelésre, erősebb biztonsági korlátokra, jobb klinikai kontextusra és validált orvosi tudásbázisokkal való szorosabb integrációra van szükségük.
De ez fejlesztési probléma, nem pedig zsákutca - a jövő rendszerei várhatóan erősebbek lesznek strukturált kérdezéssel, naprakész orvosi irányelvek lekérdezésével, klinikai kalkulátorokkal, képi és szöveges adatok együttes elemzésével, betegrekord-integrációval és orvosi felügyelet mellett működő munkafolyamatokkal.
Egyes jól körülhatárolt orvosi feladatokban az AI már ma elérheti vagy meghaladhatja az átlagos szakember teljesítményének egy részét. A következő valódi áttörést azonban várhatóan nem önmagában egy újabb modell, hanem az AI, a betegadatok, a naprakész irányelvek, a klinikai kalkulátorok és az orvosi ellenőrzés biztonságos összekapcsolása hozza majd.
Hivatkozások
Rao AS és mtsai: Large Language Model Performance and Clinical Reasoning Tasks, JAMA Network Open, 2026.
Mass General Brigham: AI Remains Lacking in Clinical Reasoning Abilities, According to Study of 21 Large Language Models, 2026.
Peter Attia: Can AI models reason like clinicians?, 2026.
OpenAI: GPT‑6 Astra: A new generation of intelligence, 2026.
OpenAI: HealthBench Professional: Evaluating Large Language Models on Real Clinician Chats, 2026.
A vizsgált modellek
A hivatkozott tanulmány 21 általánosan elérhető nagy nyelvi modellt vizsgált, többek között az OpenAI, Anthropic, Google DeepMind, xAI és DeepSeek modelljeit. A nyilvános összefoglalókban említett példák között szerepeltek olyan modellek, mint a GPT-5, Claude 4.5 Opus, Gemini 3.0 Flash/Pro, Grok 4 és DeepSeek modellek.
A GPT‑6 Astra nem szerepelt a JAMA-tanulmányban, mivel a vizsgálat még a modell megjelenése előtt készült. Az Astra eredményei ezért külön benchmarkokból származnak, és nem hasonlíthatók közvetlenül a tanulmány PrIME-LLM pontszámaihoz.




