
Nuovi dati presentati al meeting 2025 dell’European Academy of Neurology (EAN 2025) suggeriscono che GPT-4o, l’ultimo modello di ChatGPT, potrebbe aiutare a ridurre il divario di competenza diagnostica tra neurologi non specialisti ed esperti nel campo delle polineuropatie, offrendo un supporto significativo in contesti clinici dove l’accesso a specialisti è limitato.
Un team di ricerca guidato da Alberto De Lorenzo dell’IRCCS Humanitas di Milano ha condotto uno studio per valutare le capacità diagnostiche di GPT-4o. Hanno compilato 100 casi reali di polineuropatia provenienti da centri terziari e hanno inserito ciascun caso in GPT-4o con un singolo prompt “zero-shot chain-of-thought” – una tecnica di “prompt engineering” che permette ai Large Language Models di affrontare compiti complessi che richiedono un ragionamento in più passaggi, senza fornire esempi specifici nel prompt – richiedendo una diagnosi principale, due diagnosi differenziali e un test di conferma.
Successivamente, ventisei neurologi (14 specialisti neuromuscolari e 12 neurologi generali) provenienti da 19 centri in dieci paesi hanno analizzato gli stessi casi, prima autonomamente e poi dopo aver esaminato le risposte generate dall’intelligenza artificiale. I risultati dello studio hanno evidenziato una forte coerenza di GPT-4o tra le diverse prove, con un Cohen’s kappa di 0,80 (). L’ultimo modello di ChatGPT ha identificato correttamente la diagnosi principale nel 65,5% dei casi, superando i neurologi non specialisti (54,4%), ma rimanendo dietro agli specialisti esperti nel campo delle polineuropatie (73,9%).
Quando sono state considerate le due diagnosi differenziali, il vantaggio del modello rispetto ai non specialisti si è ampliato, con l’intelligenza artificiale che ha raggiunto l’82% di accuratezza contro il 68,5% dei non specialisti. ChatGPT ha anche eguagliato gli specialisti nel suggerire l’indagine di conferma appropriata (68% contro 67,3%), superando di gran lunga i non specialisti, che hanno identificato il test corretto in meno della metà dei casi.
È interessante notare che nel 21% dei casi, i neurologi non specialisti hanno modificato la loro diagnosi iniziale dopo aver esaminato i suggerimenti di GPT-4o. Questo indica un certo livello di fiducia nello strumento e, forse, una iniziale incertezza nelle loro decisioni. Gli specialisti, d’altra parte, sono stati meno propensi a cambiare le loro risposte, trovando spesso i suggerimenti di ChatGPT troppo basilari o occasionalmente fuori luogo.
Lo studio ha anche evidenziato alcune debolezze di GPT-4o: oltre un terzo degli errori del modello derivavano da un’eccessiva interpretazione dei valori di laboratorio, un sesto dall’ignorare sottili indizi clinici e un ulteriore quinto erano risposte plausibili ma errate. Ciò sottolinea l’importanza della supervisione clinica nella sua implementazione.
“GPT-4o non è perfetto e non possiede l’esperienza o la capacità di ragionamento di un clinico, ma i nostri dati indicano che il suo uso supervisionato potrebbe aiutare a ridurre il divario di competenza e indirizzare i medici verso il giusto test di follow-up senza sostituire il giudizio clinico“, ha affermato De Lorenzo.
Con oltre cento possibili cause, nell’ambito delle polineuropatie la diagnosi errata è comune e i centri terziari sono spesso sovraccarichi. L’introduzione di un assistente basato sull’intelligenza artificiale potrebbe facilitare lo smistamento dei casi, segnalare situazioni critiche e proporre studi di laboratorio o genetici mirati, alleggerendo i colli di bottiglia nella cura specialistica.
In contesti rurali o con risorse limitate, dove l’accesso a specialisti in disturbi neuromuscolari è limitato, ChatGPT potrebbe servire come uno strumento facilmente accessibile e conveniente per supportare il processo decisionale diagnostico nell’ambito delle polineuropatie. Guidando i primi passi diagnostici e identificando i pazienti che necessitano di un rinvio urgente, lo strumento potrebbe ridurre i ritardi e semplificare l’assistenza.
Il gruppo di ricerca sta ora testando come il modello gestisce le note della medicina di base e sta confrontando diversi modelli di linguaggio di grandi dimensioni per determinare quale offra la migliore combinazione di accuratezza, esplicabilità e rapporto costo-efficacia.





