Polineuropatie: ChatGPT può aiutare i neurologi non specialisti nella diagnosi?

Redazione By 26 Giugno 2025No Comments
Dai congressiNews
ChatGPT polineuropatie

Nuovi dati presentati al meeting 2025 dell’European Academy of Neurology (EAN 2025) suggeriscono che GPT-4o, l’ultimo modello di ChatGPT, potrebbe aiutare a ridurre il divario di competenza diagnostica tra neurologi non specialisti ed esperti nel campo delle polineuropatie, offrendo un supporto significativo in contesti clinici dove l’accesso a specialisti è limitato.

Un team di ricerca guidato da Alberto De Lorenzo dell’IRCCS Humanitas di Milano ha condotto uno studio per valutare le capacità diagnostiche di GPT-4o. Hanno compilato 100 casi reali di polineuropatia provenienti da centri terziari e hanno inserito ciascun caso in GPT-4o con un singolo prompt “zero-shot chain-of-thought” – una tecnica di “prompt engineering” che permette ai Large Language Models di affrontare compiti complessi che richiedono un ragionamento in più passaggi, senza fornire esempi specifici nel prompt richiedendo una diagnosi principale, due diagnosi differenziali e un test di conferma.

Successivamente, ventisei neurologi (14 specialisti neuromuscolari e 12 neurologi generali) provenienti da 19 centri in dieci paesi hanno analizzato gli stessi casi, prima autonomamente e poi dopo aver esaminato le risposte generate dall’intelligenza artificiale. I risultati dello studio hanno evidenziato una forte coerenza di GPT-4o tra le diverse prove, con un Cohen’s kappa di 0,80 (). L’ultimo modello di ChatGPT ha identificato correttamente la diagnosi principale nel 65,5% dei casi, superando i neurologi non specialisti (54,4%), ma rimanendo dietro agli specialisti esperti nel campo delle polineuropatie (73,9%).

Quando sono state considerate le due diagnosi differenziali, il vantaggio del modello rispetto ai non specialisti si è ampliato, con l’intelligenza artificiale che ha raggiunto l’82% di accuratezza contro il 68,5% dei non specialisti. ChatGPT ha anche eguagliato gli specialisti nel suggerire l’indagine di conferma appropriata (68% contro 67,3%), superando di gran lunga i non specialisti, che hanno identificato il test corretto in meno della metà dei casi.

È interessante notare che nel 21% dei casi, i neurologi non specialisti hanno modificato la loro diagnosi iniziale dopo aver esaminato i suggerimenti di GPT-4o. Questo indica un certo livello di fiducia nello strumento e, forse, una iniziale incertezza nelle loro decisioni. Gli specialisti, d’altra parte, sono stati meno propensi a cambiare le loro risposte, trovando spesso i suggerimenti di ChatGPT troppo basilari o occasionalmente fuori luogo.

Lo studio ha anche evidenziato alcune debolezze di GPT-4o: oltre un terzo degli errori del modello derivavano da un’eccessiva interpretazione dei valori di laboratorio, un sesto dall’ignorare sottili indizi clinici e un ulteriore quinto erano risposte plausibili ma errate. Ciò sottolinea l’importanza della supervisione clinica nella sua implementazione.

“GPT-4o non è perfetto e non possiede l’esperienza o la capacità di ragionamento di un clinico, ma i nostri dati indicano che il suo uso supervisionato potrebbe aiutare a ridurre il divario di competenza e indirizzare i medici verso il giusto test di follow-up senza sostituire il giudizio clinico“, ha affermato De Lorenzo.

Con oltre cento possibili cause, nell’ambito delle polineuropatie la diagnosi errata è comune e i centri terziari sono spesso sovraccarichi. L’introduzione di un assistente basato sull’intelligenza artificiale potrebbe facilitare lo smistamento dei casi, segnalare situazioni critiche e proporre studi di laboratorio o genetici mirati, alleggerendo i colli di bottiglia nella cura specialistica.

In contesti rurali o con risorse limitate, dove l’accesso a specialisti in disturbi neuromuscolari è limitato, ChatGPT potrebbe servire come uno strumento facilmente accessibile e conveniente per supportare il processo decisionale diagnostico nell’ambito delle polineuropatie. Guidando i primi passi diagnostici e identificando i pazienti che necessitano di un rinvio urgente, lo strumento potrebbe ridurre i ritardi e semplificare l’assistenza.

Il gruppo di ricerca sta ora testando come il modello gestisce le note della medicina di base e sta confrontando diversi modelli di linguaggio di grandi dimensioni per determinare quale offra la migliore combinazione di accuratezza, esplicabilità e rapporto costo-efficacia.