Este estudo avaliou o desempenho diagnóstico de modelos de linguagem de grande porte (LLMs) - ChatGPT 5.0 (OpenAI) e Gemini Flash 2.0 (Google Inc.) - na detecção de lesões periapicais em radiografias periapicais, utilizando um prompt multimodal padronizado. Foram analisadas 75 radiografias periapicais anonimizadas de dentes anteriores da maxila e da mandíbula, distribuídas igualmente entre casos com e sem lesões. Um especialista em Endodontia, devidamente calibrado, forneceu o diagnóstico de referência. Cada imagem foi avaliada de forma independente cinco vezes por ambos os LLMs, utilizando o prompt: “Esta imagem apresenta uma lesão periapical? Em caso afirmativo, em qual dente? Responda com: A) Sim B) Não.” A acurácia balanceada, sensibilidade, especificidade e F1-score foram calculados com intervalos de confiança de 95% (IC95%) obtidos por reamostragem bootstrap. O desempenho também foi estratificado conforme o nível de dificuldade diagnóstica, e os modelos foram comparados pelo teste exato de McNemar (α = 0,05). O ChatGPT 5.0 apresentou desempenho geral superior ao Gemini Flash 2.0, com sensibilidade de 0,97 (IC95%: 0,95-0,99), especificidade de 0,11 (IC95%: 0,07-0,16) e acurácia balanceada de 0,54 (IC95%: 0,52-0,57). O Gemini Flash 2.0 obteve sensibilidade de 0,84 (IC95%: 0,79-0,89), especificidade de 0,11 (IC95%: 0,07-0,16) e acurácia balanceada de 0,48 (IC95%: 0,44-0,51). Ambos os modelos apresentaram altas taxas de falso-positivos e erros frequentes na localização do dente. O teste de McNemar confirmou diferença estatisticamente significativa entre os modelos (p < 0,05), favorecendo o ChatGPT 5.0. Ambos os LLMs demonstraram alta sensibilidade, porém baixa especificidade, resultando em desempenho diagnóstico intermediário e viés para classificações positivas. Assim, modelos de linguagem de uso geral ainda não são adequados para aplicação diagnóstica radiográfica.
Autoria
person Diulia Pereira Bubna
person Natanael Henrique Ribeiro Mattos
person Luana Beatriz das Portas Luiz
person Flares Baratto-Filho
school Tuiuti University of Paraná, Curitiba, PR, Brazil.Tuiuti University of ParanáBrazilCuritiba, PR, Brazil Tuiuti University of Paraná, Curitiba, PR, Brazil.school Department of Dentistry, University of Joinville (Univille), Joinville, SC, Brazil.University of JoinvilleBrazilJoinville, SC, Brazil Department of Dentistry, University of Joinville (Univille), Joinville, SC, Brazil.
person May Tostes de Mattos-Calil
person Yara Teresinha Corrêa Silva-Sousa
person Erika Calvano Küchler
person Ângela Graciela Deliga Schroder
person Cristiano Miranda de Araujo
person Bianca Marques de Mattos de Araujo
school Tuiuti University of Paraná, Curitiba, PR, Brazil.Tuiuti University of ParanáBrazilCuritiba, PR, Brazil Tuiuti University of Paraná, Curitiba, PR, Brazil.school Department of Dentistry, University of Joinville (Univille), Joinville, SC, Brazil.University of JoinvilleBrazilJoinville, SC, Brazil Department of Dentistry, University of Joinville (Univille), Joinville, SC, Brazil.
Correspondence: Flares Baratto Filho. Tuiuti University of Paraná. R. Padre Ladislau Kula, 395 - Santo Inácio. Curitiba, Brazil. Email:
fbaratto1@gmail.com
fbaratto1@gmail.com
Conflict of Interest
The authors declare that they have no conflicts of interest related to this study.
SCIMAGO INSTITUTIONS RANKINGS
Tuiuti University of Paraná, Curitiba, PR, Brazil.Tuiuti University of ParanáBrazilCuritiba, PR, Brazil Tuiuti University of Paraná, Curitiba, PR, Brazil.
Department of Dentistry, University of Joinville (Univille), Joinville, SC, Brazil.University of JoinvilleBrazilJoinville, SC, Brazil Department of Dentistry, University of Joinville (Univille), Joinville, SC, Brazil.
Figuras | Tabelas
imageopen_in_new

imageFigure 1 Overall confusion matrices for ChatGPT and Gemini in periapical lesion detection. open_in_new

imageFigure 2 Confusion matrices by diagnostic difficulty for ChatGPT and Gemini in periapical lesion detection. open_in_new

imageFigure 3 Diagnostic performance metrics by difficulty level for ChatGPT and Gemini. open_in_new

table_chartTable 1
Global performance metrics of the LLMs.
| Model | ChatGPT (n = 384) | Gemini (n = 384) |
|---|---|---|
| Accuracy (95% CI) | 0.54 (0.52-0.57) | 0.48 (0.44-0.51) |
| Sensitivity (95% CI) | 0.97 (0.95-0.99) | 0.84 (0.79-0.89) |
| Specificity (95% CI) | 0.11 (0.07-0.16) | 0.11 (0.07-0.16) |
| Precision (95% CI) | 0.50 (0.45-0.55) | 0.47 (0.42-0.52) |
| F1-Score (95% CI) | 0.66 (0.62-0.71) | 0.60 (0.55-0.65) |
table_chartTable 2
Performance metrics of the large language models (LLMs) by diagnostic difficulty level.
| Model | Difficulty | Accuracy (95% CI) | Sensitivity (95% CI) | Specificity (95% CI) | Precision (95% CI) | F1-Score (95% CI) |
|---|---|---|---|---|---|---|
| ChatGPT | Easy (n = 210) | 0.54 (0.52-0.57) | 1.00 (1.00-1.00) | 0.09 (0.05-0.14) | 0.30 (0.24-0.37) | 0.47 (0.39-0.54) |
| Gemini | 0.48 (0.43-0.54) | 0.85 (0.75-0.93) | 0.12 (0.07-0.17) | 0.28 (0.21-0.35) | 0.42 (0.34-0.50) | |
| ChatGPT | Intermediate (n = 140) | 0.59 (0.54-0.65) | 0.99 (0.97-1.00) | 0.20 (0.09-0.32) | 0.72 (0.64-0.80) | 0.83 (0.78-0.88) |
| Gemini | 0.47 (0.42-0.53) | 0.85 (0.78-0.92) | 0.09 (0.02-0.18) | 0.67 (0.58-0.75) | 0.75 (0.68-0.81) | |
| ChatGPT | Difficult (n = 35) | 0.43 (0.37-0.48) | 0.87 (0.73-0.97) | 0.00 (0.00-0.00) | 0.84 (0.70-0.97) | 0.85 (0.75-0.94) |
| Gemini | 0.40 (0.33-0.47) | 0.80 (0.66-0.93) | 0.00 (0.00-0.00) | 0.83 (0.68-0.96) | 0.81 (0.70-0.91) |
Como citar
location_on
Fundação Odontológica de Ribeirão Preto
Av. do Café, S/N, 14040-904 Ribeirão Preto SP Brasil, Tel.: (55 16) 3602-3982, Fax: (55 16) 3633-0999 -
Ribeirão Preto -
SP -
Brazil
E-mail: bdj@forp.usp.br
E-mail: bdj@forp.usp.br
rss_feed
Stay informed of issues for this journal through your RSS reader
PDF version for download
Related articles
Lista de links para artigos relacionados. Os links abrem em nova aba.
Versões e tradução automática
Escolha a versão original do texto ou utilize um serviço de tradução automática.
Versão original do texto
Como citar
Escolha um formato para exportar ou selecione um estilo de citação. O conteúdo abaixo pode ser atualizado após a seleção.
Thumbnail
Thumbnail
Thumbnail
Thumbnail