Person spricht mit einem Sprachassistenten am hellen Schreibtisch

Projekt

Die Leistung eines KI-Chatbots bei Fragen zum Glaukom, die von Patientenbroschüren adaptiert wurden

Einleitung: Angesichts des Potenzials von Chatbots mit künstlicher Intelligenz (KI) als Hauptinformationsquelle für Glaukompatienten ist es unerlässlich, die von Chatbots bereitgestellten Informationen zu charakterisieren, damit die Anbieter die Gespräche anpassen, die Anliegen der Patienten antizipieren und irreführe…

Einleitung: Angesichts des Potenzials von Chatbots mit künstlicher Intelligenz (KI) als Hauptinformationsquelle für Glaukompatienten ist es unerlässlich, die von Chatbots bereitgestellten Informationen zu charakterisieren, damit die Anbieter die Gespräche anpassen, die Anliegen der Patienten antizipieren und irreführende Informationen identifizieren können. Zweck dieser Studie war es daher, die Informationen zum Glaukom von KI-Chatbots wie ChatGPT-4, Bard und Bing zu evaluieren. Dazu wurden die Antwortgenauigkeit, die Vollständigkeit, die Lesbarkeit, die Anzahl der Wörter und die Anzahl der Zeichen im Vergleich zueinander und im Vergleich zu den Patienteninformationen zum Glaukom der American Academy of Ophthalmology (AAO) analysiert. Methoden: Die Abschnittsüberschriften der AAO-Broschüren zur Glaukom-Patientenaufklärung wurden in Frageform adaptiert und jedem KI-Chatbot (ChatGPT-4, Bard und Bing) 5-mal vorgelegt. 2 Reihen von Antworten jedes Chatbots wurden verwendet, um die Genauigkeit der Antworten der KI-Chatbots und der Informationen der AAO-Broschüren sowie die Vollständigkeit der Antworten des KI-Chatbots im Vergleich zu den AAO-Broschüren zu beurteilen. Die Antworten wurden von 3 unabhängigen, in Fragen zum Glaukom geschulten Augenärzten auf einer Skala von 1–5 bewertet. Für alle Chatbot-Antworten und die Abschnitte der AAO-Broschüren wurden die Lesbarkeit (bewertet mit dem Flesch-Kincaid Grade Level (FKGL), der dem US-amerikanischen Schulnotensystem entspricht), die Anzahl der Wörter und die Anzahl der Zeichen ermittelt. Ergebnisse: Die Genauigkeitswerte für AAO, ChatGPT, Bing und Bard lagen bei 4,84, 4,26, 4,53 bzw. 3,53. Im direkten Vergleich war AAO genauer als ChatGPT (p = 0,002) und Bard am wenigsten genau (Bard vs. AAO, p < 0,001; Bard vs. ChatGPT, p < 0,002; Bard vs. Bing, p = 0,001). ChatGPT hatte die vollständigsten Antworten (ChatGPT vs. Bing, p < 0,001; ChatGPT vs. Bard, p = 0,008), wobei die Werte für die Vollständigkeit von ChatGPT, Bing und Bard bei 3,32, 2,16 bzw. 2,79 lagen. Die Informationen von AAO und die Antworten von Bard waren am besten lesbar (AAO vs. ChatGPT, AAO vs. Bing, Bard vs. ChatGPT, Bard vs. Bing, alle p < 0,0001), mit Lesbarkeitswerten für AAO, ChatGPT, Bing und Bard von 8,11, 13,01, 11,73 bzw. 7,90. Die Antworten von Bing hatten die geringste Anzahl an Wörtern und Zeichen.