KI im Stresstest: Können Chat GPT und Copilot die Triage in der Notaufnahme revolutionieren?

Die Triage in der Notaufnahme ist ein entscheidender Schritt für die adäquate weitere Versorgung von Patientinnen und Patienten. Wie gut sind gängige KI-Modelle in der Triage echter Patientinnen und Patienten und wo liegen die Herausforderungen?
Personalmangel ist ein in deutschen Notaufnahmen konstant präsentes Problem. Die Ressourcen reichen oft kaum aus, um die Vielzahl an Patientinnen und Patienten angemessen zu behandeln. Bei der Triage, also dem Prozess der Unterscheidung von schweren und weniger schweren Verletzungen wird für die Versorgung benötigtes Personal gebunden [1]. Eine Möglichkeit zur Entlastung von Personal, kann die Anwendung von KI-Algorithmen zur Triage-Unterstützung sein. Mit Datensätzen von an Covid-19 Erkranken konnte retrospektiv bereits gezeigt werden, dass KI-Algorithmen gegenüber herkömmlichen Algorithmen eine höhere Genauigkeit in der Triage erreichen können [2]. Ein prominenter Kritikpunkt ist dabei allerdings, dass die Entscheidungsprämissen der KI-Modelle größtenteils in einer „Black Box“ verborgen liegen [3]. Die geringe Nachvollziehbarkeit von KI-Entscheidungen kann zu Vertrauensproblemen führen [4]. Spannend ist daher der Vergleich der Triage-Genauigkeit gängiger Large Language Models (LLMs) in Echtzeit-Notfall-Situationen gegenüber Triage-Krankenpflegepersonal. Wo entstehen in realen klinischen Settings mit hohem Patientenaufkommen signifikante Fehler in den Triage-Entscheidungen?
Triage in der Notaufnahme – KI-Modelle im Test
Arslan, Nuhoglu & Altinbilek (2024) [5] untersuchten die Triage-Genauigkeit von ChatGPT 4.0, Copilot Plus und Krankenpflegekräften anhand der Anamnesedaten von 468 Patienten/innen in einer türkischen Notaufnahme. Ein Notfallmediziner erstellte aus den Daten klinische Vignetten, die anschließend in die LLMs gespeist wurden, und vergab Referenz-Triage-Level. Gleichzeitig vergaben Krankenpflegekräfte anhand der Anamnese selbst ein Triage-Level, sodass die Genauigkeit der beiden LLMs mit der Genauigkeit des Pflegepersonals in Bezug auf die Vignette verglichen werden konnte.
Studie zu Gründungsmotiven von Ärzten
Die Ergebnisse zeigen, dass die durchschnittliche Genauigkeit bei ChatGPT 4.0 mit 66.5 % am höchsten war. Die Genauigkeit der Krankenpflegerinnen und Krankenpfleger steht mit 65,2% an zweiter Stelle, gefolgt von Copilot Plus mit 61,8%. Interessant dabei ist, dass das Krankenpflegepersonal kaum Personen in zu hohe Triage-Level eingestuft hat, dafür aber 34% zu niedrig eingruppierte. Dabei muss beachtet werden, dass es sich häufig um bewusste Falsch-Einteilung angesichts Überbelegung von Betten in den jeweiligen Triage-Zonen handelte. In diesen Situationen hat das Krankenpflegepersonal Rücksprache mit Notfallmedizinerinnen und –Medizinern gehalten und Lösungen im Einzelfall schnell abgesprochen, was bei der Interpretation der Zahlen berücksichtigt werden sollte. Die Autoren folgern, dass ein schlichtes Ausführen der Triage-Empfehlungen der LLMs zu einer starken Überbelastung einzelner Triage-Zonen geführt hätte, was die Verbindung der LLM-Empfehlungen mit den Erfahrungen der real Verantwortlichen unabdingbar macht.
Bei Krankenpflegepersonal konnte eine statistisch signifikante Unter-Triage von Personen in der Altersgruppe unter 45 Jahren festgestellt werden. Demgegenüber hatten die LLMs keine signifikanten Verzerrungen hinsichtlich Alter, Geschlecht, Aufnahmetagen und Aufnahmezeit. Die Studie deutet darauf hin, dass menschliche Voreingenommenheit durch die Verwendung von LLMs reduziert werden kann – ein Gegenargument zur Black-Box Sorge.
KI kann menschliche Entscheidungen optimieren – nicht nur bei der Triage in der Notaufnahme
Die Ergebnisse der vorgestellten Studie bestätigen die Fähigkeit von KI-Modellen, präzise Triage-Kategorisierungen auch in echten Notfall-Szenarien durchzuführen und dabei menschliche Verzerrungen zu vermeiden. Allerdings fehlen ihnen bisher wichtige Kontextfaktoren wie die Bettenbelegung. Eine hybride Lösung – KI-gestützte Vorselektion kombiniert mit menschlicher Überprüfung – erscheint Patientinnen und Patienten sowie Health Professionals momentan die optimale Lösung zu sein [6]. Hierbei sind neben erheblichen Zeit- und Kostenersparnissen weitere Effekte zu erwarten: Die gegenseitige Kontrolle von Mensch und Technik bei Triage-Entscheidungen kann gleichzeitig der Black-Box Problematik von LLMs wie auch den systematischen Verzerrungen menschlicher Triage entgegenwirken. Diese Erkenntnisse sind für die zukünftige technologiegestützte Prozessgestaltung in Notaufnahmen essenziell. Aber auch in anderen Versorgungsbereichen kann die Frage, wie systematische Bias in menschlicher Entscheidungsfindung durch KI-Einsatz vermieden werden können, für die Versorgungsqualität und damit auch für das Management bei Anschaffungsentscheidungen besonders relevant sein. Um dabei Datenschutzbedenken zu adressieren, können fundierte Praxisleitfäden wie vom Bitkom e.V. [7] das Management bei KI-Initiativen unterstützen.
Verwandte Artikel
Lesen Sie auch: Telenotärzte: Die Zukunft der prähospitalen Notfallversorgung?
Literatur
- Mühlenfeld, N., et al., Kosten-Erlös-Defizit der ambulanten Versorgung von Bagatellverletzungen in der Notaufnahme. Die Unfallchirurgie, 2023. 126(6): p. 433-440 DOI: 10.1007/s00113-022-01205-9.
- Bartenschlager, C.C., et al., Covid-19 triage in the emergency department 2.0: how analytics and AI transform a human-made algorithm for the prediction of clinical pathways. Health Care Management Science, 2023. 26(3): p. 412-429 DOI: 10.1007/s10729-023-09647-2.
- Arbet, J., et al., Lessons and tips for designing a machine learning study using EHR data. Journal of Clinical and Translational Science, 2021. 5(1): p. e21 DOI: 10.1017/cts.2020.513..
- Tahernejad, A., et al., Application of artificial intelligence in triage in emergencies and disasters: a systematic review. BMC Public Health, 2024. 24(1) DOI: 10.1186/s12889-024-20447-3.
- Arslan, B., et al., Evaluating LLM-based generative AI tools in emergency triage: A comparative study of ChatGPT Plus, Copilot Pro, and triage nurses. The American Journal of Emergency Medicine, 2025. 89: p. 174-181 DOI: https://doi.org/10.1016/j.ajem.2024.12.024.
- Morlotti, C., et al., The digitalization of emergency department triage: the perspectives of health professionals and patients. BMC Health Services Research, 2024. 24(1): p. 1406 DOI: 10.1186/s12913-024-11862-8.
- Künstliche Intelligenz & Datenschutz Praxisleitfaden. 2024, Bitkom e.V.: Berlin.


