Introductie
Generatieve kunstmatige intelligentie (AI) ontwikkelt zich snel en krijgt ook binnen de tandheelkunde een steeds grotere rol. AI wordt al toegepast in onder meer diagnostiek, behandelplanning en simulatieonderwijs. Minder duidelijk is echter hoe goed generatieve AI-tools inzetbaar zijn voor academische taken binnen de tandheelkunde, zoals literatuur zoeken, wetenschappelijke vragen beantwoorden, toetsvragen maken en feedback geven.
In dit onderzoek zijn drie populaire AI-tools met elkaar vergeleken: ChatGPT, DeepSeek en SciSpace. Het doel was om te onderzoeken in hoeverre deze tools kerntaken binnen tandheelkundig onderwijs en onderzoek kunnen ondersteunen, en of er duidelijke prestatieverschillen bestaan tussen de tools.
Onderzoeksmethode
De drie AI-tools kregen gestandaardiseerde prompts voor zes taken. Drie taken waren gericht op onderzoek: het schrijven van een abstract op basis van een wetenschappelijk artikel, het beantwoorden van onderzoeksvragen met bronvermelding en het zoeken naar wetenschappelijke literatuur. De andere drie taken waren gericht op onderwijs: het formuleren van toetsvragen, het nakijken van toetsantwoorden met feedback en het maken van een antwoordmodel voor een tandheelkundige onderwijsopdracht.
De output werd beoordeeld aan de hand van vooraf vastgestelde criteria, zoals helderheid, relevantie, leesbaarheid, wetenschappelijke juistheid en kwaliteit van bronvermelding. Per criterium konden 0, 0,5 of 1 punt worden toegekend. De beoordeling werd uitgevoerd door derdejaars tandheelkundestudenten en deels gekruist gecontroleerd door de AI-tools zelf. De resultaten werden weergegeven als percentages. Verschillen tussen ChatGPT, DeepSeek en SciSpace werden statistisch geanalyseerd met een one-way ANOVA en Tukey HSD-test, waarbij p < 0,05 als significant werd beschouwd.
Resultaten
Alle drie de tools presteerden boven de vooraf gekozen grens van 70 procent en lieten daarmee zien dat zij bruikbaar kunnen zijn als ondersteunend hulpmiddel binnen tandheelkundig onderwijs en onderzoek. De totale scores lagen dicht bij elkaar: ChatGPT behaalde 81,80%, DeepSeek 82,79% en SciSpace 86,9%. Er werd geen statistisch significant verschil gevonden in de totaalscores.
Binnen de onderzoekstaken behaalde DeepSeek de hoogste gemiddelde score met 86,87%. DeepSeek presteerde vooral sterk bij het beantwoorden van onderzoeksvragen en het leveren van relevante, gestructureerde literatuur. ChatGPT scoorde in deze categorie het laagst, vooral door een zwakkere prestatie bij het zoeken naar wetenschappelijke literatuur. Bij deze taak bleek dat ChatGPT wel veel bronnen kon aanleveren, maar dat deze niet altijd goed aansloten op de PICO-vraag of voldoende recent waren. SciSpace en DeepSeek scoorden op deze literatuurtaak beide hoger en leverden relevantere en beter gestructureerde resultaten.
Binnen de onderwijstaken scoorde SciSpace het hoogst met 91,67%. Vooral bij het formuleren van toetsvragen presteerde SciSpace sterk. De vragen sloten goed aan bij de leerdoelen en de antwoordopties waren over het algemeen plausibel. Dit verschil was ook statistisch significant tussen SciSpace en DeepSeek. ChatGPT viel op door beknopte en duidelijke feedback bij het nakijken van toetsantwoorden. DeepSeek gaf eveneens bruikbare feedback, maar was soms uitgebreider dan nodig. SciSpace gaf vaak veel context, wat inhoudelijk waardevol kon zijn, maar minder praktisch was voor korte toetsfeedback.
Over het algemeen scoorden alle tools goed op helderheid, structuur, relevantie en leesbaarheid. De grootste zwakte lag bij wetenschappelijke accuratesse en bronvermelding. Vooral het correct zoeken, selecteren en citeren van literatuur bleek lastig. Er werden geen verzonnen bronnen gevonden, maar wel fouten in citatiestijl, ontbrekende DOI’s, onvolledige referenties en soms bronnen die niet volledig aansloten op de onderzoeksvraag.
Conclusie
ChatGPT, DeepSeek en SciSpace zijn alle drie geschikt als ondersteunend hulpmiddel voor kerntaken binnen tandheelkundig onderwijs en onderzoek. Er werd echter geen statistisch significant verschil gevonden in de algemene prestaties van de drie tools. Daarmee werd bevestigd dat de tools bruikbaar zijn, maar niet dat één tool duidelijk superieur is.
De verwachte taakgerichte verschillen kwamen niet volledig uit. ChatGPT was niet aantoonbaar het beste in taalgerichte taken, DeepSeek scoorde niet consequent tussen de andere tools in, en SciSpace was niet het sterkst in literatuurgerelateerde taken. Wel bleek dat iedere tool eigen praktische voordelen heeft: ChatGPT is sterk in compacte feedback, DeepSeek in onderzoekstaken en SciSpace in onderwijstoepassingen zoals toetsvragen.
Discussie
De resultaten laten zien dat generatieve AI waardevol kan zijn binnen de tandheelkundige academische praktijk, maar alleen onder kritische menselijke controle. De tools kunnen tijd besparen, ideeën structureren en tekstuele output van hoog niveau produceren. Toch kunnen zij menselijke beoordeling niet vervangen. Vooral bij literatuuronderzoek blijft een gestructureerde zoekstrategie, bijvoorbeeld met PICO en MeSH-termen, noodzakelijk.
Een belangrijk aandachtspunt is dat AI-tools snel veranderen. Tijdens het onderzoek bleek dat dezelfde prompt op een later moment soms een ander of beter antwoord opleverde. Dit maakt reproduceerbaarheid lastig. Toekomstig onderzoek zou daarom binnen een kort tijdsbestek moeten plaatsvinden, met meerdere herhaalde metingen en meer beoordelaars, bij voorkeur ook experts.
De kracht van dit onderzoek ligt niet alleen in de vergelijking tussen drie AI-tools, maar ook in de ontwikkelde beoordelingsmethode. Deze methode kan worden gebruikt om toekomstige AI-tools opnieuw te evalueren, zowel binnen de tandheelkunde als binnen andere academische domeinen.
Bekijk de 5 genomineerde scripties