Naar de hoofdinhoud
Kunstbrein, AI-nieuws met duiding
6 augustus 2026
Terug naar het nieuws

AI-tools

OpenAI claimt hogere score voor GPT-5.6 dan Claude Opus 5, maar de test is niet dezelfde

OpenAI zegt dat GPT-5.6 Sol beter scoort dan Anthropics Claude Opus 5 op een logicatest, maar dat is enkel zo met instellingen die OpenAI zelf koos.

Op basis van OpenAI, The Decoder en ITdaily

5 min lezen 4 bronnen

Samengesteld met AI-assistentie uit de onderstaande bronnen, onder redactie van Frederiek Pascal. Hoe dit werkt

In het kort

  • OpenAI zegt dat GPT-5.6 Sol met twee eigen API-instellingen 38,3 procent haalt op de ARC-AGI-3-test, tegenover 30,2 procent voor Claude Opus 5.
  • Met de officiële, neutrale testopstelling scoorde GPT-5.6 Sol maar 7,8 procent, omdat het model daar zijn eigen redeneerstappen niet mag bijhouden.
  • ARC Prize, de organisatie achter de test, erkent dat de officiële meting OpenAI benadeelde, maar houdt vast aan een vaste testopstelling voor alle aanbieders.
  • Voor Vlaamse bedrijven betekent dit dat benchmarkscores van AI-leveranciers zelf zelden een eerlijke vergelijking zijn.
  • Los van deze rekenexercitie luiden bijna 1.300 medewerkers van AI-bedrijven, ook bij OpenAI, de alarmbel over het huidige ontwikkeltempo van AI en vragen ze de Amerikaanse overheid om dat internationaal mee af te remmen.

Wat dit voor jou betekent

OpenAI heeft nieuwe testresultaten gepubliceerd waaruit zou blijken dat zijn model GPT-5.6 Sol beter scoort dan Claude Opus 5 van concurrent Anthropic op ARC-AGI-3, een logicatest die kunstmatige intelligentie op algemeen redeneervermogen beoordeelt. Het probleem: OpenAI gebruikte daarvoor niet de officiële, neutrale testopstelling, maar een eigen configuratie met twee extra instellingen die het resultaat flink omhoog duwden.

Met die eigen opstelling haalt GPT-5.6 Sol een score van 38,3 procent, tegenover 30,2 procent voor Claude Opus 5 in de officiële meting. Zonder die extra instellingen, in de standaardtest die voor alle aanbieders gelijk is, haalde het OpenAI-model maar 7,8 procent.

Wat verklaart dat grote verschil?

Het verschil zit in twee technische instellingen die OpenAI aanbiedt via zijn eigen ontwikkelaarsomgeving: “retained reasoning” en “compaction”. De eerste zorgt ervoor dat het model zijn redeneerstappen kan bijhouden tussen verschillende acties in de test, in plaats van die telkens te moeten weggooien. De tweede vat oudere informatie samen in plaats van die simpelweg af te knippen wanneer het geheugen van het model vol raakt.

In de officiële testopstelling van ARC Prize, de organisatie achter de benchmark, worden die instellingen niet gebruikt. Daar moet elk model onder dezelfde, vaste voorwaarden werken, zodat de vergelijking tussen aanbieders eerlijk blijft. OpenAI stelt dat dit geen correct beeld geeft, omdat een benchmark volgens het bedrijf niet enkel het model test, maar ook de technische omgeving errond.

Wie heeft hier gelijk?

De organisatie achter de test erkent zelf dat er iets scheef zat. François Chollet, medeoprichter van ARC Prize, zei dat de officiële test OpenAI mogelijk benadeelde omdat die gebruikmaakte van een oudere versie van OpenAI’s ontwikkelaarstoegang, die niet dezelfde mogelijkheden bood als de nieuwste versie die Anthropic al wel kon gebruiken.

Chollet maakt daarbij een onderscheid: instellingen die specifiek gemaakt zijn om deze ene test te kraken, zijn niet toegestaan. Instellingen die gewoon beschikbaar zijn voor elke gebruiker van de ontwikkelaarstoegang, zoals de twee die OpenAI hier gebruikte, zijn dat volgens hem wel. Toch houdt ARC Prize vast aan zijn standaardmethode zonder providerspecifieke aanpassingen, net om de vergelijking tussen verschillende AI-bedrijven eerlijk te houden. Chollet noemt het aanvaardbaar dat aanbieders verschillende instellingen gebruiken, “zolang de instellingen en de kosten duidelijk gerapporteerd worden”.

Onafhankelijke, door derden gecontroleerde cijfers die de claims van OpenAI bevestigen of ontkrachten, zijn er op dit moment niet. Wat er ligt, zijn testresultaten die OpenAI zelf heeft gepubliceerd, plus een reactie van de testorganisatie die deels begrip toont voor OpenAI’s punt, maar de eigen meetlat niet aanpast.

Waarom komt dit nu naar boven?

De discussie volgt op een eerdere aankondiging van Anthropic, dat met Claude Opus 5 het bestaande record op deze benchmark met een veelvoud verbeterde. OpenAI’s publicatie lijkt een directe reactie daarop, in een periode waarin AI-bedrijven elkaar voortdurend proberen te overtreffen op dit soort testen.

Die onderlinge race staat niet los van een breder ongemak binnen de sector zelf. Bijna 1.300 medewerkers van AI-bedrijven, onder wie mensen bij OpenAI, Anthropic en Google DeepMind, riepen recent de Amerikaanse overheid op om internationaal AI-onderzoek doelbewust te helpen vertragen. Ze wijzen erop dat de druk om sneller te gaan dan de concurrentie zo groot is dat geen enkel bedrijf zelf op de rem durft te staan, ook al voelen ze zelf onbehagen bij het huidige tempo. Dat de sector tegelijk vecht om enkele procentpunten op een benchmark en intern waarschuwt voor een te hoog ontwikkeltempo, illustreert hoe die druk in de praktijk werkt.

Verandert dit iets aan welk model je moet gebruiken?

Voor de meeste bedrijven verandert er weinig. Benchmarkscores als deze meten abstract logisch redeneren onder gecontroleerde, kunstmatige omstandigheden, niet hoe een model presteert bij het opstellen van een offerte, het beantwoorden van klantenmails of het samenvatten van een contract. Bovendien tonen de eigen cijfers van OpenAI dat de uitkomst voor exact hetzelfde model bijna vijf keer hoger kan uitvallen naargelang de gekozen instellingen, wat aangeeft hoe wisselvallig dit soort vergelijkingen is.

Wat betekent dit voor jou

Wat benchmarkoorlogen betekenen voor je keuze van AI-tool

  • Kmo's die een AI-tool kiezen op basis van 'de beste score' Benchmarkclaims van leveranciers zelf zijn geen onafhankelijk bewijs. Test een model op je eigen taken voor je overstapt of extra geld uitgeeft aan een 'beter' model.
  • Bedrijven die nu al met ChatGPT werken Er is geen actie nodig. Dit gaat over een testresultaat, niet over een productwijziging die invloed heeft op hoe je huidige abonnement of tool werkt.
  • Wie AI-leveranciers vergelijkt voor een aankoopbeslissing Vraag altijd naar de exacte testomstandigheden achter een gepubliceerd cijfer. Twee leveranciers die 'dezelfde test' claimen, gebruiken vaak andere instellingen, waardoor de cijfers niet vergelijkbaar zijn.

Veelgestelde vragen

Is GPT-5.6 Sol nu écht beter dan Claude Opus 5?

Dat is niet vastgesteld. OpenAI's hogere score kwam er alleen met twee specifieke instellingen die het bedrijf zelf koos. Met de neutrale, officiële testmethode scoorde het model juist veel lager dan Claude Opus 5. Er zijn geen onafhankelijke cijfers die één van beide claims bevestigen.

Wat zijn 'retained reasoning' en 'compaction' precies?

Het zijn twee technische opties in OpenAI's ontwikkelaarstoegang. De eerste laat een model zijn tussenstappen onthouden in plaats van die na elke actie te vergeten. De tweede vat oude informatie samen in plaats van die weg te gooien wanneer het geheugen vol raakt. Beide verbeteren de score aanzienlijk op deze specifieke test.

Waarom gebruikt de testorganisatie die instellingen niet standaard?

ARC Prize wil elk AI-model onder identieke, vaste voorwaarden testen zodat de vergelijking tussen bedrijven eerlijk blijft. De organisatie erkent wel dat de gebruikte versie van OpenAI's toegang mogelijk minder mogelijkheden bood dan die van Anthropic, wat de vergelijking scheeftrok.

Moet ik als ondernemer overstappen naar het model met de hoogste benchmarkscore?

Nee, niet op basis van dit soort cijfers alleen. Benchmarks als ARC-AGI-3 testen abstract logisch redeneren onder kunstmatige omstandigheden, niet je concrete taken zoals klantenservice of tekstwerk. Test een model altijd op je eigen taken voor je overstapt, benchmarkscores zeggen daar weinig over.

Wat heeft de oproep van AI-medewerkers om te vertragen hiermee te maken?

Los van dit specifieke geschil illustreert het de onderliggende druk in de sector: bedrijven vechten voortdurend om elkaar op tests te overtreffen, terwijl bijna 1.300 medewerkers van diezelfde bedrijven vragen om internationaal minder hard op het gaspedaal te duwen bij AI-onderzoek.

Bronnen

Deel dit artikel

Nieuwsbrief

Wil je dinsdag en vrijdag het belangrijkste AI-nieuws in je mailbox?

Een selectie met bij elk stuk de duiding: wat verandert dit voor jouw zaak?

Uitschrijven kan met één klik onderaan elke mail. Zie ook Privacy en cookies.