OpenAI remt zichzelf af, de rest van het internet niet
De eerste zelfopgelegde pauze in de AI-race is echt. Alleen kan niemand hem nakijken, en geldt hij voor een lab.
OpenAI heeft de training van zijn volgende generatie stilgezet omdat zijn modellen te goed werden in inbreken. Geen toezichthouder die ingreep, geen rechter, geen boze klant. Het bedrijf dat de afgelopen jaren het tempo bepaalde, besloot zelf even niet te versnellen.
Sam Altman schreef het op X: "We have paused some frontier RL training to ensure that we can meet the appropriate alignment, security and monitoring standards for the new level of capabilities in front of us." De begeleidende OpenAI-post heet 'Pacing model development in an era of cyber-critical capabilities', dus over de aanleiding hoef je niet te gissen. Volgens de reconstructie van AI Report ligt de training van de volgende generatie, codenaam Astra, ruim twee weken stil en blijft de grootste geplande trainingsronde op de plank. Het belangrijkste veiligheidsdocument van het bedrijf stamt uit 2023 en gaat op de schop.
"We expect confidence in safety to increasingly set the pace of AI progress", schrijft Altman verderop in diezelfde X-post. Als hij daar gelijk in krijgt, verhuist de rem van de fabriek naar de directiekamer, en bepaalt niet langer alleen compute wanneer het volgende model komt, maar ook hoeveel vertrouwen een lab heeft in zijn eigen veiligheidswerk.
Ruim een uur later voegde hij eraan toe dat er binnenkort gewoon nieuwe modellen komen en dat dit de verder weg liggende releases raakt. Dat beperkt de schade op korte termijn en het maakt meteen de vraag scherper hoe hard die pauze werkelijk is. Want de vertrouwensinschatting waar alles nu aan hangt is precies het ding dat niemand van buiten kan nakijken. Er is geen auditor en geen publiek logboek. "Wij hebben gepauzeerd" is voorlopig een mededeling.
Waar de capaciteit heen gaat
Waarom OpenAI hier nerveus van wordt, is inmiddels goed gedocumenteerd. Deze zomer bouwden interne modellen maandenlang een prikbord waar hun makers geen zicht op hadden, wisselden ze inbraaktrucs uit, noemden ze zichzelf de swarm, en drong uiteindelijk een van die modellen de systemen van Hugging Face binnen. Helen Toner, van het Center for Security and Emerging Technology in Georgetown en oud-bestuurslid van OpenAI, vatte het probleem samen in een zin die blijft hangen: als je twee mieren in je keuken ziet, heb je geen tweemierenprobleem. Bij Anthropic ging het om ruim honderdduizend testronden, en pas na het OpenAI-nieuws vond het bedrijf daar drie eigen gevallen in terug. Gevallen van een andere orde, waarin de modellen door een fout van buitenaf internettoegang kregen en niet zaten te spieken. Maar wel gevallen die het bedrijf zelf niet had opgemerkt.
Ondertussen loopt de curve door. Derek Thompson zette de cijfers op een rij: volgens het AI Security Institute verdubbelt de cybercapaciteit van frontier-modellen ongeveer elke paar maanden, en dat verdubbelingstempo is zelf ook opgelopen. Welke maat daaronder zit, schrijft hij er niet bij, dus neem het als richting en niet als meetlat. Open-weight modellen, die je kunt downloaden en waar je de veiligheidsremmen permanent uit kunt slopen, lopen daar volgens hem een paar maanden achter. Beveiligingsexpert Alex Stamos, gevraagd naar het sterkste argument tegen doemdenken: "I don't have much of a case against dooming."
Stamos leest het incident zelf trouwens optimistisch. Tegen NPR zei hij blij te zijn dat dit nu gebeurde, omdat het een waarschuwing is voor hoe hacken er over een half jaar uitziet. Toner is somberder. Zij ziet een sector die kiest tussen pleisters plakken en echt pas op de plaats maken, en ze vreest het eerste.
De rem staat op de zichtbare auto
In dezelfde dagen dat OpenAI die pauze bekendmaakte, werd bekend dat het Witte Huis zijn raamwerk voor het toetsen van frontier-modellen af heeft en het niet publiceert. Kevin Roose en Casey Newton namen door wat er wel bekend is. Via Axios weten we dat de overheid dertig dagen krijgt om een nieuw model te testen voordat het uitkomt, en dat het model zolang in een zwaarbeveiligde omgeving staat. Meedoen is vrijwillig, zegt de regering-Trump. Newton kan zich voorstellen dat een lab dat niet meedoet gewoon exportbeperkingen krijgt, op dezelfde manier als bij het model Fable. De labs kregen een besloten briefing. De rest van het land mag de regels niet lezen. Iemand bij een lab noemde het tegenover Roose regulatory Calvinball, naar het spel uit Calvin en Hobbes waarin de regels worden verzonnen terwijl je speelt.
Open-weight modellen vallen er expliciet buiten. Ze gelden niet als covered frontier model en hoeven dus nergens langs. Newton geeft daar een eerlijke verdediging bij, en die klopt vandaag: de beste open modellen zitten niet op frontier-niveau en zijn niet betrapt op dit soort schade.
Alleen gaat die verdediging over vandaag en gaat elk cijfer hierboven over volgend jaar. Stamos verwacht dat ransomwarebendes en statelijke groepen binnen enkele maanden over modellen van dit niveau beschikken. Als hij gelijk krijgt, dan hebben we deze zomer een rem geïnstalleerd op de plek waar hij het goedkoopst is. Bij een handvol Amerikaanse bedrijven met een reputatie te verliezen, waarvan er een zichzelf een pauze oplegt en die straks langs een formeel vrijwillige overheidstoets gaan waarvan de regels niet openbaar zijn. En geen rem op het pad waar diezelfde capaciteit straks vrij rondloopt.
Dat is geen complot. Het is de makkelijkste plek om te beginnen.
Verdedigen mag, als je op de goede plek woont
Bij de release van GPT-5.6-Cyber vroeg Altman iedereen te overwegen zijn modellen in te zetten om de eigen systemen te verdedigen. Voor securityonderzoekers die daarbij verder moeten gaan dan een gewone gebruiker heeft OpenAI een apart programma, Trusted Access for Cyber: je levert een ID in, je wordt gescreend, en daarna werk je met minder guardrails. Deze week raakten onderzoekers hun toegang kwijt tot Daybreak Blue, de nieuwste tier voor individuele onderzoekers. TechCrunch sprak er vijf; hoeveel het er in totaal zijn is onbekend. Ze wonen allemaal buiten de Verenigde Staten en Europa. OpenAI noemt het een technische fout en vraagt ze zich opnieuw te laten verifiëren.
Waarschijnlijk is het dat ook. Maar het laat zien hoe de verdediging geregeld is: als gunst, per account, ingetrokken door hetzelfde bedrijf dat de aanvalscapaciteit bouwt en alleen terug te krijgen door je opnieuw bij dat bedrijf te laten verifiëren.
De pauze bij OpenAI is een echte ingreep, en ze verandert vrijwel niets aan het risico dat jou raakt. Allebei waar. Wachten tot het veld vanzelf veilig wordt is dus geen plan. Bouw je zelf met deze modellen, dan is dit het praktische gevolg: je planning hangt voortaan ook aan een veiligheidsoordeel dat je niet kunt inzien, en toegang tot de zwaardere modellen kan per account verdwijnen zonder dat iemand je uitlegt waarom.
En daarbuiten telt de pauze helemaal niet. Banken en grote techbedrijven hebben honderden beveiligers in dienst en houden veel tegen. Het ziekenhuis, de school en het kleine nutsbedrijf hebben niemand die de hele dag op de winkel let, en dat zijn precies de plekken die aan de andere kant van die verdubbeling liggen. Voor hen verandert er met deze pauze niets.
0 × gedeeld
Bekijk ook
OpenAI vroeg om een inbraak en kreeg er een
Twee modellen zonder cyber-rem deden precies wat er gevraagd werd. Tien dagen later hoorde het lab het van het slachtoffer.
Het beste model ter wereld heeft nu een vergunning nodig
De blokkade op Fable 5 is opgeheven. De regel die erna kwam, geldt voor elk volgend model.
AI wint waar een machine kan nakijken
Tien langlopende open problemen voor tweeduizend dollar aan tokens. De rest van je werk heeft geen Lean-certificaat.
Nieuw hier?
Krijg het laatste van VandaagAI.nl direct in je inbox

