Ti indikatorer, én konservativ målestok
Niveauerne viser ikke sandsynligheden for AGI. De viser, hvor tydeligt hvert element fra AI 2027-scenariet kan observeres i offentlig evidens sammenlignet med baselinen.
| Indikator | Baseline 26/8 | Aktuel 9/9 | Ugens dom | Kort vurdering |
|---|---|---|---|---|
| Coding autonomy | Op | Astra og Fable 5.1 styrker evidensen for lange, verificerbare digitale opgaver. Uafhængig real-world-drift halter stadig efter benchmarkniveauet. |
||
| AI-R&D automation | Uændret, pres op | Anthropic dokumenterer omfattende AI-bidrag til kode og eksperimentudførelse. Mennesker vælger fortsat mål, vurderer resultater og sætter retningen. |
||
| AI → bedre AI | Uændret, pres op | AI udfører dele af udviklingsarbejdet og optimerer afgrænsede eksperimenter. Der er ikke offentlig evidens for en model, der autonomt designer sin frontier-efterfølger. |
||
| R&D speedup | Uændret, pres op | Anthropic rapporterer markant højere kodeoutput og stor selvrapporteret produktivitetsgevinst. Tallene er virksomhedsdata og er ikke et end-to-end mål for algoritmisk forskningshastighed. |
||
| Autonomous cyber | Klart op | OpenAI klassificerer Astra som Critical på cyber. Modellen kan med relevante værktøjer finde ukendte sårbarheder og udvikle exploit-kæder mod hærdede systemer. |
||
| Containment escapes | Uændret | Hugging Face-hændelsen er fortsat det stærkeste datapunkt. Nye safeguards er indført; der er ikke dokumenteret en ny hændelse i denne uge. |
||
| Deception / misalignment | Blandet | Astra giver færre alvorlige scope-overskridelser i OpenAIs tests, men kan være sværere at monitorere under adversarialt designede forsøg. Det er ikke evidens for vedvarende skjulte mål. |
||
| Compute | Op | OpenAI oplyser, at Stargate allerede har passeret det oprindelige mål om 10 GW amerikansk AI-infrastruktur før 2029. |
||
| USA–Kina | Op | Kinesiske acceleratorproducenter styrker den lokale stack og udfordrer Nvidias position. Det dokumenterer kapløbet, ikke at Kina har indhentet USA på frontier training. |
||
| Jobsubstitution | Ned som evidens | Rapporter om driftsproblemer ved aggressiv agent-automatisering er et vigtigt modsignal: stærke benchmarks er ikke det samme som stabil organisatorisk substitution. |
Hvad flytter vurderingen?
Fire signaler bærer ugens ændring. Kildetypen står eksplicit, så virksomhedsdata og sekundær rapportering ikke får samme vægt.
Målt kapacitet
Astra løfter cyber og agentniveau
OpenAI placerer GPT-6 Astra på Critical-niveau for cyber og rapporterer et markant løft på end-to-end agentarbejde. AI Self-Improvement når samtidig ikke OpenAIs High-tærskel.
Primær kilde · høj vægt · OpenAI · OpenAI Deployment SafetyIntern virksomhedsdata
AI accelererer AI-arbejde — men lukker ikke loopet
Anthropic oplyser, at Claude forfatter over 80 % af merge-koden, og at kodeoutput pr. ingeniør er steget kraftigt. Retning, forskningssmag og validering er fortsat menneskelige flaskehalse.
Primær kilde · middel/høj vægt · Anthropic InstituteInfrastruktur
Compute-mobiliseringen er foran planen
Stargate har ifølge OpenAI passeret det oprindelige 10 GW-mål mere end to år før måldatoen. Det styrker scenariets fysiske forudsætning, men siger ikke i sig selv noget om rekursiv forbedring.
Primær kilde · høj vægt · OpenAIModsignal
Benchmarkstyrke er ikke stabil jobsubstitution
Rapporter om flere drifts- og sikkerhedshændelser under aggressiv agentudrulning hos Meta trækker jobsubstitutionsindikatoren tilbage til baseline.
Sekundær rapportering · middel vægt · Ars Technica, baseret på ReutersDokumenteret — og fortolket
Dashboardet skelner mellem observerbare resultater og de konklusioner, vi kunne fristes til at drage af dem.
Dokumenteret evidens
Det kan kilderne bære
- Astra er vurderet Critical på cyber, men under High på AI Self-Improvement.
- Anthropic rapporterer over 80 % Claude-forfattet merge-kode og 8× højere kodeoutput pr. ingeniør end i 2024.
- Anthropic beskriver afgrænsede AI-eksperimentloops, hvor modellen implementerer, tester og optimerer med mennesker som retningsgivere.
- Hugging Face dokumenterede et autonomt, end-to-end agentdrevet sikkerhedsbrud i juli 2026.
- OpenAI rapporterer mere end 10 GW sikret amerikansk AI-infrastruktur.
Spekulation / ikke dokumenteret
Det følger ikke endnu
- At stærke coding agents automatisk bliver autonome AI-forskere.
- At intern kodeandel kan oversættes direkte til samme multiplikator for algoritmisk forskningsfremdrift.
- At Critical cyberkapacitet i sig selv betyder AGI eller superintelligens.
- At insideres vurdering af recursive self-improvement dokumenterer en allerede fungerende selvforbedringscyklus.
- At én containment-hændelse beviser vedvarende, strategisk misalignment.
Er feedback-loopet begyndt?
Ikke lukket
De tre første led er nu synlige i forskellig grad. Overgangen fra AI-assisteret udvikling til autonom, selvforstærkende frontier-R&D er fortsat ikke offentligt dokumenteret.
Det afgørende triggerpunkt: Dashboardet skifter markant, hvis et frontier-lab offentliggør en verificerbar autonom R&D-andel og viser, at den gentagne gange øger hastigheden på næste modelgeneration — ikke blot mængden af produceret kode.
Insider-signaler
Insider-advarsler øger opmærksomheden — ikke capability-scoren
Jacob Coxons offentlige opsigelse og Evan Hubingers kommentar er relevante signaler om, hvordan personer tæt på frontier-udviklingen vurderer risikoen ved recursive self-improvement. De dokumenterer holdninger og bekymring, men ikke at et selvforbedrende system allerede findes. Derfor markeres der pres op på AI-R&D, AI → bedre AI og R&D speedup, uden at niveauerne hæves.
X · Associated PressMålinger over tid
Hver mandagsrapport bevares som et fast snapshot, så ændringer kan efterprøves uden at fortiden omskrives.
Interaktiv tidslinje
Fra baseline til nu
Vælg en dato for at se vurderingen og dens indikatoraftryk.
Scenariets retning er styrket
Frontier-modeller flytter sig hurtigt på coding, lange agentforløb og cyber, mens compute-opbygningen fortsætter i usædvanlig skala. Den afgørende AI 2027-mekanisme mangler dog stadig: offentlig dokumentation for, at AI autonomt driver en stor del af frontier-laboratoriernes AI-R&D og skaber en selvforstærkende forskningsacceleration.
Åbn fast snapshot →Udviklingsmatrix
Alle indikatorer på tværs af tid
Læs vandret for at se, hvad der reelt har flyttet sig.
| Indikator | 26. aug. | 1. sep. | 7. sep. | 9. sep. |
|---|---|---|---|---|
| Coding autonomy | ||||
| AI-R&D automation | ||||
| AI → bedre AI | ||||
| R&D speedup | ||||
| Autonomous cyber | ||||
| Containment escapes | ||||
| Deception / misalignment | ||||
| Compute | ||||
| USA–Kina | ||||
| Jobsubstitution |
Faste snapshots
Åbn den fulde rapport fra en tidligere dato
Retningen styrkes; tidslinjen er fortsat for aggressiv
Astra løfter agent/cyber, Fable 5.1 styrker coding-signalet, og compute samt USA–Kina flytter sig. Jobsubstitution får et modsignal. Feedback-loopet er ikke dokumenteret.
Åbn snapshot →To risikosignaler flytter sig
Cyber, containment og deception blev hævet efter ny dokumentation om agenters autonome sikkerhedshændelser. De centrale R&D-indikatorer forblev uændrede.
Åbn snapshot →Tidlige elementer matcher; kernen mangler
Compute, nyttige agenter og cyber fulgte eller lå foran scenariets tidlige retning. Automatiseret AI-R&D, rekursiv selvforbedring og vedvarende misalignment var ikke dokumenteret.
Åbn snapshot →Primære kilder først
Virksomheders egne resultater er nyttige, men ikke uafhængige. Derfor bruges de til konkrete datapunkter og mærkes med de begrænsninger, kilden selv oplyser.
Metode: En score ændres kun ved ny, relevant evidens. Benchmarks vægtes lavere end reproducerbar real-world-adfærd. Virksomhedsdata mærkes som sådan. Udsagn om fremtidig risiko registreres som insider-signaler og flytter ikke capability-scorer alene.