TLDR
Gemini 4 og AlphaEvolve er separate teknologier. Google har bekræftet, at Gemini 4 er i prætræning, men har ikke offentliggjort dets modelkort, benchmarks, priser eller API-detaljer.
AlphaEvolve er allerede tilgængelig på Google Cloud. Det bruger Gemini-modeller til at generere kandidatprogrammer, evaluerer dem via automatiserede tests og søger iterativt efter bedre algoritmer. Google har ikke bekræftet, at Gemini 4 driver AlphaEvolve, eller at AlphaEvolve hjalp med at træne Gemini 4.
Key Takeaways
- AlphaEvolve gør kodegenerering til en gentagelig søgeproces baseret på eksekvering og målbar feedback. Dets offentliggjorte anvendelser omfatter Google-infrastruktur, matematik, genomik, kvanteberegning, logistik og maskinlæring.
- Gemini 4 kan forbedre kandidatskabelsen, hvis det leverer bedre koderæsonnering og værktøjsbrug, men denne forbindelse er stadig ubekræftet.
- AlphaEvolve kræver et fungerende seed-program, en pålidelig evaluator og et isoleret eksekveringsmiljø.
- Dette er begrænset algoritmeoptimering, ikke autonom rekursiv selvforbedring.
Gemini 4 + AlphaEvolve: Hvorfor overveje dem sammen?
At placere Gemini 4 og AlphaEvolve i samme diskussion kan skabe indtryk af, at Google allerede har bygget et system, der kan designe sin egen efterfølger. De tilgængelige beviser understøtter ikke den konklusion.
Google har oplyst relativt lidt om Gemini 4. Selskabet har bekræftet, at prætræning er i gang, og beskrevet den som deres mest ambitiøse prætræningskørsel til dato. Det har ikke frigivet den tekniske dokumentation, der er nødvendig for at evaluere den færdige model.
AlphaEvolve er længere fremme. Google DeepMind introducerede AlphaEvolve i maj 2025, og Google Cloud gjorde det generelt tilgængeligt i juli 2026. Det har nu offentlig udviklerdokumentation, et API-workflow og dokumenterede anvendelser.
Gemini 4 + AlphaEvolve bør derfor forstås som en mulig teknisk retning snarere end en bekræftet produktpakke. Gemini 4 repræsenterer den fortsatte udvikling af generelle modelkapabiliteter. AlphaEvolve viser, hvordan modelgenererede programmer kan testes i en målbar algoritmeforskningsproces.
Hvad Gemini 4 repræsenterer
Gemini begyndte som en multimodal modelfamilie for tekst, billeder, lyd, video og kode. Dens rolle er siden udvidet til søgning, kode-miljøer, produktivitetssoftware, browsere og cloud-tjenester.
Det relevante spørgsmål for Gemini 4 er ikke længere begrænset til svarkvalitet. Det er, om modellen kan forblive pålidelig på lange opgaver, store kodebaser, værktøjskald og gentagen feedback.
Google har bekræftet Gemini 4-prætræningskørslen, men har ikke offentliggjort modellens parameterantal, kontekstvindue, benchmarks, priser eller offentlig API-specifikation. Påstande om disse detaljer bør behandles som ubekræftede, indtil Google frigiver officiel dokumentation.
Hvad AlphaEvolve er
En almindelig kodeassistent producerer kode til en forespørgsel. AlphaEvolve søger gennem mange fungerende implementeringer for at finde en, der performer bedre ifølge målbare kriterier.
Gemini-modeller foreslår kandidatprogrammer. En evaluator tester korrekthed og ydeevne. Et evolutionært system afgør, hvilke kandidater der skal påvirke næste runde.
Dette gør AlphaEvolve velegnet til algoritmeopdagelse, matematisk søgning og kombinatorisk optimering. Det er ikke designet til rutinemæssig applikationsudvikling, linting eller kodestil-oprydning.
Deres fælles grundlag: AI træder ind i Udforsk-Verificer-Optimer-lukket sløjfe
En sprogmodel stopper normalt efter at have produceret et svar. AlphaEvolve tilføjer ekstern feedback ved at kompilere, køre og score det genererede program.
Processen gentager tre aktiviteter:
- Udforske nye algoritmer og programstrukturer.
- Verificere kandidater via eksekvering og objektive tests.
- Optimere senere kandidater ved hjælp af målte resultater.
Gemini leverer ræsonnering og kandidatskabelse. AlphaEvolve organiserer disse kapabiliteter i et eksperiment, der kan fortsætte på tværs af hundreder eller tusinder af programmer.
Fra LLM til AI-forsker: Hvor præcis sker skiftet?
AlphaEvolve vælger ikke sin egen forskningsdagsorden eller beslutter, hvilke mål der skal forfølges. Skiftet ligger i modellens position i forskningsprocessen.
I stedet for kun at forklare et problem eller skrive isoleret kode deltager modellen i at foreslå, teste og revidere løsninger. Forskere definerer stadig opgaven, konstruerer evaluatoren, fortolker resultaterne og beslutter, hvad der kommer i produktion eller en videnskabelig publikation.
I matematik erstatter beregningsmæssig evidens ikke et bevis. I chipdesign skal et usædvanligt kredsløb stadig bestå formel verifikation. I produktionssoftware skal en hurtigere implementering stadig gennemgå sikkerheds- og vedligeholdelsesreview.
Overgangen fra LLM til AI-forsker er derfor ikke en overførsel af videnskabelig autoritet. Det er bevægelsen af modeller ind i den eksperimentelle sløjfe.
Hvad vi aktuelt ved og ikke ved om Gemini 4
Der er ét nyligt signal, der er værd at holde øje med. Den 17. september 2026 postede en Gemini-bruger en side-by-side Arena-sammenligning og foreslog, at forespørgsler mærket Gemini 3.8 Flash blev dirigeret til en ny Gemini Pro-model, beskrevet i opslaget som Gemini 4 Pro.
Kilde: @TimJayas fra X
For AlphaEvolve er den mulige forbindelse direkte. Bedre koderæsonnering, planlægning og værktøjsbrug kan forbedre kvaliteten af kandidatprogrammer. Google har ikke bekræftet, at den nuværende AlphaEvolve-tjeneste bruger Gemini 4.
Det, vi med sikkerhed ved
Google har bekræftet, at Gemini 4-prætræning startede. Detaljer om Pro-checkpoints og Arena-routing kommer fra community-rapporter, ikke officiel modeldokumentation.
| Test | Rapporteret resultat | Status |
|---|---|---|
| Argon 160 | Angiveligt associeret med Gemini 3.8 Flash på Arena | Uverificeret mapping |
| Argon checkpoint | Viste en 256k outputgrænse og "High reasoning"-tilstand | Uofficielt screenshot |
| SVG-generering | Producerede en detaljeret påfugl-SVG på ca. 2.4 minutter | Output observeret; model uverificeret |
| Arena-routing | Gemini 3.8 Flash angiveligt dirigeret til et nyt Gemini Pro-checkpoint | Community-rapporteret |
| Offentlige benchmarks | Ingen reproducerbare Gemini 4-scorer er tilgængelige | Ikke offentliggjort |
Det, vi har brug for at vide
Flere detaljer er stadig udokumenterede eller ubekræftede. AlphaEvolves offentliggjorte træningsoptimeringer bør også adskilles fra påstande om dets involvering i Gemini 4.
| Spørgsmål | Status pr. 17. september 2026 |
|---|---|
| Gemini 4-prætræning startet? | Bekræftet af Google |
| Gemini 4 offentligt udgivet? | Ikke officielt dokumenteret |
| Gemini 4 modelkort? | Ikke offentliggjort |
| Gemini 4 API-specifikation? | Ikke offentliggjort |
| Gemini 4-priser? | Ikke offentliggjort |
| Driver Gemini 4 AlphaEvolve? | Ikke bekræftet |
| Har AlphaEvolve bidraget til Gemini 4? | Ikke bekræftet |
| Har AlphaEvolve forbedret AI-træning? | Bekræftet |
DeepMinds AlphaEvolve-annoncering dokumenterer forbedringer af beregninger, der bruges i Gemini-træning. Det understøtter en snævrere, etableret påstand om træningseffektivitet, ikke en bekræftet forbindelse til Gemini 4.
Hvordan AlphaEvolve virker: Algoritme-evolution og principper
AlphaEvolve kombinerer programgenerering med evolutionær søgning og automatiseret evaluering. Et fungerende program går ind i systemet, Gemini foreslår ændringer, og en evaluator måler hver kandidat. Bedre performende programmer bliver materiale til senere runder.
Evolutionær søgning
AlphaEvolve vedligeholder en database over kandidatprogrammer og deres scorer. Udvalgte programmer inkluderes i senere prompts, så Gemini kan ændre eller kombinere dem. Nye kandidater kommer ind i databasen, når de tilføjer performance eller nyttig diversitet.
Systemet bevarer ikke kun én vinder. At holde flere programfamilier reducerer risikoen for at konvergere for tidligt på et lokalt optimum. Det kan også balancere flere metrikker, herunder hastighed, hukommelsesforbrug, nøjagtighed og stabilitet.
Seed-programmer
Et seed-program er det fungerende baseline-program, der leveres til AlphaEvolve. Det skal have klare input og output, reproducerbar eksekvering, bestå test og have en målbar score.
Udviklere specificerer også, hvilken kode AlphaEvolve må ændre, så interfaces, sikkerhedstjek og fastlagt adfærd forbliver beskyttet.
Ifølge AlphaEvolve-udvikleroversigten bør startkoden allerede være funktionelt korrekt. AlphaEvolve er ikke beregnet til at omdanne en ufuldstændig naturlig sprogforespørgsel til en hel applikation.
Evaluator
Evaluatoren kompilerer, kører, tester og scorer hver kandidat. Afhængigt af opgaven kan den måle korrekthed, latenstid, hukommelsesforbrug, numerisk fejl, løsningskvalitet eller forretningsmæssige begrænsninger.
Dens design bestemmer, hvad søgningen faktisk optimerer. En evaluator, der kun fokuserer på hastighed, kan belønne unøjagtig kode, mens et ufuldstændigt testsæt kan åbne smuthuller. Pålidelige projekter bruger derfor flere tests og metrikker i stedet for ét bekvemt benchmark.
Generering af kandidatprogrammer
Gemini-modeller genererer kandidater ud fra seed-koden, problembeskrivelsen, begrænsninger, tidligere programmer, scorer og fejlrapporter. Ændringer kan være lokale eller spænde over flere sammenkoblede komponenter.
Googles oprindelige AlphaEvolve-beskrivelse brugte hurtigere Gemini-modeller til at brede udforskningen ud og mere kapable modeller til at foreslå dybere revisioner. Google har ikke bekræftet, hvilke præcise Gemini-versioner der driver den nuværende tjeneste.
Eksekvering og filtrering
Kandidater gennemgår først parsing, kompilering og korrekthedstjek. Gyldige programmer går videre til performanceevaluering. Højtscorende resultater kan sås ind i senere runder, mens fejl giver signaler om tilgange, der bør undgås.
Google Cloud tillader, at evaluatoren kører i en kundes eget miljø. Dette understøtter proprietær kode, private data, specialiseret hardware og højtydende beregningssystemer.
Et højtscorende program bør stadig gennemgå kodereview, sikkerhedstest, trinvis udrulning og rollback-planlægning.
AlphaEvolve vs. almindelig kodegenerering
Almindelig kodegenerering hjælper med at gennemføre udviklingsopgaver. AlphaEvolve leder efter en bedre implementering blandt mange gyldige muligheder.
En kodeassistent kan starte fra en skriftlig forespørgsel og producere nogle få outputs til menneskelig gennemgang. AlphaEvolve starter normalt fra fungerende kode og er afhængig af en evaluator til at behandle mange kandidater.
De to tilgange kan kombineres. En kodeassistent kan hjælpe med at opbygge baseline, mens AlphaEvolve optimerer udvalgte komponenter efter, at tests og benchmarks er på plads.
Hvilke offentlige resultater har AlphaEvolve allerede leveret?
Googles offentliggjorte eksempler dækker infrastruktur, videnskab og kommercielle udrulninger. Tallene nedenfor stammer primært fra Google DeepMind, Google Cloud og deltagende organisationer.
Hvert projekt brugte forskellig hardware, datasæt, baselines og søgebudgetter. Procenterne bør ikke behandles som direkte sammenlignelige benchmark-scorer.
Google-beregningsinfrastruktur
AlphaEvolve fandt en Borg-planlægningsheuristik, som Google siger genvinder i gennemsnit ca. 0,7% af deres globale beregningsressourcer.
Det accelererede også en matrixmultiplikationskerne, der bruges i Gemini, med 23%, hvilket reducerede den samlede træningstid med ca. 1%. Andre rapporterede resultater omfatter:
- Op til 32,5% hastighedsforøgelse for en FlashAttention-implementering
- Et kredsløb indarbejdet i et senere TPU-design
- 20% reduktion i Google Spanner write amplification
- Kompilatoridéer, der reducerede softwarelageraftryk med næsten 9%
Disse eksempler viser, at AlphaEvolve bevæger sig ud over applikationskode til planlægning, lager, kompilatorer, GPU-kerner og chipdesign.
Matematik og videnskabelig forskning
For 4 × 4 komplekse matricer fandt AlphaEvolve en algoritme, der bruger 48 skalarmultiplikationer.
På tværs af eksperimenter, der dækker mere end 50 matematiske problemer, rapporterede Google, at AlphaEvolve genopdagede state-of-the-art-resultater i ca. 75% af tilfældene og forbedrede det bedste kendte resultat i ca. 20%.
Googles 2026 AlphaEvolve-impactrapport beskriver også:
- 30% reduktion i varianthandlingsfejl for DeepConsensus
- En stigning i mulige løsninger for en AC Optimal Power Flow-model fra 14% til mere end 88%
- 5% forbedring i samlet nøjagtighed for naturkatastrofeprognoser
- Kvantekredsløb med ti gange lavere fejl end konventionelt optimerede baselines
AlphaEvolve har også bidraget med beregningsmæssige resultater for Erdős-problemer, Traveling Salesman-problemet, Ramsey-tal og 11-dimensionelt kissing number-problem.
Disse resultater kan understøtte videnskabelig forskning, men beregningsmæssige opdagelser kræver stadig domænegennemgang og, hvor det er relevant, matematisk bevis.
Enterprise-anvendelser
Kommercielle udrulninger anvender den samme metode på modne systemer:
- Klarna rapporterede fordoblet træningsgennemløb samtidig med forbedret modelkvalitet efter at have udforsket næsten 6.000 kandidatprogrammer.
- FM Logistic forbedrede lager-routing med 10,4% og reducerede årligt personalets gangdistance med mere end 15.000 kilometer.
- JetBrains rapporterede gevinster på ca. 15% til 20% for udvalgte IDE-algoritmer.
- Kinaxis forbedrede centrale prognosemetrikker med mere end 22% og reducerede benchmark-køretid med over 90%.
- Schrödinger opnåede cirka en firedobling af hastigheden i træning og inferens for maskinlærte kraftfelter.
- WPP rapporterede nøjagtighedsgevinster på omtrent 5% til 10% på tværs af reklameanvendelser.
AlphaEvolve byggede ikke disse systemer fra bunden. Hver organisation leverede fungerende software, domæneekspertise og en målbar evalueringsproces.
Hvordan Gemini 4 og AlphaEvolve kunne arbejde sammen
Google har ikke bekræftet, at Gemini 4 driver AlphaEvolve, eller at AlphaEvolve bidrog direkte til Gemini 4. Arbejdsgangen nedenfor er en fremskrivning baseret på AlphaEvolves offentliggjorte design, ikke en annonceret Google-integration.
Trin 1: Gemini forstår problemet og genererer kandidatløsninger
Gemini kan analysere seed-kode, opgavebegrænsninger, testresultater og tidligere kandidater, før det foreslår ændringer til algoritmer, datastrukturer, hukommelsesadgang eller modelkomponenter.
Hvis Gemini 4 forbedrer kodebaseforståelse og langvarig værktøjsbrug, kan det hæve kvaliteten af AlphaEvolve-kandidater. Foreslåede ændringer vil stadig kræve ekstern testning.
Trin 2: AlphaEvolve håndterer udforskning og iteration
AlphaEvolve styrer, hvilke historiske programmer der påvirker nye kandidater, og hvor meget diversitet der forbliver i søgningen. Det balancerer fortsat udforskning med dybere arbejde på lovende grene.
Bedre modelræsonnering kan forbedre individuelle forslag, men den evolutionære proces forbliver nødvendig, fordi plausibel kode ikke altid er hurtigere eller korrekt.
Trin 3: Automatiserede evaluatorer filtrerer effektive løsninger
Evaluatoren leverer evidens fra reel eksekvering. For modeludviklingsopgaver kan den måle:
- Træningsgennemløb
- Inferenslatens
- Hukommelsesforbrug
- Modelkvalitet
- Stabilitet
- Hardwareudnyttelse
- Reproducerbarhed
Dyre opgaver kan bruge flere evalueringsstadier. Billige tests fjerner først ugyldige kandidater, mens stærkere kandidater går videre til længere kørsler eller større benchmarksuiter.
Trin 4: Vellykkede løsninger returneres til modellen for fortsat optimering
Højtydende programmer returneres til senere prompts sammen med deres scorer og mutationshistorik.
Løkken bliver:
Generate → Execute → Evaluate → Select → Generate Again
Dette er kontinuerlig optimering inden for menneskedefinerede rammer. Om Google vil bruge det til at designe Gemini-arkitekturer, træningsmetoder eller datapipelines, er stadig et åbent spørgsmål.
Anvendelige scenarier og begrænsninger for AlphaEvolve
AlphaEvolve fungerer bedst, når opgaven kan udtrykkes i kode, kandidater kan eksekveres automatisk, og resultater kan måles pålideligt.
Egnede opgaver
Gode kandidater inkluderer:
- GPU-kerner og numeriske algoritmer
- Kompilatorstrategier og cachepolitikker
- Klyngeplanlægning og databaseheuristikker
- Logistik og ruteplanlægning
- Chipdesign og elnetoptimering
- Matematisk søgning
- Udvalgte maskinlæringskomponenter
Et egnet projekt har typisk en fungerende baseline, pålidelig evaluator, kvantificerbare mål, stort søgerum, isoleret eksekveringsmiljø og tilstrækkelig compute til at teste mange kandidater.
Uegnede opgaver
AlphaEvolve passer dårligt til projekter, der kun har et verbalt krav og intet fungerende program.
Rutinemæssig formatering, dokumentation, ordinær refaktorering og subjektive designbeslutninger giver også begrænset værdi for evolutionær søgning.
Eksisterende eksakte løsere kan fortsat være bedre til standard lineær eller konveks optimering. Projekter, der ikke kan eksekvere genereret kode sikkert, bør ikke bruge en automatiseret kandidatløkke uden først at opbygge et begrænset miljø.
Begrænsninger og forventede flaskehalse
Evalueringsomkostning er den første begrænsning. En lille algoritme kan tage sekunder at teste, mens modeltræning eller videnskabelig simulering kan tage timer. Store søgninger kan blive dyrere end manuel optimering.
Måldesign er en anden begrænsning. Systemet vil forfølge det, evaluatoren måler, inklusive utilsigtede smuthuller. Hardwarenoise, tilfældige seeds og caching kan også gøre små gevinster upålidelige.
Vedligeholdelighed og sikkerhed forbliver menneskelige ansvar. Automatisk opdaget kode kan være svær at forstå eller bundet til én hardwareplatform. Kandidatprogrammer bør køre med begrænset netværks-, lager-, tids- og compute-adgang.
Hvad betyder Gemini 4 og AlphaEvolve for almindelige udviklere?
De fleste udviklere vil ikke bruge AlphaEvolve til hver feature. Websites, mobilapplikationer, API’er og interne værktøjer er fortsat bedre egnet til almindelige kodeassistenter og etablerede testworkflows.
Den umiddelbare effekt vil være større i performance engineering, algoritmedesign og maskinlæring. Udviklere kan bruge mindre tid på manuelt at teste én optimering ad gangen og mere tid på at opbygge miljøer, der kan evaluere mange alternativer.
Relevante færdigheder omfatter:
- At skrive reproducerbare benchmarks
- At designe evaluatorer for korrekthed og performance
- At definere sikre kodegrænser
- At spore eksperimenthistorikker
- At gennemgå genereret kode for sikkerhed og vedligeholdelighed
- At planlægge trinvis udrulning og rollback
Programmeringskundskab forbliver nødvendig. Udviklere skal stadig opdage benchmarkudnyttelse, udefineret adfærd, numerisk ustabilitet og hardwarespecifikke antagelser.
Hvad CometAPI-læsere bør være opmærksomme på
For CometAPI brugere er modeladgang kun ét lag i et AlphaEvolve-lignende system. Resten af stacken omfatter kodeeksekvering, evaluering, eksperimentsporing, sikkerhedskontroller og omkostningsstyring.
Teams bør registrere:
- Den nøjagtige modelversion og genereringsindstillinger
- Prompter og kandidatprogrammer
- Evaluator- og testdataversioner
- Eksekveringsmiljøer
- Scorer og fejlsårsager
- Model- og compute-omkostninger
Genereret kode bør køre i isolerede containere uden produktionslegitimationsoplysninger. Netværksadgang, filadgang, eksekveringstid og compute-forbrug bør begrænses.
Når Gemini 4 modtager et offentligt API, bør udviklere verificere dets officielle model-id, priser, grænser og CometAPI-tilgængelighed. Produktionskode bør ikke afhænge af navne eller specifikationer fra ubekræftede rapporter.
Fremtidige observationsparametre for Gemini 4 og AlphaEvolve
Flere offentliggørelser vil afklare, om Gemini 4 og AlphaEvolve er ved at blive en reel kombineret workflow:
- Et officielt Gemini 4-modelkort og API-specifikation
- Bekræftelse af hvilke Gemini-modeller der driver AlphaEvolve
- Evidens for, at AlphaEvolve bidrog til en leveret Gemini-komponent
- Offentlige detaljer om kandidatantal, søgebudgetter og fejlede kørsler
- Uafhængig reproduktion uden for Google og dets partnere
- Omkostningssammenligninger, der dækker modelkald, eksekvering, gennemgang og vedligeholdelse
Det klareste bevis ville være en dokumenteret forbedring foreslået af en Gemini-model, valideret via AlphaEvolve og indarbejdet i en senere Gemini-udgivelse.
Indtil da beskrives selvforbedring mere præcist som begrænset ingeniørautomatisering.
FAQ
Er Gemini 4 blevet udgivet?
Ikke officielt. Pr. 17. september 2026 ser Gemini 4.0 ud til stille at være dukket op på Arena. En community-rapport antyder, at forespørgsler mærket Gemini 3.8 Flash kan blive dirigeret til en ny Gemini Pro-model inden for Arena.
Det bør behandles som en mulig før-udgivelsestest snarere end en officiel Gemini 4-lancering.
Hvad er AlphaEvolve?
AlphaEvolve er en agent til algoritmeopdagelse og kodeoptimering udviklet af Google DeepMind. Gemini-modeller genererer kandidatprogrammer, evaluatorer eksekverer og scorer dem, og evolutionær søgning bruger resultaterne til at guide senere kandidater.
Er AlphaEvolve generelt tilgængelig?
Google Cloud annoncerede generel tilgængelighed i juli 2026. Adgangsbetingelser, regioner, kvoter og priser bør tjekkes i den aktuelle Google Cloud-dokumentation.
Bruger AlphaEvolve Gemini 4?
Google har ikke offentligt bekræftet, at AlphaEvolve bruger Gemini 4. Det oprindelige system brugte Gemini-familie-modeller, men det identificerer ikke modellerne bag den nuværende tjeneste.
Hvordan adskiller AlphaEvolve sig fra en kodeassistent?
En kodeassistent genererer eller ændrer kode som svar på en forespørgsel. AlphaEvolve starter fra et fungerende program og kører gentagne eksperimenter for at finde implementeringer med bedre målbar performance.
Hvilke typer kode kan AlphaEvolve optimere?
Offentliggjorte anvendelser omfatter GPU-kerner, CPU-algoritmer, kompilatorstrategier, cachepolitikker, planlægningssystemer, databaseheuristikker, rutealgoritmer, modelkomponenter, numeriske metoder og hardwarekredsløb.
Kan almindelige udviklere bruge AlphaEvolve?
Udviklere kan undersøge adgangen gennem Google Cloud, med forbehold for aktuelle konto- og tilgængelighedskrav. Systemet er mest nyttigt for projekter med en fungerende baseline, en pålidelig evaluator og nok compute til gentagne tests.
Kan Gemini 4 tilgås via CometAPI?
Det bør verificeres, efter at Gemini 4 modtager en officiel API-udgivelse og vises i CometAPIs dokumentation over understøttede modeller. Udviklere bør ikke antage et model-id, en pris eller en udgivelsesdato baseret på tredjepartsrapportering.
