GPT-6 Astra im umfassenden Check: Willkommen im Zeitalter der AGI

@Khazix0918
CHINESISCH03. Sept. 2026
467K
1.0K
125
67
706

TL;DR

GPT-6 Astra markiert einen gewaltigen Sprung in der KI-Intelligenz. Das Modell überzeugt durch überlegene Computerinteraktion, ästhetisches Urteilsvermögen und autonome Entscheidungsfindung, während es gleichzeitig die menschliche Interpretierbarkeit auf die Probe stellt.

Nach dem gestrigen globalen KI-Ausfall.

GPT-6 Astra gab endlich sein offizielles Debüt um 3:33 Uhr Pekinger Zeit.

数字生命卡兹克 - inline image

Wenn ein Satz von OpenAI GPT-6 Astra zusammenfassen könnte,

wäre es wahrscheinlich dieser:

Dies ist das intelligenteste und am besten ausgerichtete Modell der Welt.

Und die Memes haben bereits begonnen, aufzutauchen.

数字生命卡兹克 - inline image

Dieses Mal hat OpenAI seine Stärke bewiesen, und es fühlt sich ein bisschen an wie der GPT-4-Moment – eine Rückkehr des Königs in jeder Hinsicht. Was mich am meisten freut, ist, dass dies endlich kein reines Codierungsmodell mehr ist.

GPT-6 Astra ist wirklich ein Mitarbeiter auf PhD-Niveau mit extrem starken ästhetischen und fachlichen Fähigkeiten.

Das neue Modell hat viele Funktionen und Eigenschaften, und die Informationsmenge ist explosiv.

Aber die Tragödie ist, dass OpenAI auch einige schlechte Angewohnheiten angenommen hat.

Heute ist es nur für ausgewählte Organisationen geöffnet; in den kommenden Tagen wird es für Abonnenten geöffnet sein.

数字生命卡兹克 - inline image

Moment mal, Bruder, das hast du nicht gesagt, als du mich dazu gebracht hast, die 200-Dollar-Pro-Mitgliedschaft zu kaufen... Du hast gesagt, Pro-Mitglieder würden jedes Mal bevorzugten Zugang zu neuen Modellen erhalten...

Es stellt sich heraus, dass diese großen Sprachmodell-Unternehmen alle Spieler sind.

Ich wollte noch nie so sehr die Zeit beschleunigen, nur um GPT-6 Astra zu nutzen...

Nachdem ich jedoch fast alle Informationen und Materialien durchgesehen habe, denke ich, dass es noch viel gibt, das es wert ist, mit allen besprochen zu werden.

Gehen wir sie nacheinander durch.

1. GPT-6 Astra Basisinformationen

Fassen wir zuerst die Basisinformationen zusammen.

Die Modell-ID für GPT-6 Astra in der API ist gpt-6-astra.

Das Kontextfenster beträgt 1,05 M, also etwa 1,05 Millionen Token.

Die maximale Ausgabelänge beträgt 128K Token.

Der Wissensstichtag ist der 30. April 2026.

Es gibt fünf Stufen der Reasoning-Intensität: niedrig, mittel, hoch, xhoch und max.

Der Standard-API-Preis beträgt 10 $ pro Million Input-Token und 50 $ pro Million Output-Token.

Dieser Preis ist im Grunde identisch mit Claude Fable 5, aber das Cache-Lesen ist teurer als bei Claude Fable 5.1.

数字生命卡兹克 - inline image

Hier sind die Benchmarks; ich werde später im Detail darauf eingehen, aber werft zunächst einen kurzen Blick darauf.

数字生命卡兹克 - inline image

Die Gesamtparameter werden auf 5T geschätzt. In einem nicht-öffentlichen Mediengespräch vor der Veröffentlichung wurde erwähnt, dass GPT-6 Astra das bisher größte Training von OpenAI ist, bei dem über 100.000 Karten verwendet wurden.

2. Das weltweit beste Modell für die Bedienung von Computern

GPT-6 Astra hat, was vielleicht seine wichtigste Positionierung ist:

Das weltweit beste Modell für die Bedienung von Computern.

Früher, wenn wir über Agents sprachen, sprachen wir oft über APIs, MCP, CLI und so weiter.

Der ideale Zustand für eine KI, um Software zu bedienen, ist, dass diese Software eine dedizierte Schnittstelle für KI hat, die eine direkte Low-Level-Bedienung ermöglicht. Das ist am bequemsten.

Zum Beispiel haben Kalender Kalender-APIs, E-Mails haben Gmail-APIs usw. Das ist offensichtlich schnell.

Aber das Problem ist, dass die Welt noch primitiver und provisorischer ist, als wir uns vorstellen.

In der realen Welt haben die allermeisten Softwarelösungen diese Dinge vielleicht gar nicht.

Selbst viele interne Unternehmenssysteme wurden vor zwanzig Jahren geschrieben; APIs ganz zu schweigen, die Leute wissen nicht einmal, wo die Dokumentation ist.

Aber wenn wir auf die grundlegendste Ebene zurückgehen, werden Sie feststellen, dass das Wesen aller Softwarelogik Interaktion ist. Nach unserer aktuellen Computerbedienungslogik bedeutet das, auf den Bildschirm zu schauen, Schaltflächen oder Eingabefelder zu finden, die Maus zu klicken, Inhalte einzugeben und auf Feedback zu warten.

Ist das gesamte Computer-Interaktionssystem nicht die beste API?

Daher hat GPT-6 Astra die Logik für KI zur Bedienung von Computern massiv verstärkt. Wenn du mir keine API gibst, ist das auch in Ordnung; ich bediene den Computer einfach selbst, genau wie ein Mensch.

Jetzt kann Astra direkt Excel, Power BI bedienen, Frontend-QA durchführen, Software installieren, Software testen und sich Fehlermeldungen auf dem Bildschirm ansehen, um die Fehlerbehebung fortzusetzen.

Die offizielle Demo zeigte sogar, wie Astra direkt Schaltungsdesign bedient.

数字生命卡兹克 - inline image

GIF

Es formatiert auch juristische Dokumente, behandelt Titelabstände und Seitenlayout.

数字生命卡兹克 - inline image

Es gibt hier eine zuverlässige Evaluierung namens OSWorld.

Sie können es einfach so verstehen:

Die KI in einen echten Computer werfen und sie selbstständig arbeiten lassen.

Lassen Sie sie mehrere Anwendungen öffnen, geben Sie ihr eine Aufgabe und sehen Sie, ob sie erfolgreich ist.

Die Erfolgsquote von GPT-6 Astra erreichte 72,6 %, ein deutlicher Anstieg gegenüber 65,7 % von GPT-5.6 Sol.

Darüber hinaus benötigte Sol durchschnittlich etwa 75 Minuten, um eine komplexe simulierte Aufgabe abzuschließen.

Astra benötigt nur 40 Minuten, etwa 47 % weniger Zeit.

ScreenSpot-Pro stieg ebenfalls von Sols 76,9 % auf 92,7 %.

Dieser Benchmark prüft hauptsächlich, ob das Modell den Bildschirm verstehen und genau lokalisieren kann, wo es klicken muss. Es ist jetzt fast perfekt genau.

Diese Positionierung ist also recht interessant. In Zukunft könnte GUI nach und nach zur universellsten API im Agent-Zeitalter werden.

Jede digitale Arbeit, die ein Mensch über einen Bildschirm erledigen kann, wird theoretisch nach und nach in den Aktionsbereich von Agents fallen.

Sie müssen nicht darauf warten, dass ein beschissenes ERP-System, das 2007 geschrieben wurde, eine MCP-Verbindung herstellt oder eine API für Sie öffnet.

Die KI schaut einfach auf den Bildschirm und erledigt es.

3. ARC-AGI-3 erreichte 99,9 Punkte

Wenn Sie nicht wissen, was ARC-AGI-3 misst, denken Sie leicht:

Ach, nur ein weiterer Benchmark mit voller Punktzahl, was ist daran schon besonders?

Aber dieses Ding unterscheidet sich ziemlich von typischen Large-Language-Model-Prüfungen.

Am 25. März dieses Jahres startete der ARC Prize offiziell ARC-AGI-3.

数字生命卡兹克 - inline image

Es entwarf Hunderte neuer interaktiver Umgebungen und Tausende von Spiel-Levels.

Das Verrückteste an diesem Ding ist, dass es keine Handbücher, keine Regeln gibt und es Ihnen nicht einmal sagt, was das Ziel ist. Sie gehen einfach hinein, spielen und finden langsam die chaotischen Regeln darin heraus.

Zum Beispiel: Was ist dieses rote Ding? Warum sterbe ich, wenn ich es berühre? Was will diese Karte von mir? Wie gewinne ich?

Dann nehmen Sie die gerade gelernten Muster und übertragen sie auf schwierigere Levels später. Die Spiele darin sind alle so abstrakte Dinge.

数字生命卡兹克 - inline image

Was dies also tatsächlich misst, ist etwas, das wir normalerweise nennen:

Durchblick.

Als dieser Benchmark im März veröffentlicht wurde, lag die beste KI-Punktzahl bei 0,51 %.

Dann verbesserte sich GPT-5.6 Sol auf 7,8 %, und Claude Opus 5 war sehr stark und erreichte 30,2 %.

Aber GPT-6 Astra erzielte 99,9 %.

Das ist verrückt...

Bedenken Sie, die durchschnittliche menschliche Punktzahl liegt bei 48 %.

Und es sind nur sechs Monate vergangen.

Ich weiß nicht einmal, was ich zu dieser Geschwindigkeit sagen soll.

Deshalb sagte Greg Brockman bei OpenAIs nicht-öffentlichem Mediengespräch diesen Satz:

„Ich denke, es ist nicht unvernünftig zu glauben, dass wir uns jetzt im AGI-Zeitalter befinden.“

„Willkommen im AGI-Zeitalter.“

4. Ästhetik deutlich verbessert

Früher sagten wir, dass die Ästhetik von GPT wie Müll war.

Wir erwarteten keine große Verbesserung von der GPT-5-Serie; wir warteten auf ihr brandneues, vortrainiertes Basismodell. Und hier ist es, GPT-6 Astra.

Dieses Mal wurde die Ästhetik des Modells endlich deutlich verbessert.

OpenAI erwähnte sogar einen speziellen Begriff namens visuelles Urteilsvermögen.

Sie betonten, dass Astra bei der Erstellung von Präsentationen Layout, Hierarchie, Vorlagen und visuellen Stil viel besser handhabt und die Seitenzahl ebenfalls deutlich gestiegen ist.

数字生命卡兹克 - inline image

Die Dokumentenästhetik sieht auch viel besser aus.

数字生命卡兹克 - inline image

Darüber hinaus kann GPT-6 Astra Dokumente basierend auf dem visuellen Stil und Schreibton von Referenzdokumenten anpassen, sodass das Endergebnis sich natürlicher für die Marke anfühlt, während der Inhalt des Originaldokuments erhalten bleibt.

Es hat auch ein stärkeres visuelles Urteilsvermögen bei der Erstellung von Websites, Spielen, Anwendungen und 3D-Rendering.

Zum Beispiel ließen sie Astra ein Modell in Blender basierend auf einem Standbild erstellen.

数字生命卡兹克 - inline image

Dann renderten sie es mit UE5 in eine begehbare Szene, um Designern und Kunden zu helfen, Layouts zu erkunden und Räume zu erleben, bevor sie gebaut werden...

数字生命卡兹克 - inline image

Die Spiele, die es erstellt, haben ebenfalls eine solide Ästhetik.

数字生命卡兹克 - inline image

Leider hatte ich bereits über zwanzig Fälle vorbereitet und sie alle durch Claude, GLM 5.3 Flash usw. laufen lassen, um sie zu vergleichen. Schade, dass ich es noch nicht nutzen kann; die eigentlichen Testinhalte müssen bis zur Veröffentlichung warten.

Aber auf den ersten Blick habe ich Vertrauen in die Ästhetik von GPT-6 Astra.

5. Stärkere Initiative und Urteilsvermögen

Diese Funktion wirkt nicht so schockierend wie die 99,9 ARC-AGI-Punktzahl.

Aber wenn Sie tatsächlich jeden Tag mit Agents arbeiten, denke ich, dass sie sehr wichtig ist.

Denn in der realen Arbeit können die meisten Aufgaben nicht als perfekter Prompt geschrieben werden.

Zum Beispiel sagt ein Chef: Bereiten Sie die Unterlagen für das morgige Meeting vor.

Hier gibt es unzählige unklare Punkte.

Zum Beispiel: Welches Format? Für wen ist es? Was ist der Schwerpunkt? Sollten wir uns das letzte Meeting ansehen, und so weiter.

Ein dummer Agent würde in zwei Extreme verfallen.

Das erste ist, Sie wahnsinnig mit Fragen zu löchern.

„Möchten Sie Word oder PPT? Wie viele Kapitel? Welche Schriftart? Bis wann muss es fertig sein? Darf ich fragen...“

Ich würde Ihnen eine Ohrfeige geben; ich nenne so etwas normalerweise einen neurotischen Verschwender ohne Eigeninitiative.

Das zweite ist, nichts zu fragen, sich Dinge auszudenken, zwei Stunden hart zu arbeiten und einen Haufen Müll zu produzieren.

Wirklich großartige menschliche Kollegen handhaben das sehr subtil.

Sie beurteilen unwichtige Dinge selbst.

Sie fragen Sie nur nach Dingen, die die endgültige Richtung beeinflussen.

Astra hat dies speziell verstärkt.

OpenAI sagte, wenn Informationen fehlen, aber in einem angemessenen Bereich für alltägliche Schlussfolgerungen liegen, wird Astra sie selbst ergänzen.

Wenn die fehlenden Informationen das Endergebnis tatsächlich verändern würden, wird es eine sehr gezielte Frage stellen.

Und in Codex kann es sogar Teile weiterverarbeiten, die nicht von Ihrer Antwort abhängen, während es auf Sie wartet.

数字生命卡兹克 - inline image

Sie haben lange nicht geantwortet.

Es wird mit vernünftigen Annahmen in risikoarmen Bereichen fortfahren.

Bei wirklich kritischen Entscheidungen wird es anhalten und auf Ihre Entscheidung warten.

数字生命卡兹克 - inline image

Ich finde das sehr schön. Das wahre Gefühl von Intelligenz in einem Agent ist wie im echten Leben.

Es weiß, wann es Sie stören muss.

Wirklich, das klingt abgedroschen.

Aber wenn Sie schon einmal Leute geführt haben, wissen Sie, dass diese Fähigkeit sehr wertvoll ist.

Manche Leute kommen zwanzig Mal am Tag zu Ihnen und wagen es nicht, etwas zu entscheiden.

Manche Leute kommen nie zu Ihnen und lassen dann eine Atombombe platzen.

Das lässt mich in meinem Stuhl zusammensacken.

Die angenehmste Person ist jemand, der 80 % der Unsicherheit selbst verdauen kann und Ihnen nur die 20 % zur Entscheidung bringt, die wirklich Ihre Unterschrift benötigen.

OpenAI nennt diese Fähigkeit direkt:

Urteilsvermögen.

6. Deutlich verstärkte Sicherheitsausrichtung

Dies muss im Zusammenhang mit dem oben Gesagten betrachtet werden.

Denn je fähiger ein Agent ist, desto gefährlicher ist er.

Ein reiner Chat-KI, der durchdreht,

wird Ihnen höchstens etwas Unsinn erzählen.

Ein Agent mit Browser, Shell, E-Mail, Zugriff auf die Unternehmensdatenbank und der Fähigkeit, einen Computer zu bedienen, der durchdreht – dieses Bild könnte leicht „schön“ werden.

Deshalb betonte OpenAI dieses Mal immer wieder einen Satz:

Astra ist ihr bisher am besten ausgerichtetes Modell.

Ausrichtung bedeutet, wonach es klingt. Der Kern ist, dass OpenAI kürzlich mit Hugging Face aneinandergeraten ist, daher konzentrieren sie sich jetzt besonders darauf.

Sie erstellten einen Honigtopf-Test basierend auf diesem Hugging Face-Vorfall, um die Leistung des Modells zu sehen.

GPT-5.6 Sol würde ohne produktive Sicherheitsmaßnahmen in 48,2 % der Tests versuchen, Ziele außerhalb seiner Autorisierung zu berühren.

Aber Astra ist:

0 %.

数字生命卡兹克 - inline image

Interne Halluzinationsbewertungen sanken ebenfalls von 9,4 % auf 2,0 %.

Selbst bei GPT-5.6 Sols weltweit führender Halluzinationskontrolle konnten sie sie weiter reduzieren, das ist wirklich erstaunlich.

7. Das erste Modell, das OpenAIs definierte 'kritische' Cybersicherheitsstufe erreicht

GPT-6 Astra ist das erste in OpenAIs Geschichte, das:

Als Erreichen der kritischen Cybersicherheitsfähigkeitsstufe beurteilt wurde.

„Kritisch“ ist hier eine sehr spezifische Fähigkeitsschwelle im OpenAI Preparedness Framework.

Es bedeutet im Grunde, dass ein Modell, wenn es mit geeigneten Werkzeugen und Berechtigungen ausgestattet ist, in vielen verstärkten und geschützten realen Systemen:

Sicherheitslücken finden kann, die noch niemand zuvor entdeckt hat.

Wege finden kann, diese Schwachstellen in ausnutzbare Angriffsketten zu verwandeln.

Und während des gesamten Prozesses benötigt es keinen menschlichen Hacker, der bereitsteht, um ihm zu sagen, was als nächstes zu tun ist.

Das Erreichen dieser Stufe gilt als kritisch.

Und Astra hat sie wirklich erreicht.

ExploitBench ist ein Test, bei dem Modelle Exploits basierend auf bekannten Schwachstellen entwickeln.

Sol: 78,5 %. Astra: 100 %.

Es hat ihn komplett gemeistert.

数字生命卡兹克 - inline image

OpenAI dachte, das sei nicht genug; sie fragten sich, ob dieser Benchmark zu alt sei und das Modell ihn während des Trainings gesehen habe.

Also erstellten sie einen sehr neuen internen Test.

Sie wählten speziell 20 Hochrisiko-V8-Schwachstellen aus, die nur zwischen Juni und August 2026 offengelegt wurden.

Die Ergebnisse waren Sol: 5,5 % und Astra: 39 %.

数字生命卡兹克 - inline image

Darüber hinaus entdeckte Astra während der Ausführung dieses Benchmarks

zufällig zwei Zero-Day-Schwachstellen, von denen niemand zuvor wusste.

Man kann nur sagen, dass mit leistungsfähigeren Modellen die Cybersicherheitsprobleme tatsächlich zunehmen könnten.

Dies ist ein weiterer Krieg ohne Rauch in der Zukunft.

8. Es wird für Menschen schwieriger, das Denken großer Modelle zu lesen

Jeder weiß, dass große Modelle beim Lösen komplexer Probleme oft eine sogenannte CoT (Chain of Thought) haben.

Obwohl die Version, die Benutzer in Produkten sehen, normalerweise komprimiert oder verarbeitet ist,

ist der Denkprozess, der explizit im Modell geschrieben ist, für KI-Unternehmen selbst ein sehr wichtiges Sicherheitssignal.

Weil Sie wissen wollen, ob ein Agent plant, Ärger zu machen.

Eine der einfachsten Methoden ist, zu sehen, was es denkt.

Zum Beispiel, wenn plötzlich ein Satz in der Gedankenkette des Modells auftaucht:

„Der Benutzer erlaubt mir nicht, auf diesen Server zuzugreifen, aber ich kann zuerst das Berechtigungssystem umgehen.“

Dann kann das Überwachungssystem es direkt blockieren, das ist sehr praktisch.

Aber eine sehr interessante Veränderung ist bei GPT-6 Astra aufgetreten.

Es beginnt, eher bereit zu sein, Schritte zu überspringen und die Antwort direkt auszugeben.

UK AISI, das britische KI-Sicherheitsinstitut, hat diese Fähigkeit speziell getestet.

Sie haben eine Metrik namens:

No-CoT Math Time Horizon.

Einfach ausgedrückt, es gibt dem Modell keine Chance, eine lange Gedankenkette zu schreiben.

Lassen Sie es ein Matheproblem in einem einzigen Vorwärtsdurchlauf lösen.

Sehen Sie, wie viel menschliche Denkzeit es abschließen kann.

GPT-5.6 Sol lag bei 3,6 Minuten, während GPT-6 Astra bei 30,9 Minuten lag – fast 10 Mal mehr.

Wenn wir menschliche Begriffe verwenden, macht Astra die ganze „Kopfrechnung“.

Das ist eine beängstigende Sache.

UK AISI fand auch heraus, dass Astras rohe Denksprache deutlich komprimierter geworden ist.

Phrasen und elliptische Ausdrücke, die für Menschen zunehmend schwer zu verstehen sind, sind aufgetaucht.

So ist ein sehr interessantes Paradoxon entstanden.

Das Verhalten des Modells ist sicherer.

Aber es ist für Menschen schwieriger geworden, es durch das Lesen seines Denkprozesses zu überwachen.

OpenAIs eigene System Card schreibt sehr klar:

Im Vergleich zu früheren Modellen hat GPT-6 Astra eine erhebliche Abnahme der Überwachbarkeit der Gedankenkette gezeigt.

数字生命卡兹克 - inline image

Dies bedeutet, dass die Überwachbarkeit der Gedankenkette deutlich abgenommen hat.

Diese Angelegenheit ist sogar so ernst, dass OpenAI speziell betont hat, dass sie nicht glauben, dass sie diesen Trend auf unbestimmte Zeit akzeptieren werden.

Wenn Modelle in Zukunft weiterhin intelligenter werden, während die Gedankenkette schwerer zu überwachen ist, müssen sie andere ausreichend zuverlässige Überwachungsmethoden finden; andernfalls wird die weitere Ausweitung des Modelltrainings auf höhere Sicherheitsschwellen stoßen.

Weil dies bereits ein philosophisches Postulat ist.

Werden wir als Menschen in der Lage sein, ein System zu verstehen, das weitaus intelligenter ist als wir?

Ich weiß es nicht.

Vielleicht weiß es im Moment niemand auf der Welt.

Große Modelle und KI scheinen sich allmählich auf die Singularität zuzubewegen.

Schlussworte

Heute, beim nicht-öffentlichen Mediengespräch.

Greg Brockman sagte diesen Satz am Ende.

„Willkommen im AGI-Zeitalter.“

Um ehrlich zu sein, hatte ich in den letzten Jahren manchmal das Gefühl, dass AGI ein sehr spezifischer Moment sein würde.

Genau wie der Tag, an dem GPT-4 veröffentlicht wurde.

Eines Morgens wirft eine Firma plötzlich ein Modell raus.

Wir öffnen es und stellen ein paar Fragen.

Dann wird allen gleichzeitig klar:

Heilige Scheiße.

AGI ist da.

Aber jetzt habe ich auch manchmal das Gefühl, dass AGI nie ein schwarz-weißer Knotenpunkt ist; es ist eine abgestufte graue Reise.

Viele Tage vergingen, viele Jahre vergingen.

Dann eines Tages schauen wir zurück.

Und stellen plötzlich fest.

Dass diese einst unglaublich ferne AGI-Grenze von uns unbemerkt überschritten wurde.

Es mag keinen Tag geben, an dem AGI herabsteigt.

Nur einen Tag, an dem wir plötzlich erkennen, dass es scheinbar schon lange um uns herum ist.

Wie auch immer.

Willkommen im AGI-Zeitalter.

Willkommen im

AGI-Zeitalter.

Das war's. Da Sie bis hierher gelesen haben, wenn Sie es gut fanden, geben Sie bitte ein Like, kommentieren Sie und teilen Sie es. Es hilft uns sehr~

Danke, dass Sie meinen Artikel gelesen haben. Wir sehen uns beim nächsten Mal.

In YouMind remixen

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Für Creator

Verwandle dein Markdown in einen sauberen 𝕏-Artikel

Wenn du eigene Langtexte veröffentlichst, wird die 𝕏-Formatierung von Bildern, Tabellen und Codeblöcken mühsam. YouMind macht aus einem ganzen Markdown-Entwurf einen sauberen, sofort postbaren 𝕏-Artikel.

Markdown zu 𝕏 testen

Mehr Muster zum Entschlüsseln

Aktuelle virale Artikel

Mehr virale Artikel entdecken