Nemotron 3 Ultra. Offen, kostenlos, eine Million Token Kontext. Im Folgenden geht es nicht um Benchmarks, sondern darum, was dieses Modell einfacher, simpler und gĂŒnstiger macht als die anderen â und wie man damit Geld verdient.

Okay, ganz ehrlich. Ich habe ein paar Tage mit Nemotron 3 Ultra verbracht und war zunĂ€chst skeptisch. Dann hat es Klick gemacht: Das Interessante sind nicht die IQ-Werte, sondern dass es Dinge tut, die andere teuer und klobig machen, und das fĂŒr ein paar Cent. Darauf basiert der folgende Geld-Plan. Nicht "ein weiterer KI-Bericht", sondern etwas, das du nicht einfach mit ChatGPT replizieren kannst.
Was dieses Modell wirklich besser macht als die anderen
Bevor es ans Geld geht, vier Unterschiede, auf denen alles aufbaut. Das ist die Antwort auf "Warum dieses hier?".
- Eine Million Token auf einmal. FĂŒge Hunderte von Seiten, einen ganzen Ordner mit Dokumenten oder 20 Konkurrenzseiten in einem Block ein. Es liest alles auf einmal und behĂ€lt den Faden. Billige Modelle können das nicht, der Kontext wird abgeschnitten, also musst du RAG aufbauen oder das Material in StĂŒcke hacken und von Hand wieder zusammensetzen.
- Nahezu null Kosten. Der kostenlose Tarif auf OpenRouter (Null rein, Null raus, ratenbegrenzt) und ein Billig-Tarif, 0,50 $ und 2,50 $ pro Million Token. Du kannst es in groĂem Umfang nutzen, sogar rund um die Uhr. Ein teures, geschlossenes Modell wĂŒrde bei gleichem Volumen den gesamten Gewinn auffressen.
- Offene Gewichte, lĂ€uft auf deiner Hardware. Lade es herunter, installiere es auf deinen Rechnern, feintune es fĂŒr eine Nische, und es gehört dir. Nichts verlĂ€sst dein Netzwerk. Geschlossene GPT-, Gemini- und Claude-Modelle kann man nicht so ĂŒbergeben, man kann sie nur mieten.
- Weniger Halluzinationen. In den Tests hat es den besten Nicht-Halluzinations-Score im Set, 78,7. FĂŒr bezahlte Berichte ist das entscheidend, eine erfundene Tatsache kostet dich einen Kunden.
Behalte diese vier im Hinterkopf. Jede Stufe des folgenden Plans stĂŒtzt sich auf eine bestimmte.
Der Geld-Plan, aufgebaut auf diesem Vorteil
Die Idee: Du verlangst Geld fĂŒr die Analyse groĂer Informationsmengen, die Konkurrenten mit billigem ChatGPT nicht auf einmal verarbeiten können. Dein Trumpf ist Punkt 1, der Millionen-Token-Kontext.
Was genau verkaufen
Nicht "ein Kurzprofil von drei Konkurrenten", das kann jeder. Dinge, die Volumen brauchen:
- Eine MarktĂŒbersicht ĂŒber 15-30 Konkurrenten auf einmal, nicht nur drei.
- Ein komplettes Dokumentenpaket: ein Investor Data Room, ein Satz VertrÀge, Ausschreibungsunterlagen.
- Ein Audit eines gesamten Bewertungskorpus, Tausende davon, in einem Durchgang.
- Eine ganze Codebasis oder ein Jahr Chat- und Anrufarchive.
Der Trick ist, dass der Kunde dir alles in einem Block gibt und du eine fertige Analyse zurĂŒckgibst. Kein RAG, kein Chunken, kein Schmerz.
Der funktionierende Prompt, zum Kopieren
1Du bist ein leitender Marktanalyst. Ich werde dir unten Rohmaterial zu mehreren Konkurrenten einfĂŒgen (Websites, Preise, Bewertungen, BerichtsauszĂŒge).23Wenn kein Material eingefĂŒgt wird, frage mich danach, anstatt zu raten.4Verwende NUR das Material, das ich bereitstelle. Wenn eine Tatsache fehlt, markiere sie als "nicht in der Quelle", erfinde sie nicht.56Erstelle:7- eine MarktĂŒbersicht (Preis vs. Positionierung) als Tabelle8- gemeinsame Kundenschmerzpunkte aus allen Bewertungen, mit Angabe, bei wie vielen Konkurrenten jeder auftritt9- einen weiĂen Fleck, den niemand gut abdeckt10- drei Nischen, in die mein Kunde einsteigen könnte, jeweils mit einem Ansatz und Unterscheidungsmerkmalen11Format: Tabellen und kurze AufzĂ€hlungspunkte, kein FĂŒlltext.
Versuche, das dem kostenlosen ChatGPT zu fĂŒttern â es wird kĂŒrzen oder dich bitten, es in Teile zu zerlegen. Hier fĂŒgst du alles auf einmal ein, und das ist der ganze Unterschied.
Was es dich kostet
So eine groĂe Analyse umfasst grob 300-800 Tausend Input-Token und ein paar Zehntausend Output-Token. Im kostenpflichtigen Tarif sind das unter einem Dollar, im kostenlosen Tarif null. Deine Modellkosten tendieren gegen null, das ist dein zahlenmĂ€Ăiger Vorteil.
Was die Leute dafĂŒr zahlen
Marktzahlen, 2026. Marktforschung auf Upwork liegt bei etwa 25-70 $ pro Stunde, und eine groĂe Analyse ist keine Dreistundenarbeit, sondern ein komplettes Projekt, also liegt die GebĂŒhr ĂŒber einem einfachen Kurzprofil. Audits und Data-Room-Reviews kosten mehr als ein einfacher Bericht. Ein einzelner Retainer-Kunde, ein monatliches Abonnement, liegt oft bei 2.000-3.000 $ pro Monat.

Eine Angebotsleiter, damit es ein GeschÀft wird und kein einmaliger Auftrag
- Stufe 1, schnelles Geld. Einmalige Analysen groĂer Datenmengen. Kosten sind CentbetrĂ€ge, GebĂŒhr zwischen einhundert und mehreren hundert Dollar pro StĂŒck. StĂŒtzt sich auf Punkt 1, Kontext.
- Stufe 2, wiederkehrend. Ein Abonnement fĂŒr einen stĂ€ndig aktiven Agenten: Jede Nacht ĂŒberwacht er Konkurrenten oder den Markt und mailt dem Kunden eine Zusammenfassung. Das funktioniert nur, weil Token nahezu kostenlos sind, Punkt 2. Ein geschlossenes Modell im Dauerbetrieb wĂŒrde einen in den Ruin treiben.
- Stufe 3, das groĂe Geld. Einsatz eines privaten, feingetunten Assistenten direkt beim Kunden, fĂŒr AnwĂ€lte, Kliniken, Finanzen, Behörden â alle, die keine Daten in die Cloud schicken können. Nur ein offenes Modell kann das, Punkt 3. Das ist Consulting, die GebĂŒhr ist viel höher, aber auch die HĂŒrde, du brauchst die FĂ€higkeiten.
Wie man an einem Tag startet
- Zugang besorgen: NVIDIA Browser Playground, https://build.nvidia.com/nvidia/nemotron-3-ultra-550b-a55bhttps://build.nvidia.com/nvidia/nemotron-3-ultra-550b-a55b), oder einen SchlĂŒssel auf OpenRouter. Ein paar Minuten.
- Vor den Kunden ein groĂes Beispiel erstellen. Nimm eine echte Nische, fĂŒttere sie mit einem Haufen Material, verpacke es schön.
- Kunden suchen. Upwork: Suche nach "Konkurrenzanalyse", "Marktforschung", "Due Diligence", filtere auf die letzten 7 Tage, 10-15 kurze Angebote pro Tag, Muster vorlegen. X: GrĂŒnder fragen stĂ€ndig nach Konkurrenten, antworte mit Mehrwert. Product Hunt: Launches vom letzten Monat, schreibe GrĂŒnder direkt an.
- Schnell liefern. Geschwindigkeit ist dein Vorteil, eine Analyse am selben Tag wirkt wertvoller.
- Bewege sie zu Stufe 2 und 3. Frage nach der Lieferung nach einer Bewertung und einem Kontakt, der das auch braucht.
Der Haken, ganz ehrlich
Das ist keine Einkommensgarantie, sondern Marktrechnung plus nahezu null Kosten. Was du persönlich verdienst, hĂ€ngt davon ab, ob du Kunden gewinnst. Der KI-Freelancer-Markt ist ĂŒberfĂŒllt, die Antwortraten in der KI-Kategorie auf Upwork liegen bei etwa 5-7%, also verkaufe das Ergebnis, "eine fertige Analyse bis morgen frĂŒh", nicht "Ich benutze KI". ĂberprĂŒfe die QualitĂ€t von Hand, das Modell kann Fakten falsch darstellen. Stufe 3 erfordert echte technische FĂ€higkeiten, das ist nichts fĂŒr jedermann.
Also, was ist dieses Modell?
Kurzversion. Die meisten Modelle antworten auf einmal, ein Agent plant, greift auf Werkzeuge zu, ĂŒberprĂŒft sich selbst und arbeitet sich in Schritten vor. Je lĂ€nger die Kette, desto teurer wird es. Nemotron ist auf die lange Schleife abgestimmt. Unter der Haube: Mixture-of-Experts (von 550 Milliarden Parametern arbeiten nur 55 Milliarden pro Token, wie ein Krankenhaus mit 512 Ărzten, von denen nur die 22, die du brauchst, hereinkommen) und Mamba-Schichten anstelle der meisten Transformer (die Kosten pro Schritt bleiben ungefĂ€hr gleich, daher kommen die Millionen Token ohne Verzögerung).

Nemotron 3 Ultra vs. Opus 4.8 und die Giganten

Gegen die offenen Rivalen (Kimi K2.6 mit 1T, GLM-5.1 mit 754B, Qwen-3.5 mit 397B), fair und direkt: nicht an der Spitze jedes Benchmarks, aber es gewinnt bei Geschwindigkeit und ZuverlÀssigkeit. Bis zu 5,9x schneller als GLM-5.1 bei langer Generierung, 94,7 Recall bei einer Million Token, bester Nicht-Halluzinations-Wert im Set mit 78,7.
Wo es schwÀchelt
Keine rosarote Brille. Bei den schwierigsten Denkaufgaben und Ein-Schuss-Problemen sind die geschlossenen GPT-, Gemini- und Opus 4.8-Modelle voraus. Bei kurzen Prompts mit vielen Eingaben verliert es gegen Qwen-3.5. Und es hat 550 Milliarden Parameter, du wirst es nicht auf einem Laptop laufen lassen, fĂŒr Stufe 1 und 2 benutze eine API, wo es CentbetrĂ€ge kostet, und Stufe 3 erfordert ernsthafte GPUs. FĂŒr die schwierigsten Aufgaben halte ein Top-geschlossenes Modell in der Hinterhand.
Wo du es bekommst
- Playground: https://build.nvidia.com/nvidia/nemotron-3-ultra-550b-a55b
- API: OpenRouter https://openrouter.ai/nvidia/nemotron-3-ultra-550b-a55b (kostenpflichtig 0,50 $ und 2,50 $ pro 1M Token oder kostenlos mit Ratenbegrenzung), Together AI, Nebius, AWS SageMaker JumpStart
- Gewichte zum Feintunen, benötigt GPUs: https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16
- In einem Produkt: Perplexity im Pro-Tarif
Wohin das alles fĂŒhrt
Die geschlossenen Giganten gewinnen noch die Demos, aber die echte Arbeit verlagert sich dorthin, wo es billiger ist und die Daten unter Kontrolle bleiben.
NVIDIA hat bereits die Nemotron-Koalition zusammengestellt und arbeitet an Nemotron 4.
Ein mĂ€chtiges Werkzeug ist gerade zu nahezu null Kosten eingetroffen, und das Fenster ist offen fĂŒr denjenigen, der es zuerst in einen Dienst verwandelt.
Die klĂŒgste KI bekommt den Applaus. Die billigste, die funktioniert, wird bezahlt.






