Vollständiger Leitfaden zur lokalen LLM-Bereitstellung: Erstellen Sie Ihren eigenen Agent-Workflow für Token-Unabhängigkeit (Einsteigerfreundlich)

@Lonely__MH
CHINESISCH17. Aug. 2026
153K
287
74
94
470

TL;DR

Ein detailliertes Tutorial zur lokalen Bereitstellung des 124B Ling-3.0-flash-Modells mit vLLM, einschließlich Leistungs-Benchmarks, TUI-Entwicklung und der Integration von Multi-Modell-Workflows für automatisierte Inhaltsaufgaben.

Dieser Artikel zielt darauf ab, so verständlich wie möglich zu sein, damit auch Anfänger die lokale Modellbereitstellung problemlos meistern und eigene Workflows erstellen können.

In diesem Jahr waren die inländischen Open-Source-Modelle sehr aktiv. DeepSeek, Qwen, Kimi, GLM, MiniMax ... neue Modelle erscheinen Schlag auf Schlag, geben ständig ihre Gewichte frei und beginnen, sich mit den Closed-Source-Modellen aus den USA zu messen.

Aber je mehr Modelle es gibt, desto mehr interessiert mich eine bestimmte Frage: Können diese Modelle nicht nur in Webseiten und APIs bleiben, sondern wirklich auf unseren eigenen Maschinen installiert werden, mit lokalen Dateien, Tools und Workflows verbunden werden?

Obwohl der Stückpreis von API-Tokens generell sinkt, bleiben die Kosten bei häufigen Aufrufen und langen Texten hoch. Zusammen mit Themen wie Datenschutz, Vernetzung und Datenkontrolle wird die lokale Bereitstellung zur Wahl für immer mehr Entwickler und Unternehmen.

Also möchte ich diesmal ein Modell mit einer anspruchsvollen Größe und repräsentativ für die Einzelmaschinenbereitstellung auswählen, um den gesamten lokalen Bereitstellungsprozess durchzuspielen.

Der Hauptdarsteller ist schließlich Ling-3.0-flash, Open-Source von Ant Bailing – ein Mixture-of-Experts (MoE)-Modell mit insgesamt 124B Parametern. Ich habe zufällig einen NVIDIA DGX Spark zur Hand, der es gerade ausführen kann.

Genug der Vorrede, lasst uns mit der Hauptsache beginnen.

Lonely - inline image

01 Begriffserklärung

Bevor wir beginnen, stellen wir einige modellbezogene Begriffe vor, um alle auf den gleichen Stand zu bringen ✌🏻

Modellgenauigkeit

Dasselbe Modell bietet oft verschiedene Genauigkeits- oder Quantisierungsversionen, die sich direkt auf die Modellgröße und die Ausführungsschwelle auswirken.

Lonely - inline image

Dieses Mal verwenden wir die offizielle Ling INT4-Version, die etwa 71,75 GB groß ist.

Dense oder MoE

Lonely - inline image

Beachten Sie, dass 5,1B nur die Anzahl der pro Inferenz aktivierten Parameter ist; die vollständigen 124B Gewichte müssen dennoch in den Speicher geladen werden.

Inferenz-Engine

Die Inferenz-Engine ist verantwortlich für das Laden der Gewichte, die Verwaltung von Kontext und Parallelität sowie die Bereitstellung von Schnittstellen. Sie ist das Werkzeug zum Ausführen des Modells, nicht das Modell selbst.

Lonely - inline image

Wir haben uns diesmal für vLLM entschieden, da die aktuelle offizielle Adaption die INT4-Gewichte von Ling-3.0-flash und MTP spekulative Dekodierung unterstützt.

02 Modellinstallation und -bereitstellung

Zunächst stelle ich die Installationsumgebung vor: Ich verwende einen NVIDIA DGX Spark, ausgestattet mit einem GB10-Chip und 121,6 GB Unified Memory, auf dem Ubuntu 24.04 auf ARM64-Architektur läuft. Bereitgestellt wird Ling-3.0-flash-INT4, und die anschließenden Durchsatztests verwenden das lokale Qwen 3.8-27B als Referenz.

Die offizielle Version bietet eine Basisversion und verschiedene Genauigkeitsversionen wie FP8, FP4 und INT4. Sie können je nach Ihrer Hardware wählen.

Es gibt auch ein 8B Ling-3.0-tiny und dessen FP8-, INT4-Versionen. Benutzer mit einem normalen Mac oder einer einzelnen 4090 können zuerst die niedrigpräzisen Versionen von Tiny ausprobieren.

Lonely - inline image

Schritt 1: Modell herunterladen. Ich habe diesmal die offizielle INT4-Version verwendet. Download-Einträge 👇🏻

Wenn der Zugriff auf Hugging Face umständlich ist, können Sie manuell von ModelScope herunterladen. Nach dem Download gibt es 24 safetensors-Shards mit insgesamt etwa 71,75 GB. Sie müssen auch Platz für die Inferenz-Engine und den KV-Cache während der Laufzeit lassen.

Schritt 2: Umgebung vorbereiten. Die BailingMoeV3-Architektur von Ling-3.0-flash ist recht neu. Ich habe versucht, GGUF mit llama.cpp zu verwenden, aber es gab einen Fehler mit unknown model architecture: 'bailingmoe3'. Daher habe ich diesmal direkt den offiziell adaptierten vLLM-Zweig verwendet:

text
1pip install uv
2uv venv ~/my_ling_env
3source ~/my_ling_env/bin/activate
4
5git clone -b ling_3_0 https://github.com/inclusionAI/vllm-ling-v3.git
6cd vllm-ling-v3
7VLLM_USE_PRECOMPILED=1 uv pip install --editable . --torch-backend=auto

Schritt 3: Inferenzdienst starten. Ersetzen Sie den Modellpfad durch Ihre lokal heruntergeladenen INT4-Gewichte:

text
1vllm serve /path/to/Ling-3.0-flash-int4 \
2 --served-model-name ling-int4 \
3 --host 127.0.0.1 \
4 --port 30000 \
5 --trust-remote-code \
6 --max-model-len 16384 \
7 --gpu-memory-utilization 0.8 \
8 --max-num-seqs 8 \
9 --reasoning-parser ling3 \
10 --speculative-config '{"method":"bailing_hybrid_v3_mtp","num_speculative_tokens":1}'

⚠️

Bitte ersetzen Sie die Pfade im Befehl durch die tatsächlichen Pfade auf Ihrem Rechner.

Hier ist das Kontextlimit auf 16K gesetzt, die Parallelität auf 8 und die MTP spekulative Dekodierung aktiviert.

Hinweis: MTP (Multi-Token Prediction) ermöglicht es dem Modell, zu versuchen, mehrere Tokens auf einmal vorherzusagen. Korrekt vorhergesagte Teile können direkt übernommen werden, wodurch die Berechnungsschritte für die Generierung von Token für Token reduziert und die Ausgabegeschwindigkeit erhöht wird.

Schritt 4: Dienst überprüfen. Sobald der Dienst gestartet ist, senden Sie eine einfache Anfrage:

bash
1curl -s http://127.0.0.1:30000/v1/chat/completions \
2 -H "Content-Type: application/json" \
3 -d '{"model":"ling-int4",
4 "messages":[{"role":"user","content":"Hallo, bitte stellen Sie sich in einem Satz vor."}],
5 "stream":true}'

Das Terminal beginnt, Inhalte als Stream zurückzugeben, was bedeutet, dass dieses 124B-Modell lokal läuft.

Lonely - inline image

03 Testen der Modellleistung und -fähigkeit

  1. Token-Durchsatz Als das Modell zum ersten Mal gestartet wurde, habe ich eine Testrunde mit dem integrierten Benchmark von vLLM durchgeführt. Alle 20 Anfragen wurden abgeschlossen, mit einem Ausgabedurchsatz von 84,34 tok/s, einem Gesamttoken-Durchsatz von 133,10 tok/s und einer MTP-Akzeptanzrate von 67,35%.
Lonely - inline image

Original-Logausgabe 👇🏻

text
1============ Serving Benchmark Result ============
2Successful requests: 20
3Failed requests: 0
4Request rate configured (RPS): 2.00
5Benchmark duration (s): 60.71
6Total input tokens: 2960
7Total generated tokens: 5120
8Request throughput (req/s): 0.33
9Output token throughput (tok/s): 84.34
10Peak output token throughput (tok/s): 61.00
11Peak concurrent requests: 20.00
12Total token throughput (tok/s): 133.10
13---------------Time to First Token----------------
14Mean TTFT (ms): 19692.98
15Median TTFT (ms): 18877.99
16P99 TTFT (ms): 40039.02
17-----Time per Output Token (excl. 1st token)------
18Mean TPOT (ms): 44.61
19Median TPOT (ms): 44.09
20P99 TPOT (ms): 49.68
21---------------Inter-token Latency----------------
22Mean ITL (ms): 74.09
23Median ITL (ms): 72.39
24P99 ITL (ms): 280.71
25---------------Speculative Decoding---------------
26Acceptance rate (%): 67.35
27Acceptance length: 1.67
28Drafts: 3051
29Draft tokens: 3051
30Accepted tokens: 2055
31Per-position acceptance (%):
32 Position 0: 67.35
33==================================================

Anschließend habe ich Parallelitätstests für Ling und das lokale Qwen 3.8-27B durchgeführt. Bei 8 parallelen Verbindungen betrug der aggregierte Durchsatz von Ling 141,38 tok/s, während Qwen 3.8 bei 32,61 tok/s lag, ein Unterschied von etwa dem 4,34-fachen in dieser Runde.

🔥🔥🔥Ling-3.0-Flash Vs Qwen3.8-27B Auslastungstest Vergleich

Lonely - inline image

Ling-3.0-flash

Lonely - inline image

Qwen 3.8 -27B

Lonely - inline image
Lonely - inline image

Einige fragen sich vielleicht: Warum beträgt die Einzelparallelität von Ling nur 34,77 tok/s, aber bei 8 parallelen Verbindungen 141,38 tok/s? Technisch versierte Freunde könnten auch fragen, ob diese Einzelparallelitätsbewertung im Vergleich zu offiziellen Daten langsam ist.

Hier müssen wir die spezifische Testmethode und die Geschwindigkeitsunterschiede, die durch verschiedene Bewertungsmethoden verursacht werden, erklären:

  1. Testmethode und echte End-to-End-Verbindung: Dieser Test verwendet eine lokale OpenAI-kompatible Schnittstelle und führt Auslastungstests über HTTP-Streaming-Anfragen durch, nicht einen Offline-Inferenztest, der vom Service-Framework getrennt ist. Jede Ling-Anfrage verwendet einen langen Text-Prompt von etwa 150 Tokens und generiert bis zu 512 Tokens. Die Zeitmessung beginnt mit der HTTP-Anfrage des Clients, bis die Streaming-Antwort abgeschlossen ist, und umfasst daher lokale HTTP-Aufrufe, Service-Scheduling, Tokenizer-Verarbeitung, Prefill, tokenweise Dekodierung und Streaming-Rückgabe.
  2. Einzelstrom-Ausgaberate vs. Maschinen-Aggregatdurchsatz: Einzelstrom-Geschwindigkeit (echte Benutzererfahrung): Bei $c=1$ beträgt die End-to-End-Ausgaberate etwa 35,34 tok/s (echte Einzelgesprächstests bei 38+ tok/s), was über 35 chinesischen Zeichen pro Sekunde entspricht und visuell extrem schnell ist; Aggregatdurchsatz (Gesamtausgabe unter Parallelität): Mit zunehmender Parallelität verwendet vLLM Continuous Batching, um mehrere Anfragen zu GPU-Berechnungen zu kombinieren und die Bandbreite des Unified Memory von Blackwell voll auszunutzen. Bei 8 parallelen Verbindungen stieg der aggregierte Durchsatz der Maschine auf 141,38 tok/s.

Was den Unterschied zu einigen offiziellen Benchmarks betrifft, liegt der Schlüssel in den Testkriterien. Modellgenauigkeit, Inferenz-Engine, Kontextlänge, Anzahl der Eingabe-/Ausgabe-Tokens, Parallelitätsskala und ob Offline-Inferenz oder HTTP-Dienste verwendet werden, beeinflussen alle das Endergebnis. Nur wenn diese Bedingungen im Wesentlichen konsistent sind, sind die Zahlen für einen direkten Vergleich geeignet.

Einfach ausgedrückt: Die Geschwindigkeit variiert aufgrund der Bewertungsmethoden – wenn bei extrem hoher Parallelität (z. B. 32/64) oder in einer reinen Rechenumgebung ohne Netzwerkprotokolle getestet wird, wären die Gesamtdurchsatzzahlen höher; bei unseren täglichen Einzelpersonengesprächen oder Codierungsproduktionsaufrufen fühlt sich Lings Einzelstrom von 35+ tok/s und eine First-Token-Latenz von unter 220 ms bereits extrem flüssig und verzögerungsfrei an.

Bei Einzelparallelität beträgt Lings durchschnittliche Einzelstromgeschwindigkeit etwa 35,34 tok/s; bei 8 parallelen Verbindungen erreicht der aggregierte Durchsatz 141,38 tok/s. Der aggregierte Durchsatz von Qwen3.8 bei 8 parallelen Verbindungen beträgt 32,61 tok/s. In dieser Runde zeigt sich Lings Vorteil hauptsächlich in der Ausgabegeschwindigkeit und dem parallelen Durchsatz, mit merklich schnelleren Antworten in der Praxis.

2. Echte Fähigkeiten

Benchmarks spiegeln nur einen Teil der Leistung wider; die tatsächliche Nutzbarkeit hängt von der Leistung des Modells bei spezifischen Problemen ab. Ich habe drei Bereiche für einfache Tests ausgewählt.

(1) Logisches Denken

Ich habe eine Variation des Hühner-und-Kaninchen-Problems vorbereitet, ein klassisches Autowaschproblem und ein Autowaschmaschinenproblem, hauptsächlich um zu sehen, ob es Bedingungen genau verstehen kann, anstatt eine vertraut aussehende Antwort anzuwenden. Das Hühner-und-Kaninchen-Problem enthielt 4 mechanische Vögel mit drei Beinen, um konventionelle Muster zu durchbrechen.

Lonely - inline image

(2) Sicherheitsgrenzen: Als nächstes habe ich seine Reaktion auf risikoreiche Operationen getestet: ob es direkt ausführt oder Risiken identifiziert, mit dem Benutzer bestätigt und sicherere Alternativen bereitstellt.

Lonely - inline image

(3) Langer Text

Schließlich eine Runde Langtext-Tests. Ich habe Schlüsselinformationen in einem langen Kontext versteckt, um zu sehen, ob es sie genau finden und beantworten kann, während ich die Ausgabegeschwindigkeit und Stabilität bei langen Texten beobachtet habe.

Lonely - inline image

04 Von API zu TUI, dann zu Tool Calling

Wir haben die Modellbereitstellung und Fähigkeitstests abgeschlossen, aber für normale Benutzer ist curl besser geeignet, um Schnittstellen zu überprüfen als für den täglichen Gebrauch. Um lange mit einem lokalen Modell zu sprechen, wird eine bequemere Interaktionsschnittstelle benötigt.

Also habe ich zuerst eine einfache TUI erstellt, eine Chat-Oberfläche, die im Terminal läuft. Es ist keine komplexe Software; ich habe KI ein Python-Skript schreiben lassen, um lokale Schnittstellenaufrufe, Streaming-Ausgabe und Gesprächsverlauf zu kapseln, und es dann mit einem Befehl gestartet:

text
1python3 ling-3.0-chat.py

Auf diese Weise muss ich nicht jedes Mal curl schreiben. Terminal öffnen und direkt chatten; Antworten werden gestreamt, und Sie können TPS, TTFT und Token-Anzahl sehen. Ich habe die vorherigen Fähigkeitstests in dieser Oberfläche durchgeführt.

Zu diesem Zeitpunkt ist die TUI jedoch nur ein Text-Chat-Tool ohne die Fähigkeit, Tools aufzurufen. Das große Modell ist wie ein "Gehirn", das für das Denken verantwortlich ist, aber es hat keine "Hände und Füße", um Dateien zu lesen, Befehle auszuführen oder den aktuellen Systemzustand zu kennen.

Um es zu befähigen, Systemfunktionen aufzurufen, müssen wir Tool Calling hinzufügen. Einfach ausgedrückt werden Operationen wie Befehlsausführung, Dateilesen und Schreiben als Tools gekapselt. Das Modell beurteilt zuerst, welche Informationen es benötigt, initiiert dann eine tool use; das Python-Skript führt es aus und übergibt das Ergebnis zur weiteren Verarbeitung an das Modell zurück.

Zum Beispiel, als ich es bat, die System-GPU-Informationen zu überprüfen, wusste es anfangs nicht die tatsächliche Nutzung und konnte mir nur sagen, wie ich es überprüfen kann. Nach dem Hinzufügen von Tool Calling konnte es selbst Systembefehle ausführen und die Abfrageergebnisse direkt in der TUI organisieren.

Basierend auf dem gleichen Prinzip können Sie weiterhin Websuche, interne Unternehmensschnittstellen, Datenbanken usw. anschließen. Spezifische Tools können je nach Geschäftsanforderungen erweitert werden.

Lonely - inline image

05 Verbindung zu einer visuellen Oberfläche

Für den persönlichen Gebrauch ist eine TUI mit Tool Calling eigentlich völlig ausreichend. Um noch einen Schritt weiter zu gehen und das Modell in eine vollständigere Agent-Workbench zu integrieren, können Sie es mit einem Agent-Framework wie Harness verbinden.

Diesmal habe ich Liang Shengs DeepSeek Harness gewählt, das nicht nur eine Chat-Seite hinzufügt, sondern auch Kontextverwaltung, Arbeitsbereiche, Tool Calling, Berechtigungskontrolle und Aufgabenplanung mit einer integrierten Web-UI bietet. Es verwendet eine "Alles ist ein Plugin"-Architektur, die zukünftige Funktionserweiterungen ermöglicht.

Beachten Sie, dass DeepSeek Harness sich noch in der Entwicklervorschauphase befindet und sich schnell aktualisiert, was zu inkompatiblen Änderungen führen kann. Es gibt viele andere Open-Source-Agent-Frameworks; Sie können je nach Bedarf wählen.

Der Verbindungsprozess ist nicht komplex: Der Kern besteht darin, einen benutzerdefinierten Modelldienst hinzuzufügen und die Adresse auf die lokale Schnittstelle zu verweisen, die von vLLM bereitgestellt wird. Neben der Konfiguration in der Web-UI können Sie auch die Konfigurationsdatei wie gezeigt ändern:

text
1llm-pi-ai:
2 providers:
3 ling:
4 displayName: "Ling-3.0-flash (124B)"
5 api: openai-completions
6 baseURL: http://127.0.0.1:30000/v1
7 apiKeyEnv: OPENAI_API_KEY
8 models:
9 - id: ling-int4
10 name: Ling-3.0-flash (124B MoE)

Nach dem Start der Web-UI öffnen Sie die Standardadresse in Ihrem Browser:

text
1http://localhost:3080

Auf diese Weise können tägliches Chatten, Verlauf und Modellwechsel alle in DeepSeek Harness durchgeführt werden. Harness selbst bietet Dateioperationen, Befehlsausführung und Aufgabenplanung, die über Plugins weiter erweitert werden können. Für die spezifische Verwendung und Plugins von Drittanbietern können interessierte Freunde selbst suchen.

Beachten Sie, dass Tools, die ich in der Python-TUI geschrieben habe, nicht automatisch migriert werden. Um sie in Harness zu verwenden, müssen sie gemäß seinem Plugin-Mechanismus neu integriert werden. Unten ist der tatsächliche Integrationseffekt, den ich für Ling erstellt habe; Sie können sich die Aufzeichnung ansehen.

Lonely - inline image

06 Aufbau eines KI-Workflows

An diesem Punkt ist die Einzelmodellkette von der Bereitstellung über die Schnittstelle bis hin zu Tool Calling für Ling-3.0-flash vollständig etabliert.

In realen Projekten verwenden wir jedoch normalerweise nicht nur ein Modell. Verschiedene Modelle sind für verschiedene Dinge gut; sie zu kombinieren ist oft besser, als ein Modell alles erledigen zu lassen.

Ling-3.0-flashs Stärke liegt in der Textverarbeitung und Generierungsgeschwindigkeit, unterstützt aber keine native multimodale Eingabe. Wenn eine Aufgabe das Verstehen von Bildern oder Videos erfordert, können Sie ein multimodales Modell wie Qwen3.8-27B anschließen; wenn Sie Video generieren müssen, können Sie das kürzlich veröffentlichte Open-Source-Modell MiniMax H3 anschließen. Jedes Modell bearbeitet das, was es am besten kann, und übergibt die Ergebnisse an das nächste.

Um beispielsweise einen Videogenerierungs-Workflow zu erstellen, kann Ling zuerst Anforderungen verstehen, Skripte schreiben und Storyboards aufteilen, dann überprüft das multimodale Modell Referenzmaterialien und visuelle Konsistenz, und schließlich generiert das Videomodell. Nach der Generierung kann eine weitere Runde der visuellen Überprüfung durchgeführt werden, um Prompts zu ändern und basierend auf den Ergebnissen neu zu generieren:

text
1Anforderungen und Materialien
2→ Ling generiert Skript und Storyboards
3→ Multimodales Modell überprüft Materialien und visuelle Anforderungen
4→ MiniMax H3 generiert Video
5→ Multimodales Modell überprüft Visuals und Kontinuität
6→ Ling passt Prompts basierend auf Feedback an
7→ Menschliche abschließende Überprüfung

Das folgende Video zeigt den tatsächlichen Effekt von Prompts, die von Ling-3.0-flash generiert und dann an MiniMax H3 zur Generierung übergeben wurden.

Lonely - inline image

Sobald dieser Prozess festgelegt ist, müssen Sie nur noch Anforderungen und Materialien ändern, um ihn wiederholt zu verwenden. Das gleichzeitige Ausführen mehrerer großer Modelle lokal stellt jedoch sehr hohe Anforderungen an VRAM und Arbeitsspeicher. Ling INT4 benötigt etwa 72 GB, Qwen3.8-27B BF16 etwa 51,77 GB, plus KV-Cache und Videomodelle; es ist schwierig, sie alle gleichzeitig auf diesem Spark zu halten.

Berechnen Sie vor der tatsächlichen Bereitstellung unbedingt, wie viel VRAM oder Unified Memory jedes Modell benötigt. Wenn die Ressourcen nicht ausreichen, können Sie Modelle schrittweise wechseln, quantisierte Versionen wählen oder Modelle auf mehrere Geräte aufteilen. Mehrere Modelle laufen dann nicht mehr unabhängig voneinander, sondern arbeiten gemeinsam an derselben Aufgabe – das ist ein wirklich nutzbarer Multi-Modell-KI-Workflow.

07 Abschließende Gedanken

Von der Modellbereitstellung über TUI und Tool Calling bis hin zu Multi-Modell-Workflows ist die gesamte Kette vollständig. Dieser Artikel zielt darauf ab, eine wiederholbare Methode zu teilen, nicht eine feste Konfiguration.

Open-Source-Modelle werden sich weiter aktualisieren. In Zukunft, egal ob Sie Modelle, Quantisierungsversionen oder Inferenz-Engines ändern, wird sich der Weg vom Herunterladen der Gewichte und Starten der Dienste bis zum Verbinden von Tools und Workflows nicht wesentlich ändern.

Wenn die Bedingungen es zulassen, empfehle ich dennoch jedem, lokale Modelle persönlich bereitzustellen:

  1. Datenkontrolle: Dateien, Gespräche und Geschäftsdaten bleiben auf Ihrem Rechner oder Intranet, mit Verzeichnis- und Befehlsberechtigungen, die von Ihnen eingeschränkt werden.
  2. Geeignet für häufige Nutzung: Keine Notwendigkeit, Token-Kosten pro Nutzung zu berechnen, reduziert die Abhängigkeit von Netzwerk- und Drittanbieterdiensten.
  3. Einfache Anpassung: Modelle, Quantisierungsgenauigkeit, Inferenz-Engines und Tools können alle angepasst werden, und interne Schnittstellen und Datenbanken können angeschlossen werden.

Da Open-Source-Modelle immer leistungsfähiger werden, wird die lokale Bereitstellung zur Wahl für immer mehr Menschen. Sie können Tools und Workflows basierend auf Ihren Aufgabenanforderungen, Gerätebedingungen und Ihrem Budget erstellen. Ich hoffe, dass jeder in Zukunft seinen eigenen lokalen Agenten haben kann, ohne jedes Mal auf den Token-Verbrauch starren zu müssen, und wirklich seine eigene "Token-Freiheit" erreicht!

Verwandte Ressourcen

📚 Zusammenfassung historischer Artikel

  1. Hermes Agent Praxisleitfaden: Von X-Angst zur automatischen Akkumulation
  2. Anti-Haarausfall-Leitfaden für Programmierer
  3. Hermes mit iMessage verbinden
  4. Hermes mit X Premium verbinden
  5. Hermes Agent Komplettleitfaden
  6. Hermes Agent Einsteigerleitfaden: Hilfsmodelle
  7. Hermes Agent Einsteigerleitfaden
  8. Hermes Agent Fortgeschrittenenleitfaden
  9. Hermes Agent Unvollständiger Leitfaden
  10. Vollständiger Leitfaden zum Claude Pro Abo in Nigeria
  11. Tutorial zur Registrierung einer Apple-ID in Nigeria
  12. ChatGPT Plus zum halben Preis in der Türkei
  13. US Apple-ID Registrierung
  14. Claude/ChatGPT/Gemini Alipay Abo
  15. Vollständiges Tutorial zur lokalen LLM-Bereitstellung auf dem Mac
  16. IP-Qualitätsprüfung
  17. Warum Doubao Ihre Marke nicht empfiehlt
  18. Wie man seiner Oma erklärt, dass das, was Doubao gesagt hat, nicht wahr ist

Wenn dies hilfreich war, folgen Sie bitte + merken Sie sich vor + teilen Sie es 👏🏻

Folgen Sie @Lonely__MH für kontinuierliche Updates zu anfängerfreundlichen Tutorials und KI-Tool-Einblicken.

In YouMind remixen

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Für Creator

Verwandle dein Markdown in einen sauberen 𝕏-Artikel

Wenn du eigene Langtexte veröffentlichst, wird die 𝕏-Formatierung von Bildern, Tabellen und Codeblöcken mühsam. YouMind macht aus einem ganzen Markdown-Entwurf einen sauberen, sofort postbaren 𝕏-Artikel.

Markdown zu 𝕏 testen

Mehr Muster zum Entschlüsseln

Aktuelle virale Artikel

Mehr virale Artikel entdecken