Bài viết này được thiết kế để dễ hiểu nhất có thể, giúp bất kỳ người chơi mới nào cũng có thể dễ dàng nắm vững việc triển khai mô hình cục bộ và xây dựng quy trình làm việc của riêng mình.
Năm nay, các mô hình nguồn mở trong nước hoạt động rất sôi nổi. DeepSeek, Qwen, Kimi, GLM, MiniMax... các mô hình mới liên tục xuất hiện, liên tục mở trọng số của chúng và bắt đầu cạnh tranh qua lại với các mô hình nguồn đóng từ Mỹ.
Nhưng càng có nhiều mô hình, tôi càng quan tâm đến một câu hỏi cụ thể: liệu các mô hình này có thể không chỉ dừng lại ở các trang web và API, mà thực sự được cài đặt vào máy tính của chúng ta, kết nối với các tệp, công cụ và quy trình làm việc cục bộ hay không?
Mặc dù đơn giá của token API nhìn chung đang giảm, nhưng chi phí vẫn cao khi gặp các cuộc gọi tần suất cao và văn bản dài. Cùng với các vấn đề như quyền riêng tư, mạng và kiểm soát dữ liệu, triển khai cục bộ đang trở thành lựa chọn của ngày càng nhiều nhà phát triển và doanh nghiệp.
Vì vậy, lần này, tôi muốn chọn một mô hình có kích thước thách thức và đại diện cho việc triển khai một máy để chạy qua toàn bộ quy trình triển khai cục bộ hoàn chỉnh.
Nhân vật chính cuối cùng được chọn là Ling-3.0-flash, được mã nguồn mở bởi Ant Bailing—một mô hình Mixture of Experts (MoE) với tổng số tham số 124B. Tôi tình cờ có một NVIDIA DGX Spark trong tay, có thể chạy nó.
Không dài dòng nữa, hãy bắt đầu phần chính.

01 Giải Thích Thuật Ngữ Cơ Bản
Trước khi bắt đầu, hãy giới thiệu một số thuật ngữ liên quan đến mô hình để mọi người cùng nắm bắt ✌🏻
Độ Chính Xác của Mô Hình
Cùng một mô hình thường cung cấp các phiên bản có độ chính xác hoặc lượng tử hóa khác nhau, ảnh hưởng trực tiếp đến kích thước mô hình và ngưỡng chạy.

Lần này chúng tôi sử dụng phiên bản Ling INT4 chính thức, có kích thước khoảng 71,75GB.
Dense hay MoE

Lưu ý rằng 5,1B chỉ là số lượng tham số được kích hoạt cho mỗi lần suy luận; toàn bộ trọng số 124B vẫn cần được tải vào bộ nhớ.
Engine Suy Luận
Engine suy luận chịu trách nhiệm tải trọng số, quản lý ngữ cảnh và đồng thời, đồng thời cung cấp các giao diện. Nó là công cụ để chạy mô hình, không phải là bản thân mô hình.

Chúng tôi chọn vLLM lần này vì bản chuyển thể chính thức hiện tại hỗ trợ trọng số INT4 của Ling-3.0-flash và giải mã suy diễn MTP.
02 Cài Đặt và Triển Khai Mô Hình
Đầu tiên, hãy giới thiệu môi trường cài đặt: Tôi đang sử dụng NVIDIA DGX Spark, được trang bị chip GB10 và bộ nhớ hợp nhất 121,6GB, chạy Ubuntu 24.04 trên kiến trúc ARM64. Việc triển khai là Ling-3.0-flash-INT4 và các bài kiểm tra thông lượng tiếp theo sẽ sử dụng Qwen 3.8-27B cục bộ làm tham chiếu.
Phiên bản chính thức cung cấp phiên bản cơ bản và các phiên bản có độ chính xác khác nhau như FP8, FP4 và INT4. Bạn có thể chọn theo phần cứng của mình.
Ngoài ra còn có Ling-3.0-tiny 8B và các phiên bản FP8, INT4 của nó. Người dùng có Mac thông thường hoặc một 4090 có thể ưu tiên dùng thử các phiên bản có độ chính xác thấp của Tiny.

Bước 1: Tải mô hình. Lần này tôi đã sử dụng phiên bản INT4 chính thức. Mục tải xuống 👇🏻
- Hugging Face: Ling-3.0-flash-int4
- ModelScope: Ling-3.0-flash-int4
Nếu truy cập Hugging Face bất tiện, bạn có thể tải xuống thủ công từ ModelScope. Sau khi tải xuống, có 24 mảnh safetensors, tổng cộng khoảng 71,75GB. Bạn cũng cần để lại dung lượng cho engine suy luận và KV Cache trong thời gian chạy.
Bước 2: Chuẩn bị môi trường. Kiến trúc BailingMoeV3 của Ling-3.0-flash khá mới. Tôi đã thử sử dụng GGUF với llama.cpp, nhưng nó báo lỗi unknown model architecture: 'bailingmoe3'. Vì vậy, lần này, tôi đã sử dụng trực tiếp nhánh vLLM được chuyển thể chính thức:
1pip install uv2uv venv ~/my_ling_env3source ~/my_ling_env/bin/activate45git clone -b ling_3_0 https://github.com/inclusionAI/vllm-ling-v3.git6cd vllm-ling-v37VLLM_USE_PRECOMPILED=1 uv pip install --editable . --torch-backend=auto
Bước 3: Khởi động dịch vụ suy luận. Thay thế đường dẫn mô hình bằng trọng số INT4 bạn đã tải xuống cục bộ:
1vllm serve /path/to/Ling-3.0-flash-int4 \2 --served-model-name ling-int4 \3 --host 127.0.0.1 \4 --port 30000 \5 --trust-remote-code \6 --max-model-len 16384 \7 --gpu-memory-utilization 0.8 \8 --max-num-seqs 8 \9 --reasoning-parser ling3 \10 --speculative-config '{"method":"bailing_hybrid_v3_mtp","num_speculative_tokens":1}'
⚠️
Vui lòng thay thế các đường dẫn trong lệnh bằng đường dẫn thực tế trên máy của bạn.
Ở đây, giới hạn ngữ cảnh được đặt thành 16K, đồng thời là 8 và tính năng giải mã suy diễn MTP được bật.
Lưu ý: MTP (Multi-Token Prediction) cho phép mô hình thử dự đoán nhiều token cùng một lúc. Các phần được dự đoán chính xác có thể được áp dụng trực tiếp, giảm số vòng tính toán để tạo token từng cái một và tăng tốc độ đầu ra.
Bước 4: Xác minh dịch vụ. Sau khi khởi động, hãy gửi một yêu cầu đơn giản:
1curl -s http://127.0.0.1:30000/v1/chat/completions \2 -H "Content-Type: application/json" \3 -d '{"model":"ling-int4",4 "messages":[{"role":"user","content":"Xin chào, hãy giới thiệu về bạn trong một câu."}],5 "stream":true}'
Terminal bắt đầu trả về nội dung dưới dạng luồng, cho thấy mô hình 124B này đang chạy cục bộ.

03 Kiểm Tra Hiệu Suất và Khả Năng của Mô Hình
- Thông Lượng Token Khi mô hình mới khởi động, tôi đã chạy một vòng kiểm tra bằng điểm chuẩn tích hợp của vLLM. Tất cả 20 yêu cầu đã được hoàn thành, với thông lượng đầu ra là 84,34 tok/s, tổng thông lượng token là 133,10 tok/s và tỷ lệ chấp nhận MTP là 67,35%.

Đầu ra nhật ký gốc 👇🏻
1============ Serving Benchmark Result ============2Successful requests: 203Failed requests: 04Request rate configured (RPS): 2.005Benchmark duration (s): 60.716Total input tokens: 29607Total generated tokens: 51208Request throughput (req/s): 0.339Output token throughput (tok/s): 84.3410Peak output token throughput (tok/s): 61.0011Peak concurrent requests: 20.0012Total token throughput (tok/s): 133.1013---------------Time to First Token----------------14Mean TTFT (ms): 19692.9815Median TTFT (ms): 18877.9916P99 TTFT (ms): 40039.0217-----Time per Output Token (excl. 1st token)------18Mean TPOT (ms): 44.6119Median TPOT (ms): 44.0920P99 TPOT (ms): 49.6821---------------Inter-token Latency----------------22Mean ITL (ms): 74.0923Median ITL (ms): 72.3924P99 ITL (ms): 280.7125---------------Speculative Decoding---------------26Acceptance rate (%): 67.3527Acceptance length: 1.6728Drafts: 305129Draft tokens: 305130Accepted tokens: 205531Per-position acceptance (%):32 Position 0: 67.3533==================================================
Sau đó, tôi đã thực hiện các bài kiểm tra đồng thời trên Ling và Qwen 3.8-27B cục bộ. Ở mức đồng thời 8, thông lượng tổng hợp của Ling là 141,38 tok/s, trong khi Qwen 3.8 là 32,61 tok/s, chênh lệch khoảng 4,34 lần trong vòng này.
🔥🔥🔥So Sánh Kiểm Tra Tải Ling-3.0-Flash Vs Qwen3.8-27B

Ling-3.0-flash

Qwen 3.8 -27B


Một số người có thể thắc mắc: tại sao đồng thời đơn của Ling chỉ là 34,77 tok/s, nhưng ở mức đồng thời 8 lại trở thành 141,38 tok/s? Những người bạn kỹ thuật cũng có thể hỏi liệu điểm đồng thời đơn này có chậm so với dữ liệu chính thức không.
Ở đây chúng ta cần giải thích phương pháp kiểm tra cụ thể và sự khác biệt về tốc độ do các phương pháp đánh giá khác nhau gây ra:
- Phương pháp kiểm tra và liên kết đầu cuối thực tế: Bài kiểm tra này sử dụng giao diện tương thích OpenAI cục bộ, kiểm tra tải thông qua các yêu cầu luồng HTTP, không phải là bài kiểm tra suy luận ngoại tuyến tách rời khỏi khung dịch vụ. Mỗi yêu cầu Ling sử dụng một lời nhắc văn bản dài khoảng 150 token, tạo ra tối đa 512 token. Thời gian bắt đầu từ yêu cầu HTTP của máy khách cho đến khi phản hồi luồng hoàn tất, do đó bao gồm các cuộc gọi HTTP cục bộ, lập lịch dịch vụ, xử lý Tokenizer, Prefill, giải mã từng token và trả về luồng.
- Tốc độ đầu ra một luồng so với thông lượng tổng hợp của máy: Tốc độ một luồng (trải nghiệm người dùng thực tế): Ở $c=1$, tốc độ đầu ra đầu cuối là khoảng 35,34 tok/s (các bài kiểm tra hội thoại đơn thực tế ở mức 38+ tok/s), tương đương với hơn 35 ký tự tiếng Trung mỗi giây, cực kỳ nhanh về mặt thị giác; Thông lượng tổng hợp (tổng đầu ra dưới sự đồng thời): Khi đồng thời tăng lên, vLLM sử dụng Continuous Batching để kết hợp nhiều yêu cầu vào các tính toán GPU, tận dụng tối đa băng thông bộ nhớ hợp nhất của Blackwell. Ở mức đồng thời 8, thông lượng tổng hợp của máy tăng vọt lên 141,38 tok/s.
Về lý do tại sao nó khác với một số điểm chuẩn chính thức, chìa khóa nằm ở tiêu chí kiểm tra. Độ chính xác của mô hình, engine suy luận, độ dài ngữ cảnh, số lượng token đầu vào/đầu ra, quy mô đồng thời và việc sử dụng suy luận ngoại tuyến hay dịch vụ HTTP đều ảnh hưởng đến kết quả cuối cùng. Chỉ khi các điều kiện này về cơ bản nhất quán thì các con số mới phù hợp để so sánh trực tiếp.
Nói một cách đơn giản: Tốc độ thay đổi do phương pháp đánh giá—nếu được kiểm tra ở mức đồng thời cực cao (như 32/64) hoặc môi trường tính toán thuần túy không có giao thức mạng, tổng số thông lượng sẽ cao hơn; trong các cuộc gọi hội thoại hoặc mã hóa sản xuất hàng ngày của chúng ta, tốc độ một luồng 35+ tok/s và độ trễ token đầu tiên dưới 220ms của Ling đã mang lại cảm giác cực kỳ mượt mà và không bị lag.
Ở mức đồng thời đơn, tốc độ một luồng trung bình của Ling là khoảng 35,34 tok/s; ở mức đồng thời 8, thông lượng tổng hợp đạt 141,38 tok/s. Thông lượng tổng hợp của Qwen3.8 ở mức đồng thời 8 là 32,61 tok/s. Trong vòng này, lợi thế của Ling chủ yếu thể hiện ở tốc độ đầu ra và thông lượng đồng thời, với các phản hồi nhanh hơn đáng kể khi sử dụng thực tế.
2. Khả Năng Thực Tế
Điểm chuẩn chỉ phản ánh một phần hiệu suất; khả năng sử dụng thực tế phụ thuộc vào hiệu suất của mô hình trên các vấn đề cụ thể. Tôi đã chọn ba hướng để kiểm tra đơn giản.
(1) Suy Luận Logic
Tôi đã chuẩn bị một biến thể của bài toán gà và thỏ, một bài toán rửa xe cổ điển và một bài toán máy rửa xe, chủ yếu để xem liệu nó có thể hiểu chính xác các điều kiện thay vì áp dụng một câu trả lời có vẻ quen thuộc hay không. Trong số đó, bài toán gà và thỏ bao gồm 4 con chim cơ khí có ba chân để phá vỡ các khuôn mẫu thông thường.

(2) Ranh Giới An Toàn: Tiếp theo, tôi đã kiểm tra phản ứng của nó đối với các hoạt động có rủi ro cao: liệu nó thực thi trực tiếp hay xác định rủi ro, xác nhận với người dùng và cung cấp các giải pháp thay thế an toàn hơn.

(3) Văn Bản Dài
Cuối cùng, một vòng kiểm tra văn bản dài. Tôi đã giấu thông tin quan trọng trong một ngữ cảnh dài để xem liệu nó có thể tìm và trả lời chính xác hay không, đồng thời quan sát tốc độ đầu ra và độ ổn định trong văn bản dài.

04 Từ API đến TUI, sau đó đến Gọi Công Cụ
Chúng tôi đã hoàn thành việc triển khai mô hình và kiểm tra khả năng, nhưng đối với người dùng thông thường, curl phù hợp hơn để xác minh giao diện hơn là sử dụng hàng ngày. Để trò chuyện với một mô hình cục bộ trong thời gian dài, cần có một giao diện tương tác thuận tiện hơn.
Vì vậy, trước tiên tôi đã tạo một TUI đơn giản, một giao diện trò chuyện chạy trong terminal. Nó không phải là phần mềm phức tạp; tôi đã nhờ AI viết một tập lệnh Python để đóng gói các cuộc gọi giao diện cục bộ, đầu ra luồng và lịch sử hội thoại, sau đó khởi động nó bằng một lệnh:
1python3 ling-3.0-chat.py
Bằng cách này, tôi không phải viết curl mỗi lần. Mở terminal và trò chuyện trực tiếp; câu trả lời được truyền vào và bạn có thể thấy TPS, TTFT và số lượng token. Tôi đã hoàn thành các bài kiểm tra khả năng trước đó trong giao diện này.
Tuy nhiên, tại thời điểm này, TUI chỉ là một công cụ trò chuyện văn bản mà không có khả năng gọi công cụ. Mô hình lớn giống như một "bộ não" chịu trách nhiệm suy nghĩ, nhưng nó không có "tay chân" để đọc tệp, thực thi lệnh hoặc biết trạng thái hiện tại của hệ thống.
Để cho phép nó gọi các khả năng của hệ thống, chúng ta cần thêm tính năng gọi công cụ. Nói một cách đơn giản, các thao tác như thực thi lệnh, đọc và ghi tệp được đóng gói dưới dạng công cụ. Mô hình trước tiên đánh giá nó cần thông tin gì, sau đó khởi tạo một tool use; tập lệnh Python thực thi nó và chuyển kết quả trở lại mô hình để xử lý thêm.
Ví dụ: ban đầu, khi tôi yêu cầu nó kiểm tra thông tin GPU của hệ thống, nó không biết mức sử dụng thực tế và chỉ có thể cho tôi biết cách kiểm tra. Sau khi thêm tính năng gọi công cụ, nó có thể tự thực thi các lệnh hệ thống và sắp xếp kết quả truy vấn trực tiếp trong TUI.
Dựa trên cùng một nguyên tắc, bạn có thể tiếp tục kết nối tìm kiếm Web, giao diện nội bộ doanh nghiệp, cơ sở dữ liệu, v.v. Các công cụ cụ thể có thể được mở rộng theo nhu cầu kinh doanh.

05 Kết Nối với Giao Diện Trực Quan
Đối với mục đích sử dụng cá nhân, một TUI với tính năng gọi công cụ thực sự là khá đủ. Để tiến xa hơn và đưa mô hình vào một môi trường làm việc Agent hoàn chỉnh hơn, bạn có thể kết nối với một khung agent như Harness.
Lần này tôi chọn DeepSeek Harness của Liang Sheng, không chỉ thêm một trang trò chuyện mà còn cung cấp quản lý ngữ cảnh, không gian làm việc, gọi công cụ, kiểm soát quyền và lập kế hoạch tác vụ, với một Web UI tích hợp. Nó sử dụng kiến trúc "mọi thứ đều là plugin", cho phép mở rộng chức năng trong tương lai.
Lưu ý rằng DeepSeek Harness vẫn đang trong giai đoạn xem trước dành cho nhà phát triển và cập nhật nhanh chóng, điều này có thể dẫn đến các thay đổi không tương thích. Có nhiều khung Agent nguồn mở khác; bạn có thể chọn theo nhu cầu của mình.
Quy trình kết nối không phức tạp: cốt lõi là thêm một dịch vụ mô hình tùy chỉnh và trỏ địa chỉ đến giao diện cục bộ do vLLM cung cấp. Ngoài việc cấu hình trong Web UI, bạn cũng có thể sửa đổi tệp cấu hình như hình dưới đây:
1llm-pi-ai:2 providers:3 ling:4 displayName: "Ling-3.0-flash (124B)"5 api: openai-completions6 baseURL: http://127.0.0.1:30000/v17 apiKeyEnv: OPENAI_API_KEY8 models:9 - id: ling-int410 name: Ling-3.0-flash (124B MoE)
Sau khi khởi động Web UI, hãy mở địa chỉ mặc định trong trình duyệt của bạn:
1http://localhost:3080
Bằng cách này, trò chuyện hàng ngày, lịch sử và chuyển đổi mô hình đều có thể được thực hiện trong DeepSeek Harness. Bản thân Harness cung cấp các thao tác tệp, thực thi lệnh và lập kế hoạch tác vụ, có thể được mở rộng thêm thông qua các plugin. Để biết cách sử dụng cụ thể và plugin của bên thứ ba, những người bạn quan tâm có thể tìm kiếm chúng.
Lưu ý rằng các công cụ tôi đã viết trong Python TUI sẽ không tự động di chuyển. Để sử dụng chúng trong Harness, chúng cần được tích hợp lại theo cơ chế plugin của nó. Dưới đây là hiệu quả tích hợp thực tế mà tôi đã tạo cho Ling; bạn có thể xem bản ghi.

06 Xây Dựng Quy Trình Làm Việc AI
Tại thời điểm này, liên kết mô hình đơn từ triển khai đến giao diện và gọi công cụ cho Ling-3.0-flash đã được thiết lập đầy đủ.
Tuy nhiên, trong các dự án thực tế, chúng ta thường không chỉ sử dụng một mô hình. Các mô hình khác nhau giỏi những việc khác nhau; kết hợp chúng thường tốt hơn là để một mô hình xử lý mọi thứ.
Lợi thế của Ling-3.0-flash là tốc độ xử lý văn bản và tạo văn bản, nhưng nó không hỗ trợ đầu vào đa phương thức gốc. Nếu một tác vụ yêu cầu hiểu hình ảnh hoặc video, bạn có thể kết nối một mô hình đa phương thức như Qwen3.8-27B; nếu bạn cần tạo video, bạn có thể kết nối MiniMax H3 mới được mã nguồn mở gần đây. Mỗi mô hình xử lý những gì nó giỏi nhất, chuyển kết quả cho mô hình tiếp theo.
Ví dụ: để xây dựng một quy trình làm việc tạo video, Ling trước tiên có thể hiểu yêu cầu, viết kịch bản và phân chia storyboard, sau đó mô hình đa phương thức kiểm tra tài liệu tham khảo và tính nhất quán về mặt hình ảnh, và cuối cùng, mô hình video tạo ra nó. Sau khi tạo, một vòng kiểm tra hình ảnh khác có thể được thực hiện để sửa đổi lời nhắc và tạo lại dựa trên kết quả:
1Yêu cầu và Tài liệu2→ Ling tạo kịch bản và storyboard3→ Mô hình đa phương thức kiểm tra tài liệu và yêu cầu hình ảnh4→ MiniMax H3 tạo video5→ Mô hình đa phương thức kiểm tra hình ảnh và tính liên tục6→ Ling điều chỉnh lời nhắc dựa trên phản hồi7→ Con người hoàn thành đánh giá cuối cùng
Video dưới đây cho thấy hiệu quả thực tế của các lời nhắc do Ling-3.0-flash tạo ra và sau đó được chuyển cho MiniMax H3 để tạo.

Khi quy trình này được cố định, bạn chỉ cần thay đổi yêu cầu và tài liệu để sử dụng lặp lại. Tuy nhiên, việc chạy đồng thời nhiều mô hình lớn cục bộ có yêu cầu rất cao về VRAM và bộ nhớ. Ling INT4 khoảng 72GB, Qwen3.8-27B BF16 khoảng 51,77GB, cộng với KV Cache và các mô hình video; thật khó để giữ tất cả chúng thường trực trên Spark này.
Trước khi triển khai thực tế, hãy chắc chắn tính toán xem mỗi mô hình cần bao nhiêu VRAM hoặc bộ nhớ hợp nhất. Khi tài nguyên không đủ, bạn có thể chuyển đổi mô hình từng bước, chọn phiên bản lượng tử hóa hoặc chia nhỏ mô hình trên nhiều thiết bị. Nhiều mô hình không còn chạy độc lập nữa mà cộng tác xung quanh cùng một tác vụ—đây là một quy trình làm việc AI đa mô hình thực sự có thể sử dụng được.
07 Suy Nghĩ Cuối Cùng
Từ triển khai mô hình, TUI và gọi công cụ đến quy trình làm việc đa mô hình, toàn bộ liên kết đã hoàn tất. Bài viết này nhằm mục đích chia sẻ một phương pháp có thể lặp lại hơn là một cấu hình cố định.
Các mô hình nguồn mở sẽ tiếp tục được cập nhật. Trong tương lai, cho dù bạn thay đổi mô hình, phiên bản lượng tử hóa hay engine suy luận, con đường từ tải trọng số và khởi động dịch vụ đến kết nối công cụ và quy trình làm việc sẽ không thay đổi nhiều.
Nếu điều kiện cho phép, tôi vẫn khuyên mọi người nên tự triển khai các mô hình cục bộ:
- Kiểm soát Dữ liệu: Các tệp, cuộc trò chuyện và dữ liệu kinh doanh vẫn nằm trên máy của bạn hoặc mạng nội bộ, với các quyền thư mục và lệnh do bạn hạn chế.
- Phù hợp với Sử dụng Tần suất Cao: Không cần tính chi phí token cho mỗi lần sử dụng, giảm sự phụ thuộc vào mạng và dịch vụ của bên thứ ba.
- Dễ dàng Tùy chỉnh: Các mô hình, độ chính xác lượng tử hóa, engine suy luận và công cụ đều có thể được điều chỉnh và các giao diện nội bộ và cơ sở dữ liệu có thể được kết nối.
Khi các mô hình nguồn mở ngày càng mạnh mẽ hơn, triển khai cục bộ sẽ trở thành lựa chọn của nhiều người hơn. Bạn có thể xây dựng các công cụ và quy trình làm việc dựa trên nhu cầu tác vụ, điều kiện thiết bị và ngân sách của mình. Tôi hy vọng mọi người có thể có Agent cục bộ của riêng mình trong tương lai, không phải nhìn chằm chằm vào mức tiêu thụ token mỗi lần, thực sự đạt được "Tự do Token" của riêng mình!
Tài Nguyên Liên Quan
- Hugging Face: Trọng số Ling-3.0-flash INT4
- ModelScope: Trọng số Ling-3.0-flash INT4
- Kho lưu trữ chuyển thể vLLM chính thức
📚 Tổng Kết Bài Viết Trước
- Hướng dẫn thực hành Hermes Agent: Từ lo lắng X đến tích lũy tự động
- Hướng dẫn chống rụng tóc cho lập trình viên
- Kết nối Hermes với iMessage
- Kết nối Hermes với X Premium
- Hướng dẫn toàn diện về Hermes Agent
- Hướng dẫn giới thiệu Hermes Agent: Mô hình phụ trợ
- Hướng dẫn giới thiệu Hermes Agent
- Hướng dẫn nâng cao Hermes Agent
- Hướng dẫn không đầy đủ về Hermes Agent
- Hướng dẫn đầy đủ về đăng ký Claude Pro tại Nigeria
- Hướng dẫn đăng ký Apple ID Nigeria
- Đăng ký ChatGPT Plus giá rẻ một nửa tại Thổ Nhĩ Kỳ
- Đăng ký Apple ID Mỹ
- Đăng ký Claude/ChatGPT/Gemini qua Alipay
- Hướng dẫn đầy đủ về triển khai LLM cục bộ trên Mac
- Kiểm tra chất lượng IP
- Tại sao Doubao không giới thiệu thương hiệu của bạn
- Cách giải thích với bà của bạn rằng những gì Doubao nói không đúng sự thật
Nếu điều này hữu ích, hãy theo dõi + đánh dấu + chia sẻ 👏🏻
Theo dõi @Lonely__MH để cập nhật liên tục các hướng dẫn thân thiện với người mới bắt đầu và thông tin chi tiết về công cụ AI.





