Hướng dẫn AI cho người mới bắt đầu: Giải thích 66 thuật ngữ AI phổ biến bằng ngôn ngữ đơn giản

@AdrianPunk115
TIẾNG TRUNG30 thg 8, 2026
137K
522
91
18
1.1K

TL;DR

Bài viết này phân tích 66 thuật ngữ AI phổ biến thành ngôn ngữ đời thường, giúp người mới bắt đầu dễ dàng nắm bắt các khái niệm như LLM, Agent, RAG và MCP.

Gần đây, tôi có gặp lại một số đồng nghiệp cũ và bạn bè ngoài đời. Biết tôi đang làm nội dung về AI, họ đều rất quan tâm, và những cuộc trò chuyện của chúng tôi thường xoay quanh AI một cách rất tự nhiên.

Nhưng khi trò chuyện, tôi nhận ra một vấn đề.

Tôi thường tự nhiên nhắc đến các thuật ngữ như Agent, Skill, MCP, cho rằng ai cũng đã từng nghe qua. Tuy nhiên, người đối diện thường ngập ngừng và hỏi: "Agent chính xác là gì vậy?" "Skill có nghĩa là gì?"

Lúc đó, tôi nhận ra mình đã rơi vào "lời nguyền kiến thức." Khi bạn nhìn và sử dụng một từ quá nhiều, bạn quên mất rằng lần đầu tiên thấy nó, bạn cũng đã từng bối rối.

Vài tháng trước, tôi cũng từng bị choáng ngợp bởi những từ viết tắt tiếng Anh này. Trong khoảng thời gian đó, tôi đã đăng "Kiến thức cơ bản về AI cho người mới bắt đầu mỗi ngày", học một từ mỗi ngày trong gần 30 ngày, lần lượt tìm hiểu một loạt các từ vựng AI thông dụng.

Gần đây, ngày càng có nhiều người hỏi, tôi quyết định làm cho nó hoàn chỉnh hơn.

Tôi đã tổng hợp 66 thuật ngữ AI mà tôi cho là tần suất cao và giải thích chúng bằng ngôn ngữ đơn giản. Với mỗi từ, tôi sẽ cho bạn biết: nó là gì, bạn sẽ gặp nó ở đâu, và tình huống thực tế nào giúp bạn dễ nhớ nhất.

Bạn không cần phải nhớ hết tất cả cùng một lúc. Chỉ cần đọc qua một lần để lần sau khi thấy LLM, RAG, Agent, MCP, API hay CLI, bạn ít nhất biết được vị trí của chúng trong thế giới AI.

Adrian Punk - inline image

I. Đầu tiên, hiểu về AI và Mô hình Lớn

Nhóm này giải đáp hai câu hỏi: AI là gì, và Mô hình Ngôn ngữ Lớn đang xử lý gì khi chúng nói? Khi bạn hiểu được bản đồ này, các thuật ngữ sau sẽ dễ dàng hơn nhiều.

AI là việc làm cho máy móc thực hiện các nhiệm vụ thường đòi hỏi sự hiểu biết, phán đoán, dự đoán hoặc sáng tạo của con người. Mở khóa khuôn mặt trên điện thoại, dự đoán giao thông trên bản đồ, đề xuất video trên các nền tảng và chatbot trả lời câu hỏi đều thuộc về AI. Đây là một thuật ngữ bao quát rộng; các công cụ trò chuyện chỉ là một loại ứng dụng.

Thuật toán là một tập hợp các bước rõ ràng để giải quyết một vấn đề, giống như một công thức nấu ăn. Công thức quy định cắt rau trước, sau đó làm nóng chảo, và cuối cùng là nêm nếm gia vị; thuật toán quy định máy tính đọc gì trước, so sánh như thế nào, và cuối cùng xuất ra gì. Nhiều thuật toán truyền thống không thể trò chuyện; thuật toán AI chỉ là một phần của họ thuật toán.

NLP là lĩnh vực kỹ thuật cho phép máy tính xử lý ngôn ngữ của con người. Dịch thuật, tóm tắt, tìm kiếm, chuyển giọng nói thành văn bản và trò chuyện đều liên quan đến nó. Khi bạn nhập một câu hỏi thông thường và AI hiểu được ý nghĩa chung và trả lời, nó đang sử dụng khả năng xử lý ngôn ngữ tự nhiên.

Adrian Punk - inline image

LLM là các mô hình ngôn ngữ được huấn luyện với lượng văn bản và tính toán khổng lồ, chuyên về hiểu và tạo văn bản. Các mô hình hoặc họ mô hình phổ biến bao gồm GPT của OpenAI, Claude của Anthropic, Gemini của Google, cũng như DeepSeek và Qwen. Điều quan trọng là phân biệt giữa sản phẩm và mô hình: ChatGPT là sản phẩm bạn mở ra và sử dụng, trong khi GPT là họ mô hình mà nó có thể gọi đến ở hậu trường.

SLM là các mô hình ngôn ngữ có kích thước nhỏ hơn và yêu cầu tính toán thấp hơn. Hiện tại, không có ranh giới tham số thống nhất trên toàn cầu. Các ví dụ phổ biến bao gồm dòng Phi của Microsoft và các phiên bản tham số nhỏ của các họ mô hình như Gemma và Qwen. Phạm vi kiến thức của chúng có thể hẹp hơn, nhưng đối với các tác vụ cố định như tóm tắt, phân loại hoặc trợ lý trên thiết bị, chúng có thể nhanh hơn, rẻ hơn và dễ chạy hơn trên điện thoại hoặc máy tính tiêu chuẩn.

Adrian Punk - inline image

Token là các khối nhỏ mà mô hình sử dụng khi đọc và viết văn bản. Chúng không hoàn toàn bằng một ký tự tiếng Trung, một từ tiếng Anh hay một dấu câu. Mô hình chia một câu thành nhiều token trước khi tính toán. Việc tính phí và dung lượng ngữ cảnh cũng thường được tính bằng token. Hãy coi chúng như những "khối xây dựng" mà AI sử dụng để xử lý văn bản.

Ngữ cảnh là tất cả thông tin AI hiện có thể tham khảo, bao gồm câu hỏi của bạn, cuộc đối thoại trước đó, tệp đã tải lên, quy tắc hệ thống và kết quả công cụ. Giống như một bác sĩ khám bệnh, cùng một câu nói "Tôi cảm thấy không khỏe" sẽ dẫn đến những chẩn đoán khác nhau tùy thuộc vào việc có thông tin về tuổi tác, triệu chứng và báo cáo xét nghiệm hay không. Ngữ cảnh cung cấp cho AI càng rõ ràng, câu trả lời của nó sẽ càng thực tế.

Cửa sổ ngữ cảnh là lượng thông tin tối đa mà một mô hình có thể xử lý cùng một lúc, thường được biểu thị bằng token. Nó giống như một cái bàn có kích thước giới hạn: có giới hạn về số lượng tài liệu có thể trải ra cùng một lúc. Khi nội dung vượt quá giới hạn này, hệ thống phải cắt bớt, tóm tắt, xử lý theo lô hoặc để thông tin trước đó thoát ra khỏi cửa sổ.

Độ dài ngữ cảnh thường có hai nghĩa: số token tối đa mà mô hình cho phép hoặc số token thực tế được sử dụng trong một yêu cầu cụ thể. Cái trước giống như diện tích tối đa của bàn; cái sau giống như các tài liệu bạn thực sự trải ra lần này. Khi các sản phẩm quảng cáo "ngữ cảnh siêu dài", chúng thường đề cập đến dung lượng tối đa.

Adrian Punk - inline image

MLLM có thể xử lý thông tin ngoài văn bản, chẳng hạn như hình ảnh, âm thanh hoặc video. Nếu bạn đưa cho nó một bức ảnh tủ lạnh, nó có thể nhìn thấy các nguyên liệu và đề xuất bữa tối dựa trên yêu cầu văn bản; nếu bạn tải lên một bản ghi âm cuộc họp, nó có thể sắp xếp các điểm chính sau khi nghe. "Đa phương thức" ở đây đề cập đến nhiều dạng thông tin.

VLM kết nối cụ thể thị giác và ngôn ngữ, chủ yếu xử lý các tác vụ như "nhìn vào một bức tranh và hiểu hoặc trả lời bằng văn bản". Nó có thể viết chú thích cho ảnh, xác định nội dung biểu đồ hoặc tìm nút dựa trên ảnh chụp màn hình. VLM nhấn mạnh sự phối hợp của thị giác và ngôn ngữ, và phạm vi của nó thường cụ thể hơn thuật ngữ mô hình đa phương thức chung.

MoE sắp xếp nhiều bộ "chuyên gia" bên trong mô hình, chỉ để một phần trong số chúng tham gia tính toán mỗi lần. Nó giống như phân loại bệnh nhân ở bệnh viện: vấn đề về da đến khoa da liễu, chấn thương xương đến khoa chỉnh hình, thay vì tất cả các bác sĩ cùng hội chẩn một lúc. Điều này mở rộng khả năng của mô hình trong khi kiểm soát lượng tính toán cần thiết cho mỗi lần chạy.

Adrian Punk - inline image

Sau khi đọc nhóm này, bạn chỉ cần phân biệt: LLM chủ yếu xử lý ngôn ngữ, VLM kết nối hình ảnh và ngôn ngữ, và MLLM có thể xử lý nhiều loại thông tin. Token là các khối văn bản, và Ngữ cảnh là tài liệu mô hình có thể tham khảo lần này.

II. Các Thuật ngữ Phổ biến Nhất Khi Trò chuyện với AI

Nhóm này được sử dụng hàng ngày. Prompt chịu trách nhiệm giao nhiệm vụ, ngữ cảnh cung cấp tài liệu và AI tạo ra câu trả lời dựa trên thông tin này.

Prompt là toàn bộ đầu vào bạn đưa cho AI, có thể là một câu, một câu hỏi, một tài liệu hoặc một hình ảnh. "Tóm tắt hợp đồng này thành năm rủi ro" là một prompt. Prompt không cần phải được viết như thần chú; miễn là mục tiêu, tài liệu, ràng buộc và yêu cầu đầu ra rõ ràng, AI có nhiều khả năng làm đúng hơn.

Kỹ thuật Prompt là phương pháp thiết kế, thử nghiệm và cải thiện prompt. Nó giống như giao việc cho một đồng nghiệp: nếu kết quả đầu tiên sai, bạn kiểm tra xem nhiệm vụ đã rõ ràng chưa, tài liệu đã đầy đủ chưa và định dạng đã được chỉ định chưa, sau đó điều chỉnh hướng dẫn. Giá trị của nó nằm ở việc giảm lỗi giao tiếp và làm lại.

System Prompt là một tập hợp các quy tắc ưu tiên cao được thiết lập ở hậu trường trong một ứng dụng AI để xác định danh tính, giọng điệu, phạm vi khả năng và ranh giới an toàn. Nó giống như sổ tay nhân viên của một công ty; người dùng thường không thấy hết tất cả. Nếu yêu cầu của bạn xung đột với quy tắc hệ thống, mô hình thường sẽ ưu tiên system prompt.

User Prompt là yêu cầu hiện tại do người dùng nhập - nội dung bạn gửi trong hộp trò chuyện. System prompt giống như quy tắc vận hành của cửa hàng, trong khi user prompt giống như "Làm ơn cho tôi một đồ uống nóng ít đường." Cả hai đều ảnh hưởng đến kết quả, đó là lý do tại sao cùng một câu trong các sản phẩm AI khác nhau có thể đưa ra câu trả lời khác nhau.

Instruction là một hành động rõ ràng bạn yêu cầu AI thực hiện trong một prompt, chẳng hạn như tóm tắt, dịch, so sánh, phân loại hoặc kiểm tra. Một prompt hoàn chỉnh cũng có thể bao gồm thông tin cơ bản và các ràng buộc. Ví dụ: "Đọc email dưới đây, trích xuất ngày tháng và không thêm thông tin không có trong văn bản gốc" chứa hai instructions.

Adrian Punk - inline image

Markdown là một định dạng để sắp chữ văn bản bằng các ký hiệu đơn giản.

  • # có thể đại diện cho tiêu đề,
  • - có thể đại diện cho danh sách,
  • \\văn bản\\ có thể đại diện cho in đậm.

Nhiều đầu ra của AI trông có lớp lang rõ ràng vì chúng sử dụng Markdown; bạn sẽ thường gặp nó khi viết bài báo, tài liệu hoặc mô tả dự án.

JSON là một định dạng dữ liệu có cấu trúc thường được sử dụng bởi các chương trình, thường bao gồm dấu ngoặc nhọn, tên trường và nội dung tương ứng. Nó giống như một bảng tính điện tử với các trường cố định mà con người có thể đọc và các chương trình có thể dễ dàng xử lý. Yêu cầu AI "xuất ra JSON" thường là để cho một phần mềm khác tự động sử dụng kết quả.

Adrian Punk - inline image

Lịch sử hội thoại đề cập đến các tin nhắn đã xuất hiện trước đó trong cuộc trò chuyện hiện tại. AI có thể tiếp tục một chủ đề từ năm phút trước thường là do ứng dụng gửi lại các bản ghi trò chuyện trước đó cho mô hình. Sau khi một cuộc trò chuyện trở nên quá dài, nội dung ban đầu có thể bị cắt bớt hoặc tóm tắt, vì vậy AI đôi khi quên những gì bạn đã nói lúc đầu.

Ảo giác là khi AI tạo ra nội dung nghe có vẻ hợp lý nhưng thực tế là sai hoặc không tồn tại, chẳng hạn như bịa ra tên sách, liên kết, dữ liệu hoặc kinh nghiệm cá nhân. Nó giống như một người có kỹ năng ngôn ngữ tốt nhưng không chịu thừa nhận mình "không biết" và tự điền vào chỗ trống. Luôn kiểm tra các nguồn gốc cho ngày tháng, số liệu, trích dẫn và các quyết định quan trọng.

Adrian Punk - inline image

Điều quan trọng nhất cần nhớ từ nhóm này: Prompt quyết định cách bạn hỏi, Ngữ cảnh quyết định AI có thể tham khảo những gì, và Ảo giác nhắc nhở bạn rằng câu trả lời vẫn cần được xác minh.

III. Để AI Đọc Dữ liệu: RAG và Tìm kiếm

Khi bạn thấy "để AI đọc tệp công ty" hoặc "xây dựng kiến thức cá nhân", bạn có thể sẽ gặp nhóm từ này. Toàn bộ đường đi chỉ là một câu: tìm tài liệu liên quan trước, sau đó để mô hình trả lời.

RAG cho phép AI tìm kiếm nội dung liên quan từ các tài liệu được chỉ định trước khi trả lời, sau đó chuyển các đoạn tìm được cho mô hình để sắp xếp câu trả lời. Nó giống như một kỳ thi mở sách: học sinh lật sách giáo khoa trước, sau đó trả lời dựa trên đó. RAG có thể giảm bịa đặt, nhưng nó cũng có thể tìm sai tài liệu, vì vậy các trích dẫn vẫn cần được kiểm tra bởi con người.

Kiến thức là một tập hợp các tài liệu được lưu trữ tập trung, sắp xếp và sẵn sàng cho hệ thống truy vấn. Sách hướng dẫn sản phẩm, tài liệu chính sách và câu hỏi thường gặp của một công ty có thể trở thành kiến thức dịch vụ khách hàng; ghi chú, bài báo và hồ sơ đọc của một người cũng có thể tạo thành kiến thức. Tài liệu có chính xác và được cập nhật hay không ảnh hưởng trực tiếp đến chất lượng câu trả lời.

Truy xuất là tìm nội dung phù hợp nhất từ một lượng lớn tài liệu. Một thủ thư nghe câu hỏi của bạn và mang ba cuốn sách phù hợp nhất từ hàng ngàn cuốn sách là truy xuất. Trong RAG, mô hình thường không đọc toàn bộ cơ sở dữ liệu trước mà truy xuất một vài đoạn để trả lời.

Adrian Punk - inline image

Tìm kiếm từ khóa chủ yếu tìm kiếm xem một số từ nhất định có xuất hiện trực tiếp hay không. Nếu bạn tìm kiếm "hạn chót hoàn tiền", nó sẽ ưu tiên tìm nội dung có chứa "hoàn tiền" và "hạn chót". Phương pháp này nhanh và tốt để kiểm tra mã sản phẩm, tên và các thuật ngữ cố định; nó có thể bỏ sót câu trả lời nếu cách đặt câu hỏi và cách diễn đạt gốc khác nhau đáng kể.

Tìm kiếm ngữ nghĩa tập trung nhiều hơn vào việc liệu ý nghĩa của hai đoạn văn có gần nhau hay không. Nếu bạn tìm kiếm "Tôi không muốn cái này nữa, làm thế nào để trả lại", nó cũng có thể tìm thấy một tài liệu có tiêu đề "Chính sách hoàn trả". Nó phù hợp cho các câu hỏi ngôn ngữ tự nhiên, nhưng sự hiểu biết có thể bị sai lệch, vì vậy các tình huống quan trọng thường kết hợp nó với tìm kiếm từ khóa.

Tìm kiếm kết hợp sử dụng cả tìm kiếm từ khóa và tìm kiếm ngữ nghĩa. Số ID và số hợp đồng phù hợp với đối sánh chính xác; "làm thế nào để xin hoàn tiền" cần hiểu ý nghĩa. Kết quả từ cả hai được hợp nhất và xếp hạng, tính đến cả sự nhất quán theo nghĩa đen và ý nghĩa tương tự, một phương pháp mà nhiều hệ thống RAG áp dụng.

Adrian Punk - inline image

IV. Agent, Công cụ và MCP

Đây là nhóm từ phổ biến nhất và thường gây nhầm lẫn nhất gần đây. Agent, Skill và MCP, những thứ tôi đã đề cập nhiều nhất khi trò chuyện với bạn bè, đều nằm trong chương này.

Trước hết, hãy nhìn vào con đường ngắn nhất:

text
1Bạn đề xuất một mục tiêu
2→ Agent quyết định bước tiếp theo
3→ Gọi công cụ để đọc dữ liệu hoặc thực hiện hành động
4→ Tiếp tục xử lý dựa trên kết quả
5→ Con người kiểm tra các bước chính

Chatbot là phần mềm chủ yếu trả lời câu hỏi thông qua đối thoại. Các chatbot ban đầu có thể chỉ trả lời dựa trên các từ khóa cố định; hiện nay nhiều chatbot kết nối với các mô hình lớn để có câu trả lời tự nhiên hơn. Trọng tâm của nó vẫn là "bạn hỏi, nó trả lời", và nó thường không độc lập hoàn thành một chuỗi dài các thao tác bên ngoài.

AI Assistant hoặc Copilot là một sản phẩm AI giúp mọi người hoàn thành nhiệm vụ, chẳng hạn như hỗ trợ viết lách, sắp xếp cuộc họp, tạo bảng tính hoặc lập trình. Phép ẩn dụ "copilot" rất dễ nhớ: nó có thể quan sát, nhắc nhở và giúp đỡ, nhưng vô lăng vẫn nằm trong tay con người và kết quả cuối cùng cần con người kiểm tra.

Adrian Punk - inline image

Workflow là một tập hợp các bước cố định được sắp xếp trước. Sau khi nhận được hóa đơn, xác định số tiền trước, sau đó ghi vào bảng và cuối cùng thông báo cho bộ phận tài chính là một workflow. Mỗi bước thường được xác định trước, làm cho nó ổn định và dễ kiểm tra; nó sẽ không linh hoạt quyết định bước tiếp theo như Agent khi gặp các tình huống không có kế hoạch.

AI Agent là một hệ thống có thể quyết định bước tiếp theo xoay quanh một mục tiêu, gọi công cụ, quan sát kết quả và tiếp tục hành động. Một cuộc trò chuyện thông thường sẽ cho bạn biết cách mua vé; một Agent có thể mở dịch vụ đặt vé, truy vấn chuyến bay và điền thông tin trong phạm vi được ủy quyền. Nó có thể hành động, vì vậy quyền hạn, lỗi và xác nhận của con người là rất quan trọng.

Adrian Punk - inline image

AI Agentic đề cập đến một lớp hệ thống hoặc phương pháp thiết kế nhấn mạnh khả năng của AI trong việc lập kế hoạch liên tục, sử dụng công cụ và thực hiện các tác vụ đa bước. Phạm vi của thuật ngữ này rộng và các công ty khác nhau sử dụng các tên gọi khác nhau. Khi bạn thấy một sản phẩm được dán nhãn "Agentic", bạn có thể tiếp tục hỏi ba điều: nó có thể sử dụng những công cụ nào, nó có thể tự thực hiện bao nhiêu bước và ở đâu con người phải xác nhận.

Tính tự chủ đề cập đến mức độ mà một hệ thống có thể tự quyết định và hành động mà không cần sự chỉ đạo từng bước của con người. Tự động sắp xếp một bản sao của tệp có tính tự chủ và rủi ro thấp; tự động gửi email, thực hiện thanh toán hoặc xóa dữ liệu làm tăng đáng kể rủi ro. Nhiệm vụ càng quan trọng, quyền hạn càng nên được thu hẹp và thêm các điểm xác nhận.

Lập kế hoạch là chia một mục tiêu thành các bước có thể được thực hiện theo trình tự. Giống như chuẩn bị cho một chuyến đi, trước tiên xác nhận ngày tháng, sau đó kiểm tra phương tiện di chuyển, đặt chỗ ở và lập danh sách những thứ cần mang theo. Các Agent cũng lập kế hoạch khi gặp các nhiệm vụ phức tạp; một kế hoạch đẹp không đảm bảo thực hiện thành công và mỗi bước hoàn thành cần kiểm tra kết quả thực tế.

Công cụ là một khả năng bên ngoài mà AI có thể gọi, chẳng hạn như tìm kiếm web, máy tính, cơ sở dữ liệu, lịch và email. Bản thân mô hình giống như bộ não chịu trách nhiệm phán đoán; các công cụ cung cấp cho nó tay và mắt. Nếu không có công cụ, mô hình chỉ có thể trả lời dựa trên ngữ cảnh hiện có; sau khi kết nối với các công cụ, nó có cơ hội truy vấn và hành động.

Gọi công cụ là khi mô hình chọn một công cụ theo các định dạng được chỉ định và điền vào các tham số cần thiết, sau đó chương trình thực thi và trả kết quả cho mô hình. Nó giống như một người quản lý điền vào một phiếu công việc cho một nhân viên để thực hiện. Mô hình chịu trách nhiệm phán đoán "gọi cái gì" và mã cụ thể chịu trách nhiệm hoàn thành việc truy vấn, tính toán hoặc ghi chép.

Adrian Punk - inline image

Plugin là một gói mở rộng được cài đặt vào phần mềm để thêm chức năng. Trình duyệt có thể dịch các trang web sau khi cài đặt plugin dịch thuật; một ứng dụng AI có thể kết nối với các tệp, lịch hoặc dịch vụ của bên thứ ba sau khi cài đặt plugin. Plugin thường phụ thuộc vào các sản phẩm cụ thể và những gì chúng có thể làm phụ thuộc vào các giao diện và quyền hạn do sản phẩm cung cấp.

Skill là một tập hợp các hướng dẫn, tập lệnh và tài nguyên có thể tái sử dụng dạy một Agent cách hoàn thành một loại nhiệm vụ nhất định một cách ổn định. Nó giống như một sổ tay hướng dẫn vận hành tiêu chuẩn cho một nhân viên: đọc tài liệu nào trước, làm theo các bước nào và cách kiểm tra kết quả đều được viết rõ ràng. Một prompt thường giải quyết một tác vụ một lần, trong khi một Skill phù hợp hơn để thực hiện lặp lại cùng một loại công việc.

MCP là một giao thức mở cho phép các ứng dụng AI kết nối với dữ liệu và công cụ bên ngoài. Phép ẩn dụ tốt nhất là USB-C của thế giới AI: trước đây, mọi công cụ đều phải được điều chỉnh riêng lẻ; bây giờ chúng có thể cung cấp khả năng theo cùng một tiêu chuẩn kết nối. Nó giải quyết "cách kết nối", nhưng không quyết định mục tiêu nhiệm vụ cho Agent.

MCP Host là ứng dụng AI mà người dùng thực sự sử dụng, chẳng hạn như trợ lý máy tính để bàn, trình soạn thảo mã hoặc nền tảng Agent. Nó chịu trách nhiệm quản lý người dùng, mô hình, quyền bảo mật và nhiều kết nối. Hãy coi Host như một máy tính: nó là toàn bộ môi trường sử dụng và là nơi MCP Client cư trú.

MCP Client nằm bên trong Host và chịu trách nhiệm thiết lập và duy trì giao tiếp với một MCP Server cụ thể. Nó khám phá những công cụ và tài liệu mà Server cung cấp và gửi các yêu cầu gọi. Giống như một máy tính kết nối với máy in, cần có một kênh giao tiếp chuyên dụng bên trong để quản lý kết nối này.

MCP Server là một chương trình cung cấp các công cụ, tài liệu hoặc mẫu prompt cho các ứng dụng AI theo đặc tả MCP. Có từ "Server" trong tên không có nghĩa là nó phải ở xa; nó cũng có thể chạy trên máy tính của bạn. Ví dụ: một Server tệp cục bộ có thể cho phép AI đọc các tệp trong các thư mục được ủy quyền.

Adrian Punk - inline image

MCP Tool là một hành động cụ thể mà Server cung cấp để AI yêu cầu thực thi, chẳng hạn như truy vấn thời tiết, tạo lịch trình, đọc cơ sở dữ liệu hoặc gửi tin nhắn. Mỗi Tool chỉ định các tham số cần thiết. Các hành động truy vấn có rủi ro thấp hơn, trong khi gửi, xóa hoặc thanh toán cần có quyền hạn và xác nhận rõ ràng.

MCP Resource là nội dung được cung cấp thông qua MCP để AI đọc, chẳng hạn như tệp, bản ghi cơ sở dữ liệu, cấu trúc dự án hoặc trạng thái ứng dụng. Nó giống như các tài liệu được đặt trên bàn, trong khi một Tool giống như một nút có thể nhấn. Việc một resource có thể được đọc hay không vẫn phụ thuộc vào quyền truy cập do Host và Server đặt ra.

MCP Prompt là một mẫu prompt có thể tái sử dụng do Server cung cấp để giúp người dùng bắt đầu các tác vụ một cách cố định. Nó giống như một mẫu bảng được cài đặt sẵn, sắp xếp các trường và cấu trúc nhiệm vụ cần điền. Nó không tự động thực hiện các hành động; nó vẫn cần được người dùng chọn và xử lý bởi mô hình.

Adrian Punk - inline image

Bộ nhớ là thông tin mà hệ thống lưu lại và sử dụng sau này, có thể bao gồm tóm tắt trò chuyện hiện tại, sở thích của người dùng, nhiệm vụ lịch sử và dữ liệu dài hạn. Khi AI "nhớ bạn", điều đó thường có nghĩa là thông tin này được lưu trữ và cung cấp lại cho mô hình trong các cuộc đối thoại tiếp theo. Bộ nhớ ảnh hưởng đến trải nghiệm và cũng cần chú ý đến quyền riêng tư và phương pháp xóa.

Adrian Punk - inline image

Human in the loop có nghĩa là các bước chính phải được kiểm tra, lựa chọn hoặc phê duyệt bởi một người. AI có thể sắp xếp danh sách hoàn tiền và điền dự thảo, nhưng việc chuyển tiền thực tế được xác nhận bởi bộ phận tài chính. Điều này tận dụng tốc độ của AI đồng thời tránh các hậu quả không thể khắc phục do thông tin không đầy đủ hoặc phán đoán sai.

Adrian Punk - inline image

Multi-agent là cho phép nhiều Agent cộng tác, ví dụ: một Agent truy xuất dữ liệu, một Agent viết bài và một Agent kiểm tra trích dẫn. Nó giống như một nhóm dự án; khi phân công lao động hợp lý, nó có thể xử lý các nhiệm vụ phức tạp song song. Tuy nhiên, nhiều thành viên hơn cũng làm tăng giao tiếp, công việc trùng lặp và lan truyền lỗi, vì vậy nhiều Agent hơn không phải lúc nào cũng tốt hơn.

A2A đề cập đến phương thức giao tiếp giữa các Agent để trao đổi nhiệm vụ, trạng thái và kết quả. MCP tập trung nhiều hơn vào cách các Agent kết nối với các công cụ và dữ liệu, trong khi A2A tập trung nhiều hơn vào cách một Agent giao nhiệm vụ cho một Agent khác. Hãy nghĩ về cái trước như "kết nối thiết bị" và cái sau như "bàn giao công việc giữa các đồng nghiệp."

Adrian Punk - inline image

Computer Use là để AI vận hành phần mềm bằng cách quan sát màn hình, di chuyển chuột, nhấp và gõ phím. Nó giống như một người vận hành từ xa, người có thể sử dụng các ứng dụng web và máy tính để bàn mà không cần API chuyên dụng. Các thay đổi giao diện có thể khiến nó nhấp nhầm chỗ; xác nhận của con người là bắt buộc đối với các khoản thanh toán, xóa và tin nhắn gửi đi.

Sandbox là một môi trường biệt lập giới hạn phạm vi hoạt động của một chương trình. Nó giống như một hố cát có rào chắn để trẻ em chơi; chúng có thể thử nghiệm mọi thứ, và nếu có sự cố, nó sẽ không ảnh hưởng đến các tệp quan trọng hoặc hệ thống. Khi để một Agent chạy mã, tải xuống tệp hoặc sửa đổi dự án, sandbox làm giảm phạm vi ảnh hưởng nhưng không thể thay thế tất cả các kiểm tra bảo mật.

Adrian Punk - inline image

Chỉ cần nhớ một câu cho chương này: Agent chịu trách nhiệm quyết định và hành động, Tool cung cấp khả năng cụ thể, Skill dạy nó cách thực hiện, và MCP chịu trách nhiệm kết nối AI với các khả năng bên ngoài.

V. Các Thuật ngữ Máy tính Bạn Sẽ Gặp trong Hướng dẫn AI

Những từ này không phải do lĩnh vực AI phát minh ra, nhưng chúng thường xuất hiện khi bạn học về Agent, tự động hóa và các mô hình cục bộ. Nếu bạn hiểu chúng, nhiều hướng dẫn sẽ không còn cảm giác như tiếng nước ngoài.

API là một điểm đầu vào để phần mềm giao tiếp theo một thỏa thuận. Bạn không cần phải đột nhập vào bếp của nhà hàng; bạn chỉ cần gọi món qua người phục vụ. API giống như người phục vụ của thế giới phần mềm, mang yêu cầu của bạn đến phần phụ trợ và mang lại kết quả. Các ứng dụng thời tiết, dịch vụ thanh toán và mô hình lớn đều có thể được các chương trình khác gọi thông qua API.

API Key là một thông tin xác thực bí mật được sử dụng khi một chương trình truy cập dịch vụ, được sử dụng để xác định ai đang gọi và thường được kết nối với giới hạn sử dụng và tính phí. Nó giống như mã PIN thẻ ngân hàng; bất kỳ ai có được nó đều có thể tiêu thụ hạn mức của bạn. Không đặt Key đầy đủ trong mã công khai, ảnh chụp màn hình, hướng dẫn hoặc nhóm trò chuyện.

SDK là một tập hợp mã, hướng dẫn, ví dụ và công cụ thường được sử dụng khi phát triển ứng dụng cho một nền tảng. Trong khi API cho bạn biết "cách gọi món", SDK chuẩn bị thực đơn, dụng cụ và các món ăn mẫu, giúp các nhà phát triển không phải viết nhiều mã cơ bản. Các ngôn ngữ lập trình khác nhau thường có SDK riêng của chúng.

Adrian Punk - inline image

CLI là một giao diện để vận hành máy tính bằng cách gõ các lệnh văn bản. Giao diện đồ họa cho phép bạn nhấp vào "Thư mục mới", trong khi CLI cho phép bạn gõ một dòng lệnh để làm điều tương tự. Nó trông giống như một cửa sổ đen, nhưng thực ra nó chỉ là một cách vận hành khác; việc cài đặt và chạy các công cụ mã nguồn mở AI thường sử dụng CLI.

Một terminal là cửa sổ nơi các lệnh được hiển thị và nhập vào, chẳng hạn như "Terminal" trên Mac hoặc Windows Terminal. Hãy nghĩ về nó như một cửa sổ trò chuyện giữa bạn và máy tính, nơi các lệnh CLI là những tin nhắn được gửi đến máy tính. Terminal là cửa sổ, CLI là phương thức thao tác thông qua văn bản; cả hai thường xuất hiện cùng nhau.

Adrian Punk - inline image

Một repository, thường được gọi tắt là Repo, là nơi lưu trữ tập trung các tệp dự án và lịch sử sửa đổi. Nó giống như một thư mục dự án có ghi chép phiên bản, nơi có thể đặt mã, hướng dẫn, hình ảnh và cấu hình. Khi ai đó nói "clone Repo", thường có nghĩa là sao chép dự án này cùng lịch sử của nó vào máy tính của bạn.

Git là một công cụ ghi lại các thay đổi trong phiên bản tệp. Nó có thể cho bạn biết nội dung nào đã được sửa đổi và bởi ai, đồng thời có thể giữ các phiên bản từ những giai đoạn khác nhau. Nó giống như việc lưu từng bản sửa khi viết một bài báo, nhưng có hệ thống hơn. Git hoạt động cục bộ và không cần phải trực tuyến mọi lúc, và nó không giống với GitHub.

GitHub là một trang web lưu trữ các Git repository và hỗ trợ cộng tác nhiều người. Các nhà phát triển đăng tải mã, viết hướng dẫn, báo cáo vấn đề và cùng nhau sửa đổi dự án trên đó. Git là công cụ quản lý phiên bản, còn GitHub là nền tảng cung cấp dịch vụ lưu trữ trực tuyến và cộng tác; khi học các công cụ mã nguồn mở AI, bạn thường sẽ bắt đầu với một liên kết GitHub.

Adrian Punk - inline image

Đừng lo lắng khi lần đầu tiên bạn thấy CLI. Trước khi sao chép một lệnh, hãy kiểm tra xem nó có đọc, sửa đổi, xóa hoặc tải lên bất kỳ thứ gì không, và hãy thực hành với một bản sao khi liên quan đến các tệp quan trọng.

VI. Thuật Ngữ Thường Gặp Về Mô Hình Cục Bộ và Phần Cứng

Bạn chỉ cần xem xét kỹ nhóm từ này khi bạn đã sẵn sàng chạy các mô hình trên máy tính của riêng mình. Nếu bạn thường sử dụng các sản phẩm AI trực tuyến, chỉ cần biết ý nghĩa chung là đủ.

Triển khai cục bộ là chạy một mô hình hoặc chương trình trên máy tính, điện thoại hoặc máy công ty của riêng bạn. Dữ liệu đi qua ít dịch vụ bên ngoài hơn và có thể sử dụng ngoại tuyến; tuy nhiên, việc cài đặt, cập nhật, hiệu suất và bảo mật phải do bạn tự xử lý. Nó phù hợp với những người coi trọng quyền kiểm soát dữ liệu hoặc cần một môi trường cố định, nhưng không có nghĩa là nó tự nhiên an toàn tuyệt đối.

Cloud API là khi mô hình chạy trên máy chủ từ xa của nhà cung cấp dịch vụ và người dùng gửi yêu cầu và nhận kết quả qua mạng. Nó giống như đi ăn nhà hàng và gọi món; bạn không cần phải mua bếp và nguyên liệu, rất dễ bắt đầu; đồng thời, nó bị ảnh hưởng bởi mạng, giá cả, giới hạn cuộc gọi, quy tắc nền tảng và chính sách dữ liệu.

Mã nguồn mở thường có nghĩa là mã nguồn được công khai theo một giấy phép nhất định, cho phép người khác xem, sửa đổi và phân phối nó trong phạm vi được giấy phép cho phép. Tải xuống công khai không có nghĩa là nó có thể được sử dụng cho mục đích thương mại một cách tùy tiện; các giấy phép khác nhau có yêu cầu rất khác nhau. Khi bạn thấy "AI Mã nguồn mở", bạn vẫn cần xem phần nào của mã, dữ liệu và trọng số thực sự được mở.

Open weights (trọng số mở) có nghĩa là các tham số sau khi huấn luyện mô hình có thể được tải xuống, cho người dùng cơ hội chạy hoặc điều chỉnh thêm trên thiết bị của riêng họ. Dữ liệu huấn luyện, mã huấn luyện đầy đủ và quyền thương mại không nhất thiết phải được mở cùng lúc. Do đó, trọng số mở và mã nguồn mở hoàn toàn là hai việc khác nhau; cách chúng có thể được sử dụng cụ thể phụ thuộc vào giấy phép mô hình.

Adrian Punk - inline image

GPU vốn dĩ giỏi xử lý đồ họa và cũng rất phù hợp để hoàn thành đồng thời một lượng lớn các phép tính tương tự, vì vậy chúng được sử dụng rộng rãi để huấn luyện và chạy các mô hình AI. Nó giống như một nhóm lớn người có thể giải quyết vấn đề song song. Khi mua máy tính để chạy các mô hình cục bộ, model GPU và dung lượng VRAM thường quan trọng hơn so với các tình huống văn phòng thông thường.

VRAM là bộ nhớ tốc độ cao được GPU tự sử dụng, nơi các trọng số mô hình và dữ liệu trung gian cần được đặt trong quá trình hoạt động. Mô hình giống như một bộ khối xây dựng lớn, và VRAM giống như mặt bàn; nếu mặt bàn quá nhỏ, các khối sẽ không vừa, và mô hình có thể không tải được hoặc yêu cầu các phương pháp chậm hơn, tiết kiệm không gian hơn.

Adrian Punk - inline image

7B hoặc 70B trong tên mô hình thường đại diện cho khoảng 7 tỷ hoặc 70 tỷ tham số. Các tham số có thể được hiểu là số lượng nội bộ khổng lồ mà mô hình đã học được sau khi huấn luyện. Số lượng lớn hơn thường có nghĩa là cần nhiều bộ nhớ và tài nguyên tính toán hơn; nó không trực tiếp có nghĩa là khả năng mạnh hơn, vì chất lượng huấn luyện và các tác vụ cụ thể cũng quan trọng không kém.

VII. Nếu Bạn Chỉ Nhớ 10 Từ

Bạn không cần phải nhớ 66 từ. Sau khi đọc lần đầu, hãy nhớ 10 từ này trước:

  • AI: Làm cho máy móc xử lý các tác vụ đòi hỏi sự hiểu biết, đánh giá, dự đoán hoặc sáng tạo.
  • LLM: Mô hình lớn chịu trách nhiệm hiểu và tạo ra ngôn ngữ.
  • Token: Các phần nhỏ mà mô hình sử dụng khi đọc và viết văn bản.
  • Context: Thông tin mà mô hình có thể tham khảo trong lần này.
  • Prompt: Các yêu cầu và tài liệu bạn đưa cho AI.
  • Hallucination: AI làm cho nội dung sai trông có vẻ rất thật.
  • RAG: Truy xuất từ các tài liệu được chỉ định trước, sau đó tổ chức câu trả lời.
  • Agent: Một hệ thống có thể liên tục quyết định và hành động xoay quanh một mục tiêu.
  • MCP: Một giao thức mở kết nối AI với dữ liệu và công cụ bên ngoài.
  • CLI: Giao diện để vận hành máy tính thông qua các lệnh văn bản.

Vài tháng trước, tôi cũng bắt đầu bằng cách hiểu một từ mỗi ngày. Bạn không cần phải nhớ tất cả 66 từ ngay hôm nay; chỉ cần một bức tranh tổng thể xuất hiện trong tâm trí bạn lần tiếp theo bạn thấy Agent, Skill hoặc MCP, thì cuốn từ điển này đã hoàn thành mục đích của nó.

Trong tương lai, khi bạn gặp một từ viết tắt lạ, trước tiên hãy hỏi nó thuộc loại nào: Mô hình, Đối thoại, Dữ liệu, Agent, Giao diện hay Phần cứng? Nếu bạn có thể đặt từ đó vào sáu ngăn kéo này, hầu hết các bài viết về AI sẽ dễ đọc hơn nhiều.

Về Tác Giả

Adrian Punk - inline image
Viết lại trong YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Dành cho nhà sáng tạo

Biến Markdown của bạn thành bài viết 𝕏 gọn gàng

Khi bạn đăng bài viết dài của riêng mình, việc định dạng hình ảnh, bảng và khối mã cho 𝕏 rất mệt mỏi. YouMind biến cả bản nháp Markdown thành một bài viết 𝕏 gọn gàng, sẵn sàng để đăng.

Thử Markdown sang 𝕏

Thêm pattern để giải mã

Bài viết viral gần đây

Khám phá thêm bài viết viral