YouMind
Đăng nhập

Từ Tối đa hóa Token đến Quản lý Token

@fukkyy
TIẾNG NHẬT01 thg 6, 2026
293K
606
108
0
726

TL;DR

Khi kỷ nguyên sử dụng AI không giới hạn kết thúc, các công ty phải chuyển đổi từ Tối đa hóa Token sang Quản lý Token để đảm bảo ROI. Bài viết này khám phá cách chi phí AI đang trở thành một vấn đề quản lý quan trọng, tương đương với chi phí nhân sự và tiếp thị.

Hôm nay, chúng ta sẽ thảo luận về cách mà giai đoạn "Token Maxing"—tối đa hóa việc sử dụng token AI—đã đi hết một vòng tròn, và xu hướng hiện tại đang chuyển dịch sang "Token Management," vốn đặt ra câu hỏi về ROI của AI. Quản lý token giờ đây là một vấn đề quản trị quan trọng không kém gì việc hoạch định nhân sự hay quyết định đầu tư tiếp thị.

Ở nước ngoài, khái niệm "Token Management" này thường được thảo luận dưới góc nhìn kỹ thuật hơn là "Token Optimization." Để rõ ràng, tôi sẽ sử dụng thuật ngữ Token Management ở đây, nhưng hãy coi nó đồng nghĩa với Token Optimization.

Token Maxing và Phản Ứng Trái Chiều

福島良典 | LayerX - inline image

Trong năm qua, việc sử dụng AI tạo sinh đã ở trong một giai đoạn có thể gọi là "Token Maxing." Đó là việc tràn ngập các tác vụ bằng token, sử dụng các mô hình mạnh nhất liên tục, và đưa vào ngữ cảnh đến giới hạn tuyệt đối. Các nhà cung cấp AI cũng coi việc mở rộng sử dụng như một thước đo thành công, thực chất là trợ cấp thông qua các gói đăng ký giá cố định. Về phía người dùng, việc sử dụng mô hình mạnh nhất mà không lo về chi phí được xem là một lợi thế cạnh tranh.

Tuy nhiên, bước sang năm 2026, một phản ứng trái chiều rõ rệt đối với cấu trúc này đã bắt đầu xuất hiện.

Uber là một ví dụ điển hình. Công ty này đã thiết lập một bảng xếp hạng Claude Code nội bộ để các kỹ sư cạnh tranh về mức độ sử dụng, và kết quả là họ đã sử dụng hết ngân sách AI cho lập trình năm 2026 chỉ trong bốn tháng. Giám đốc Vận hành (COO) của Uber, Andrew Macdonald, đã đề cập trong một podcast:

"Từ bây giờ, chúng ta phải thảo luận về mức tiêu thụ token và chi phí liên quan của nó cùng với chi phí nhân công. Nếu chúng ta không thể vẽ ra một đường thẳng cho thấy các tính năng đến tay khách hàng tăng lên tương ứng với số tiền chúng ta chi tiêu, thì sự đánh đổi này thật khó để biện minh."

https://www.youtube.com/watch?v=y_mQ6xLcKyc&t=1776s

Những mối quan tâm tương tự cũng được đưa ra từ phía những người bán AI. Satya Nadella của Microsoft đã phát biểu tại Hội nghị Morgan Stanley TMT vào tháng 3 năm 2026:

"Tại sao chúng ta lại sử dụng nhiều token đến vậy? Trong nhiều trường hợp, chúng ta đang làm những điều tồi tệ nhất về mặt hiệu quả sử dụng token. Điều mà mọi người sẽ làm trong năm tới là sử dụng công cụ và phần mềm để làm cho AI hoạt động hiệu quả."

https://www.investing.com/news/transcripts/microsoft-at-morgan-stanley-conference-ais-transformative-role-93CH-4542000

Trên thực tế, Microsoft đã cắt giảm đáng kể các giấy phép Claude Code trực tiếp mà họ mới giới thiệu nội bộ.

Từ đây về sau, AI sẽ không còn là một công cụ mà bạn có thể "sử dụng bao nhiêu tùy thích," mà sẽ là một đối tượng mà ROI của nó bị đặt câu hỏi, giống như chi phí nhân công hay tiếp thị. Trọng tâm của việc quản lý sẽ chuyển từ việc đã sử dụng bao nhiêu token sang việc những token đó đã tạo ra kết quả gì và nên phân bổ chúng vào đâu tiếp theo.

Sử Dụng Token Quy Mô Lớn Là Điều Kiện Tiên Quyết Để Cạnh Tranh

Mặc dù nghe có vẻ hơi tiêu cực, nhưng tiền đề ở đây là sự phát triển của AI vô cùng mạnh mẽ. Trong lĩnh vực phát triển, không có lựa chọn nào khác ngoài việc sử dụng các tác nhân lập trình (coding agents). Các công ty không thể chi trả một mức chi phí token nhất định về cơ bản đang tự rút lui khỏi cuộc cạnh tranh. Hơn nữa, rào cản cho "mức nhất định" đó của chi phí token là khá cao. Chúng ta phải đối mặt với thực tế khắc nghiệt rằng bạn không thể tăng tốc nếu không có năng lực đầu tư.

Trên thực tế, không hiếm khi chi phí token do các kỹ sư tiêu thụ lên tới hàng chục phần trăm hoặc thậm chí một nửa mức lương của họ. Việc nghĩ về "chi phí thuê một kỹ sư" không chỉ đơn thuần là "tiền lương," mà là một gói bao gồm "tiền lương cộng với chi phí token AI" đang trở nên cần thiết. Đối với ban quản lý, đây là sự xuất hiện của một hạng mục chi phí hoàn toàn mới.

Token Maxing không phải là một phong trào vô nghĩa; bằng cách sử dụng AI hết công suất, tôi tin rằng việc học hỏi đã tiến triển nhanh chóng về nơi cần tăng tốc và nơi cần kiểm soát chặt chẽ hơn. Tiến tới, các công ty có thể thực hiện Token Management—tăng tốc ở những nơi cần thiết và kiểm soát ở những nơi cần kiểm soát—sẽ nổi bật.

Token Management đã trở thành một vấn đề quản trị. Token Maxing là một bước đầu tiên quan trọng cho sự chuyển đổi cấu trúc của các công ty.

Tại công ty chúng tôi, giai đoạn chỉ sử dụng token vì mục đích sử dụng đã kết thúc, và chúng tôi đang ở giai đoạn làm thế nào để tạo ra kết quả. Trong "Compass" (kim chỉ nam) của LayerX, có những chỉ thị như "Biến AI thành động lực tăng trưởng" và "Đừng xây dựng những thứ sẽ không được sử dụng. Đừng rơi vào bẫy xây dựng AI."

福島良典 | LayerX - inline image

Từ https://speakerdeck.com/layerx/compass_202209?slide=34

福島良典 | LayerX - inline image

Từ https://speakerdeck.com/layerx/compass_202209?slide=36

Kết quả của những hướng dẫn này, chúng tôi đã tối ưu hóa token nội bộ. Chúng tôi đã sử dụng chúng ở những nơi nên sử dụng và tối ưu hóa ở những nơi cần tối ưu, nhưng số lượng token được sử dụng không thay đổi đáng kể so với khi chúng tôi đang thực hiện Token Maxing tại LayerX. Tôi cảm thấy rằng việc sử dụng token quy mô lớn trên một mức nhất định đã trở thành điều kiện tiên quyết để cạnh tranh.

Các Tác Nhân Lập Trình Chỉ Là "Tiền Lệ"

Điều quan trọng ở đây là sự bùng nổ tiêu thụ token này không chỉ giới hạn trong lĩnh vực chuyên môn là lập trình.

Hiện tại, tất cả các loại hoạt động kinh doanh ngoài lập trình đang được giải quyết theo cùng một cách như các tác nhân lập trình. Thu thập tín hiệu và tạo đề xuất cho bán hàng, các yêu cầu hỗ trợ khách hàng, báo cáo và phê duyệt chi phí tự động, soát xét hợp đồng pháp lý, vận hành quảng cáo tiếp thị, sàng lọc tuyển dụng nhân sự—tất cả đang được thiết kế lại lần lượt thành các tác nhân thực thi tự động.

Các tác nhân tự động tiêu thụ token với số lượng không thể so sánh với cách sử dụng "một câu hỏi, một câu trả lời" trước đây của con người. Khi các tác nhân làm nhiều việc hơn, tất cả việc sử dụng AI sẽ hội tụ vào cùng một mô hình mà chúng ta thấy hiện nay với các tác nhân lập trình. Các tác nhân lập trình chỉ tình cờ là tiền lệ đầu tiên đạt đến mô hình đó.

福島良典 | LayerX - inline image

Thách thức quản lý chi phí token AI, hiện trông giống như một "vấn đề chỉ dành cho kỹ sư," sẽ sớm trở thành một vấn đề quản trị trên toàn công ty. Điều này là do mọi lĩnh vực kinh doanh trong một công ty sẽ có cùng một cấu hình tiêu thụ token trong vòng vài năm tới.

Chi Phí Token Là Một Quả Bom Hẹn Giờ

福島良典 | LayerX - inline image

Có một thực tế khác mà chúng ta phải nhận ra ở đây. Phí đăng ký AI mà chúng ta hiện đang trả thấp hơn đáng kể so với chi phí thực tế.

Hiện tại, các nhà cung cấp mô hình nền tảng (foundation model) thường cung cấp các gói đăng ký AI bị lỗ, và có một khoảng cách rất lớn giữa mức phí cố định chúng ta trả và chi phí thực tế phát sinh. Nếu bạn tính toán lại cùng một mức sử dụng với giá pay-as-you-go của API, chi phí sẽ tăng lên theo cấp số nhân. Hình thức đăng ký làm cho chi phí thực tế trở nên vô hình đối với người dùng.

Vấn đề là các công ty mô hình nền tảng có thể làm rõ sự khác biệt về chi phí thực tế này bất cứ lúc nào. Ngay khi phần được trợ cấp bắt đầu được chuyển cho khách hàng dưới hình thức chuyển từ thanh toán cố định sang thanh toán dựa trên token, hướng dẫn lên các gói cao hơn, hoặc tăng giá, cảm giác "hàng chục nghìn yên mỗi ID mỗi tháng, tiêu tốn của một công ty 100 nhân viên hàng chục triệu yên mỗi năm" có thể nhảy lên mức "hàng trăm triệu hoặc hàng tỷ yên mỗi năm cho toàn công ty" trong một thời gian ngắn. Sự khác biệt về chi phí thực tế bị che giấu bởi các gói đăng ký trở thành sức mạnh của quả bom hẹn giờ.

Điều đầu tiên cần làm là làm cho những gì đang xảy ra trong công ty trở nên rõ ràng trước khi vụ nổ xuất hiện.

(Bài viết này hữu ích cho chi tiết: https://www.thestateofbrand.com/news/ai-subscription-time-bombhttps://www.thestateofbrand.com/news/ai-subscription-time-bomb))

Đầu Tiên, Hãy Trực Quan Hóa

Điều đầu tiên cần thiết cho vấn đề này là một điều cực kỳ cơ bản: làm cho nó trở nên rõ ràng "ai đang sử dụng mô hình nào và bao nhiêu token." Chỉ có vậy thôi.

Đối với con người, chúng ta đã có sẵn những nền tảng quản lý rộng lớn như đánh giá nhân sự, quản lý mục tiêu, hệ thống lương thưởng và thiết kế tổ chức. Đối với chi phí tiếp thị, việc tối ưu hóa trong khi đo lường CAC và thời gian hoàn vốn (payback) là điều hiển nhiên. Bộ phận mua sắm có các nhóm chuyên trách và quy trình làm việc riêng.

Tuy nhiên, đối với AI, ngay cả việc trực quan hóa cơ bản nhất cũng chưa được thiết lập. Đối với các CEO và bộ phận CNTT, thực tế là họ không thể thấy "ai đang chi bao nhiêu cho AI ngay lúc này" đã là một áp lực lớn. Giá trị được tạo ra chỉ bằng cách đưa các con số lên một bảng điều khiển (dashboard).

"AI Token Advisor" mà chúng tôi hiện đang cung cấp là một sản phẩm được thiết kế chính xác để lấp đầy khoảng trống này. Đây là một công cụ đơn giản để trực quan hóa ai đã sử dụng mô hình nào cho nhiệm vụ gì và bao nhiêu token. (Người dùng Bakuraku có thể sử dụng một ID miễn phí!)

福島良典 | LayerX - inline image

Từ https://bakuraku.jp/resources/product/pre-registration-ai-token-advisor/

Tuy nhiên, trực quan hóa chỉ là bước khởi đầu. Điều thực sự quan trọng là câu hỏi chắc chắn sẽ nảy sinh sau đó.

"Liệu nhiệm vụ đó có thực sự nên sử dụng mô hình đó không?"

Khi việc trực quan hóa tiến triển, câu hỏi tiếp theo luôn xuất hiện là: "Liệu nhiệm vụ đó có thực sự nên sử dụng mô hình đó không?"

Ví dụ, sử dụng một mô hình suy luận hàng đầu (như Claude Opus 4.8 hoặc GPT-5.5; các mô hình mới nhất tính đến tháng 5 năm 2026) cho một câu hỏi như "Hôm nay thời tiết thế nào?" rõ ràng là quá mức cần thiết. Mô hình nhẹ nhất là đủ, và thậm chí có thể không cần là mô hình suy luận. Tương tự, có rất nhiều trường hợp trong các công ty mà các mô hình đắt tiền vẫn tiếp tục được sử dụng cho các nhiệm vụ đã trưởng thành như tạo email thông thường.

Xu hướng cũng khác nhau ở mỗi người. Những người không quen sử dụng AI có xu hướng chỉ chọn mô hình mạnh nhất cho thời điểm hiện tại. Ngược lại, những người sử dụng AI chuyên sâu sẽ chuyển đổi mô hình tùy thuộc vào bản chất của nhiệm vụ. Sự khác biệt này, xét về cả chi phí lẫn chất lượng, trở nên quá lớn để một tổ chức có thể bỏ qua.

Điều quan trọng ở đây là thực tế rằng tất cả đầu vào cho AI cuối cùng đều được chuyển đổi thành dạng "prompt." Các câu hỏi trò chuyện và ngữ cảnh được chuyển đến các tác nhân (agents) đều được nhập vào mô hình dưới dạng prompt. Nói cách khác, nếu bạn nhìn vào prompt, bạn có thể biết khá rõ người đó đang yêu cầu AI làm gì.

Bắt đầu từ prompt này, chúng ta có thể phát hiện sự không phù hợp giữa nhiệm vụ và mô hình và đưa ra hướng dẫn như, "Đối với nhiệm vụ này, một mô hình nhẹ hơn là đủ." Xa hơn nữa, thay vì mọi người tự chọn mô hình mỗi lần, hệ thống sẽ tự động phân bổ mô hình tối ưu. Chúng ta đang tiến tới một thế giới như vậy.

福島良典 | LayerX - inline image

Trong kỷ nguyên của các tác nhân (agents), điều này càng trở nên quan trọng hơn. Vì các tác nhân thực thi một cách tự động, không có chỗ cho con người suy nghĩ mỗi lần, "Có phải là xa xỉ khi dùng Opus bây giờ không?" Ngay từ đầu, sẽ không có lựa chọn nào khác ngoài việc để hệ thống đảm nhận việc lựa chọn mô hình tối ưu dựa trên bản chất của nhiệm vụ.

Các dịch vụ chúng tôi cung cấp tại Bakuraku sẽ được cung cấp dưới dạng dịch vụ được quản lý (managed services), bao gồm cả việc triển khai backend để chọn mô hình tối ưu mà người dùng không cần phải ý thức về nó. AI Token Advisor chỉ là điểm khởi đầu.

Tổng Kết

Chi phí token AI đã vượt quá quy mô có thể xử lý bằng cách tiếp cận "cứ ném tiền vào là được." Đối với một số công ty, chúng đang trở thành những khoản chi phí ngang hàng với chi phí nhân công và tiếp thị.

Chi phí tiếp thị được quản lý chặt chẽ bởi CAC, và không ai vận hành bằng cách nói, "Cứ chạy quảng cáo bất kể CAC là bao nhiêu." Chi phí nhân công cũng vậy; lương, tuyển dụng và bố trí nhân sự đều được quản lý. Bạn không chỉ đơn giản thuê người với bất kỳ mức lương nào.

Ở cùng một cấp độ này, chi phí AI sẽ đi vào phạm vi quản lý. Điều đầu tiên cần làm sau đó là trực quan hóa "số tiền đang được chi tiêu là bao nhiêu." Và tiếp theo là kiểm tra "liệu mô hình phù hợp có được chọn cho nhiệm vụ và người dùng đó hay không."

Nó có vẻ không hào nhoáng, nhưng việc làm chủ hai điểm này sẽ trở thành một vấn đề quản trị quan trọng trong những năm tới.

Dành cho những ai muốn cùng nhau hiện thực hóa một tương lai như vậy, LayerX đang tích cực tuyển dụng các Nhà Xây dựng AI (AI Builders)!

福島良典 | LayerX - inline image

Chúng tôi đang tích cực tuyển dụng! https://jobs.layerx.co.jp/

Lưu một chạm

Đọc sâu bài viết viral bằng AI trong YouMind

Lưu nguồn, đặt câu hỏi tập trung, tóm tắt lập luận và biến một bài viết viral thành các ghi chú có thể tái sử dụng trong một không gian làm việc AI duy nhất.

Khám phá YouMind
Dành cho nhà sáng tạo

Biến Markdown của bạn thành bài viết 𝕏 gọn gàng

Khi bạn đăng bài viết dài của riêng mình, việc định dạng hình ảnh, bảng và khối mã cho 𝕏 rất mệt mỏi. YouMind biến cả bản nháp Markdown thành một bài viết 𝕏 gọn gàng, sẵn sàng để đăng.

Thử Markdown sang 𝕏

Thêm pattern để giải mã

Bài viết viral gần đây

Khám phá thêm bài viết viral