AI gateway là gì? Dùng một key gọi nhiều model AI


AI gateway là lớp trung gian đứng giữa ứng dụng của bạn và các nhà cung cấp model AI, cho phép gọi Gemini, Claude, GPT, Grok, DeepSeek… qua một API duy nhất và một key duy nhất. Thay vì viết code riêng cho từng nhà cung cấp, bạn viết một lần rồi đổi model bằng cách sửa đúng một dòng.

Nó giải quyết vấn đề gì

Khi mới dùng một model thì không thấy vấn đề. Vấn đề hiện ra khi bạn dùng từ hai model trở lên:

Mỗi nhà cung cấp một kiểu. SDK khác nhau, tên tham số khác nhau, định dạng trả về khác nhau, cách báo lỗi khác nhau. Muốn thử model mới là phải viết lại phần gọi API.

Key nằm rải rác. Mỗi nơi một key, mỗi nơi một trang thanh toán, mỗi nơi một hạn mức. Đến lúc cần biết tháng này tiêu bao nhiêu thì phải mở năm trang khác nhau cộng lại.

Hết hạn mức là chết cả hệ thống. Free tier bị giới hạn theo phút. Chạm trần là API trả lỗi, và nếu code không có phương án dự phòng thì tính năng của bạn ngừng hoạt động.

Không biết cái nào rẻ hơn cho việc của mình. Không có chỗ so sánh trực tiếp thì bạn chọn model theo cảm tính chứ không theo số liệu.

AI gateway gom cả bốn thứ đó về một chỗ.

Nó hoạt động thế nào

Bình thường ứng dụng của bạn gọi thẳng tới nhà cung cấp. Có gateway thì nó gọi tới gateway, và gateway chuyển tiếp tới nhà cung cấp phù hợp.

Điểm mấu chốt khiến việc này khả thi: hầu hết gateway đều dùng API tương thích OpenAI. Đây gần như đã thành chuẩn chung của ngành. Nghĩa là nếu code của bạn đang gọi theo kiểu OpenAI, bạn thường chỉ cần đổi base_urlapi_key là xong, không phải viết lại logic.

Ngoài việc chuyển tiếp, gateway thường làm thêm:

  • Dự phòng tự động — model chính lỗi hoặc hết hạn mức thì tự chuyển sang model khác
  • Đếm chi phí — mọi lượt gọi quy về một bảng, biết chính xác tiêu bao nhiêu cho model nào
  • Bộ nhớ đệm — câu hỏi giống hệt nhau thì trả lại kết quả cũ, khỏi tốn tiền gọi lại
  • Giới hạn tốc độ — chặn một chỗ trong ứng dụng đốt hết hạn mức của cả hệ thống
  • Nhật ký — xem lại chính xác đã gửi gì và nhận gì, cực kỳ hữu ích khi đi tìm lỗi

Ba lựa chọn phổ biến

OpenRouter LiteLLM Cloudflare AI Gateway
Kiểu Dịch vụ sẵn sàng dùng Tự cài, mã nguồn mở Hạ tầng, đứng trước key của bạn
Cần tự vận hành Không Không
Key nhà cung cấp Không cần, dùng key của họ Bạn tự mang key Bạn tự mang key
Điểm mạnh Bắt đầu nhanh nhất Kiểm soát hoàn toàn Đệm, nhật ký, phân tích
Hợp với Thử nghiệm, dự án cá nhân Chạy nội bộ, dữ liệu nhạy cảm Đã dùng hạ tầng Cloudflare

OpenRouter là đường vào dễ nhất. Bạn nạp tiền một chỗ, gọi được rất nhiều model từ nhiều nhà cung cấp mà không cần đăng ký riêng từng nơi. Nó cũng có một nhóm model miễn phí để thử — hữu ích khi bạn muốn đo xem model nào hợp việc của mình trước khi trả tiền.

LiteLLM là proxy mã nguồn mở bạn tự chạy, thường bằng Docker. Bạn vẫn tự mang key của từng nhà cung cấp, nhưng có một điểm cuối thống nhất cho mọi model. Đây là lựa chọn đúng khi dữ liệu không được phép đi qua bên thứ ba, hoặc khi bạn muốn dùng chung một cấu hình cho cả nhóm.

Cloudflare AI Gateway không thay bạn gọi model. Nó đứng trước lời gọi của bạn để thêm bộ nhớ đệm, nhật ký và thống kê. Hợp khi bạn đã hài lòng với nhà cung cấp hiện tại và chỉ cần nhìn rõ hơn vào chi phí với hiệu năng.

Đổi code thế nào

Vì là API tương thích OpenAI nên phần thay đổi rất nhỏ. Với thư viện chính thức của OpenAI, bạn chỉ chỉnh hai tham số khi khởi tạo:

client = OpenAI(
    base_url="<địa chỉ gateway>",
    api_key="<key của gateway>",
)

resp = client.chat.completions.create(
    model="<tên model theo cách gateway đặt>",
    messages=[{"role": "user", "content": "Xin chào"}],
)

Toàn bộ phần còn lại của code giữ nguyên. Đổi sang model khác chỉ là đổi chuỗi trong model.

Điểm cần chú ý: tên model ở mỗi gateway đặt một kiểu, thường có tiền tố nhà cung cấp. Đọc danh sách model của gateway đang dùng để lấy đúng tên, đừng đoán.

Chiến lược định tuyến đáng dùng

Có gateway rồi thì bạn định tuyến được theo việc, thay vì dùng một model cho tất cả:

Việc nhẹ dùng model rẻ. Phân loại, trích xuất, tóm tắt ngắn không cần model mạnh nhất. Đây là chỗ tiết kiệm được nhiều nhất mà gần như không mất chất lượng.

Việc khó mới dùng model mạnh. Suy luận nhiều bước, viết dài, code phức tạp.

Luôn có phương án dự phòng. Đặt ít nhất một model thay thế. Nhà cung cấp có lúc quá tải, và free tier thì chạm trần thường xuyên.

Đo trước khi chọn. Lấy 20 mẫu thật trong công việc của bạn, chạy qua ba model, tự so kết quả. Kết quả trên bảng xếp hạng chung không nói được model nào hợp việc cụ thể của bạn.

Dùng ở Việt Nam thế nào

Đây là phần khác biệt lớn nhất so với hướng dẫn nước ngoài.

Vấn đề thẻ quốc tế. Phần lớn gateway dạng dịch vụ yêu cầu thẻ Visa/Mastercard để nạp tiền. Nếu bạn chưa có, có hai đường vòng: dùng nhóm model miễn phí của gateway để thử trước, hoặc bỏ hẳn gateway dạng dịch vụ mà tự chạy LiteLLM với key free của Gemini — cách này không cần thẻ ở bất kỳ bước nào.

Với dự án cá nhân và blog. Nếu bạn chỉ gọi vài chục lượt mỗi ngày, key free của Gemini là đủ và bạn chưa cần gateway. Xem viết bài chuẩn SEO bằng AI cho quy trình chỉ dùng key free.

Với nhóm hoặc công ty. Lúc này gateway đáng giá thật: một chỗ quản key, một bảng chi phí, và không ai phải copy key riêng vào máy mình.

Về độ trễ. Lời gọi đi qua thêm một chặng nên có tăng một chút. Với chatbot cần phản hồi tức thì thì đáng cân nhắc; với xử lý nền như sinh bài viết thì không đáng kể.

Về dữ liệu. Dùng gateway dạng dịch vụ nghĩa là nội dung của bạn đi qua máy chủ của họ. Với dữ liệu khách hàng hoặc tài liệu nội bộ, hãy đọc chính sách của họ trước, hoặc tự chạy LiteLLM cho chắc.

Khi nào KHÔNG cần gateway

Đừng thêm một lớp nữa vào hệ thống chỉ vì nó nghe hay:

  • Bạn chỉ dùng một model duy nhất và không có ý định đổi
  • Dự án cá nhân, vài chục lượt gọi mỗi ngày, free tier chưa bao giờ chạm trần
  • Bạn đang học và muốn hiểu API gốc của từng nhà cung cấp trước

Gateway giải quyết vấn đề của việc dùng nhiều model ở quy mô có thật. Chưa có vấn đề đó thì nó chỉ là thêm một chỗ để hỏng.

Câu hỏi thường gặp

OpenRouter là gì?

Là một AI gateway dạng dịch vụ: bạn đăng ký một tài khoản, nạp tiền một chỗ, rồi gọi được nhiều model từ nhiều nhà cung cấp qua một API duy nhất mà không cần đăng ký riêng với từng bên. Nó cũng có nhóm model miễn phí để dùng thử.

AI gateway có làm chậm ứng dụng không?

Có thêm một chặng nên độ trễ tăng nhẹ. Với xử lý nền thì không đáng kể; với chatbot cần trả lời tức thì thì nên tự đo trước khi quyết định.

Dùng gateway có cần thẻ quốc tế không?

Gateway dạng dịch vụ thường cần thẻ để nạp tiền. Nếu chưa có thẻ, bạn tự chạy LiteLLM và cắm key free của Gemini vào — cả quy trình không cần thẻ ở bước nào.

Gateway có lưu nội dung tôi gửi không?

Tuỳ nhà cung cấp và tuỳ cấu hình. Nhiều dịch vụ lưu nhật ký để bạn tra cứu, và đó chính là thứ bạn không muốn với dữ liệu nhạy cảm. Đọc chính sách trước, hoặc tự chạy proxy mã nguồn mở nếu dữ liệu không được rời hạ tầng của bạn.

Nên bắt đầu bằng cái nào?

Nếu chỉ muốn thử nhanh nhiều model: OpenRouter. Nếu cần chạy nội bộ hoặc dữ liệu nhạy cảm: LiteLLM. Nếu đã dùng Cloudflare và chỉ cần nhìn rõ chi phí với hiệu năng: Cloudflare AI Gateway.

Đọc thêm: LLM là gì để hiểu thứ nằm sau các API này, và AI agent là gì — agent là nơi việc định tuyến nhiều model trở nên đáng giá nhất.