Skip to content

API Claude giá rẻ: cách so sánh giá mỗi triệu Token thật sự

Điểm chính

  • Đơn giá mỗi triệu Token là điểm khởi đầu, không phải số tiền bạn trả. Các endpoint Claude nghiêm túc tách đầu vào, đầu ra, cache write và cache read thành từng hạng mục riêng, và tỷ lệ giữa chúng quyết định chi phí — hai endpoint niêm yết cùng một đơn giá có thể lệch nhau vài lần trên cùng một khối lượng công việc.
  • Với các công cụ dạng agent như Claude Code, phần lớn Token là cache read. Công cụ gửi lại toàn bộ hội thoại đang lớn dần ở mỗi lượt, nên prompt cache quan trọng hơn bảng giá.
  • Cách so sánh duy nhất đứng vững là chạy cùng một khối lượng công việc qua cả hai endpoint rồi đọc Lịch sử sử dụng. Bảng giá là quảng cáo; lịch sử sử dụng là bằng chứng.
  • Khi đánh giá một endpoint rẻ hơn, hãy hỏi năm điều: có báo cache read và cache write riêng không, có tôn trọng cache hint không, yêu cầu thất bại có bị trừ phí không, hệ số nhóm có công khai không, và bạn có tự xem được chi tiết từng lần gọi không.

Vì sao đơn giá không dự đoán được chi phí thực trả

Mọi endpoint Claude trên thị trường đều quảng cáo một con số cho mỗi triệu Token. Gần như không endpoint nào phục vụ lưu lượng của bạn đúng ở con số đó.

Lý do: một lần gọi Claude không phải một đại lượng, mà là bốn:

Hạng mụcLà gìVì sao khác nhau giữa các endpoint
Đầu vàoPhần văn bản bạn gửi mà chưa được cachePhụ thuộc endpoint cache được bao nhiêu phần prefix
Đầu raPhần văn bản model sinh raGần như luôn là hạng mục đắt nhất
Cache writeLưu prefix để các lượt sau dùng lạiCó endpoint không hỗ trợ hạng mục này
Cache readDùng lại prefix đã lưuĐòn bẩy lớn nhất với khối lượng việc dạng agent

Một endpoint có thể niêm yết đơn giá đầu vào rất hấp dẫn mà vẫn đắt, vì nó không cache, nên mỗi lượt lại gửi toàn bộ hội thoại như đầu vào mới. Một endpoint khác niêm yết đơn giá cao hơn mà lại rẻ hơn, vì phần lớn Token của bạn đến dưới dạng cache read.

Bảng giá cho bạn biết giá của một Token. Nó không cho bạn biết bạn sẽ chủ yếu mua loại Token nào.

Cache là nơi "giá rẻ" được quyết định

Đây là phần đáng hiểu trước khi chuyển sang bất kỳ đâu.

Một client trò chuyện gửi một câu hỏi và nhận một câu trả lời: vài Token vào, vài Token ra. Claude Code là một agent. Nó đọc tệp, gọi công cụ, nhận kết quả, rồi làm lại. Một tác vụ trở thành hàng chục yêu cầu, và mỗi yêu cầu mang theo toàn bộ hội thoại tính đến lúc đó. Nếu phần prefix ấy bị tính như đầu vào mới ở từng lượt, lập trình dạng agent sẽ không thể rẻ ở bất kỳ mức giá nào.

Prompt cache ngăn điều đó. Prefix ổn định được lưu lại, các lượt sau trả cache read thay vì trả toàn bộ đầu vào mới. Claude Code thể hiện đúng cơ chế này: sau khi phiên có phản hồi đầu tiên, nó báo thống kê prompt cache, và phần xem mức sử dụng tách cùng phiên đó theo model thành đầu vào, đầu ra, cache read và cache write.

Đặt điều đó cạnh một endpoint không chuyển tiếp cache hint. Client vẫn tưởng là đang cache. Endpoint lặng lẽ biến mọi cache read thành đầu vào mới. Terminal trông hoàn toàn khỏe mạnh, còn chi phí đổi hình dạng.

Hai hệ quả:

  1. Cache được giữ theo từng model. Đổi model giữa phiên thì lượt kế tiếp phải nạp lại toàn bộ hội thoại từ đầu. Hãy chọn model theo hình dạng công việc trước khi bắt đầu, đừng đổi giữa đường.
  2. Hành vi cache không quan sát được từ phía bạn. Nhật ký của bạn không cho biết endpoint có tôn trọng cache hint hay không. Phải đọc Lịch sử sử dụng của endpoint, hoặc tự kiểm tra.

Bốn câu hỏi phân biệt endpoint rẻ thật và rẻ ngoài mặt

Câu hỏiVì sao nó quyết định chi phí
Có báo cache read và cache write riêng không?Nếu gộp vào "đầu vào", bạn không thể đối chiếu hạng mục lớn nhất
chuyển tiếp cache hint tới nhà cung cấp model không?Nếu không, mỗi lượt đều bị tính như đầu vào mới
Yêu cầu thất bại hoặc thử lại có bị trừ phí không?Phiên agent dài hay thử lại; trừ phí phần thử lại làm chi phí phình lặng lẽ
Hệ số nhóm có công khai không?"Giá chính thức × hệ số" chỉ có nghĩa khi hệ số nhìn thấy được

Một endpoint trả lời công khai cả bốn điều, và cho bạn xem lại từng hạng mục sau khi gọi, đang làm được điều mà bảng giá không làm được.

Cách tự kiểm chứng bạn đang trả bao nhiêu

Đừng tin bất kỳ điều nào ở trên — của chúng tôi hay của bất kỳ ai. Hãy chạy ba phép kiểm tra sau với endpoint bạn đang cân nhắc.

Kiểm tra 1 — đọc chi tiết của chính bạn. Thực hiện một lần gọi qua công cụ dạng agent, rồi mở Lịch sử sử dụng của khóa đó. Bạn phải thấy đầu vào, đầu ra, cache read và cache write là những con số riêng, kèm số tiền đã trừ cho lần gọi đó. Nếu thiếu cột cache hoặc cột cache luôn bằng không, endpoint không cache, và giá thực không phải giá quảng cáo.

Kiểm tra 2 — hỏi model xem nó là ai. Gửi một prompt một dòng yêu cầu model tự nhận diện, rồi so câu trả lời với model bạn đã chọn. Endpoint âm thầm định tuyến sang model khác sẽ lộ ra ở đây, và danh tính model là thứ bảng giá không thể làm giả.

Kiểm tra 3 — đối chiếu tổng. Cộng các khoản trừ trong Lịch sử sử dụng trong một ngày rồi so với mức giảm số dư trong cùng khoảng thời gian. Hai con số phải khớp. Lệch nghĩa là có thứ đang bị tính mà không nằm trong chi tiết của bạn.

Cả ba đều không cần quyền truy cập đặc biệt. Bạn làm được trong terminal trong vài phút, và chúng đáng giá hơn mọi bảng so sánh — kể cả bảng của chúng tôi.

Cách so sánh mà không bị đánh lừa

Nếu muốn một phép so sánh trụ được với thực tế, hãy làm theo thứ tự này:

  1. Khớp khối lượng công việc, không khớp đơn giá. Chạy cùng một phiên agent — cùng kho mã, cùng prompt, cùng model — qua cả hai endpoint.
  2. So tỷ lệ cache khớp trước. Xem bao nhiêu phần đầu vào đến dưới dạng cache read. Chênh lệch lớn ở đây giải thích phần lớn khác biệt chi phí trước khi bạn nhìn tới bất kỳ đơn giá nào.
  3. So số tiền bị trừ cho mỗi yêu cầu, không so đơn giá mỗi triệu Token.
  4. Xem chuyện gì xảy ra khi thất bại. Tạo một yêu cầu lỗi và xem nó có xuất hiện trong phần bị trừ hay không.
  5. Cuối cùng mới xem bảng giá, như lời giải thích cho điều bạn đã quan sát, không phải như lời dự đoán.

Hai endpoint có bảng giá giống nhau có thể kết thúc ở hai chỗ khác nhau khi có cache dạng agent. Hai endpoint có bảng giá khác nhau có thể đổi chỗ hoàn toàn.

Vì sao chúng tôi định giá theo cấu trúc này

Chúng tôi tính phí theo giá niêm yết chính thức × hệ số nhóm, và công khai hệ số của từng nhóm trên một trang mở, cùng đơn giá từng model và tách riêng đầu vào, đầu ra, cache. Hai lựa chọn kéo theo:

  • Số dư là tài sản của tài khoản. Thay đổi giá không tiêu vào số dư bạn đã nạp.
  • Yêu cầu thất bại không bị trừ phí. Một phiên agent thử lại không phải trả hai lần cho cùng một việc.

Cả hai đều kiểm chứng được chứ không chỉ được khẳng định: trang hệ số là công khai, Lịch sử sử dụng hiện từng khoản trừ, và trang trạng thái báo tình trạng vận hành hiện tại của từng nhóm, không tô vẽ. Mỗi lần thay đổi hệ số đều được thông báo công khai, và những lần giảm khi chi phí đầu vào hạ xuống đều nêu rõ lý do.

Xem ở đâu: đơn giá từng model và hệ số nhóm hiện tại nằm ở model plaza, còn trạng thái nhóm theo thời gian thực ở trang trạng thái. Cả hai đều công khai, không cần tài khoản.

Bắt đầu từ đâu

Mua đúng loại Token mà bạn sẽ thực sự tiêu thụ. Nếu công việc của bạn dạng agent, phần lớn Token sẽ là cache read, nên một nhà cung cấp có cache đáng giá hơn một nhà cung cấp niêm yết đơn giá đầu vào thấp hơn.

Sau đó hãy kiểm chứng: xem đơn giá và hệ số nhóm cùng trạng thái từng nhóm, tài liệu tiếng Việt để cấu hình endpoint và khóa, rồi tạo tài khoản, thực hiện một lần gọi và đối chiếu với Lịch sử sử dụng của chính bạn.

Ba phép kiểm tra trong bài này áp dụng với chúng tôi y như với bất kỳ endpoint nào khác. Nếu số liệu khớp, mức giá bạn được báo chính là mức giá bạn đang trả. Nếu câu hỏi của bạn là về người vận hành chứ không phải về giá, hãy xem Is a Cheap Claude API Reseller Safe? 5 Things to CheckWhat Is an AI API Aggregator? 7 Things to Check Before You Pay.

Sẵn sàng bắt đầu gọi API?

Tạo tài khoản, sinh khoá và thực hiện lần gọi đa mô hình đầu tiên trong năm phút. Một khoá dùng cho GPT, Claude, Gemini, Grok, DeepSeek và các mô hình Trung Quốc.

Đăng ký miễn phíXem mô hình & bảng giá