Mua API key DeepSeek giá rẻ: điều gì quyết định chi phí thật
Ý chính
- Với dòng mô hình này, giá niêm yết không phải là câu hỏi quan trọng. DeepSeek tự công bố bảng giá của họ, mức đó vốn đã thấp, và mọi cổng trung gian đều cạnh tranh trong cùng một cấu trúc.
- Ba đặc điểm cấu trúc quyết định phần lớn chi phí: token đầu vào cache khớp được tính ở mức nhỏ hơn nhiều so với cache trượt, đơn giá chính thức khác nhau giữa giờ cao điểm và giờ thấp điểm, và bộ nhớ đệm ngữ cảnh bật mặc định — bạn không chọn bật, nên cũng không thể bỏ qua.
- Hệ quả: hai người dùng cùng mô hình, cùng nhà cung cấp, cùng tổng số token vẫn có thể trả hai mức rất khác nhau, vì một người giữ nguyên phần đầu của yêu cầu còn người kia thì thay đổi nó mỗi lần gọi.
- Mọi điều dưới đây đều kiểm chứng được bằng hai trang tài liệu chính thức ở trên, cộng với một yêu cầu do chính bạn gửi đi.
Vì sao "rẻ nhất" không phải câu hỏi đầu tiên
Với Claude, phần khó nằm ở truy cập: thẻ bị từ chối, khu vực bị hạn chế, và cổng trung gian thường là đường đi duy nhất. DeepSeek khác. Nền tảng của họ truy cập được, tài liệu công bố đơn giá, và base URL đã nói đúng chuẩn OpenAI. Câu hỏi "ai bán khoá cho tôi" gần như không còn là vấn đề.
Phần còn lại là câu hỏi hạch toán, và nó có hình dạng cụ thể. DeepSeek tính đầu vào và đầu ra riêng, tách đầu vào thành cache khớp và cache trượt, và áp mức khác nhau theo khung giờ. Bốn con số, không phải một. Một dòng "mỗi triệu token" gộp cả bốn lại thành thứ không thể so sánh.
Cách kiểm tra: mở trang giá chính thức và đếm số cột. Nếu một nhà cung cấp chỉ báo cho bạn một con số duy nhất cho DeepSeek, hãy hỏi con số đó ứng với cột nào. Chỉ câu hỏi đó đã đủ phân loại nhà vận hành nghiêm túc với nhà vận hành đang đọc lại từ ảnh chụp màn hình.
Bốn hạng mục, và hạng mục nào sẽ phình ra
| Hạng mục | Kích hoạt bởi | Phình ra vì | Ai kiểm soát |
|---|---|---|---|
| Đầu vào, cache trượt | Mọi phần đầu yêu cầu chưa nằm trong bộ nhớ đệm | Gửi lại ngữ cảnh mới ở mỗi lần gọi | Ứng dụng của bạn |
| Đầu vào, cache khớp | Phần đầu yêu cầu khớp hoàn toàn với đơn vị đã lưu | Dùng lại một phần đầu ổn định | Ứng dụng của bạn |
| Đầu ra | Mọi token mô hình sinh ra | Câu trả lời dài, suy luận dài, thử lại | Prompt và thiết lập của bạn |
| Hệ số giờ cao điểm | Các lần gọi rơi vào khung giờ cao điểm | Việc theo lô chạy sai khung giờ | Bộ lập lịch của bạn |
Khoảng cách giữa hai dòng đầu là đòn bẩy lớn nhất trên trang giá. Trong bảng chính thức của DeepSeek, mức đầu vào cache khớp chỉ bằng một phần nhỏ của mức cache trượt — đủ để đảo ngược một bản dự toán.
Dòng cuối là thứ gần như không ai tính trước. Vì đơn giá chính thức thay đổi theo khung giờ, một lô chạy ban đêm và một lô chạy buổi chiều có cùng khối lượng không phải là cùng một khoản mua. Nếu công việc của bạn không cần độ trễ thấp, đó là phần tiết kiệm miễn phí.
Bộ nhớ đệm của DeepSeek thực sự hoạt động thế nào
Đây là phần đáng đọc tài liệu, vì luật chơi cụ thể hơn câu "gửi lại prompt là rẻ hơn".
Bộ nhớ đệm ngữ cảnh của DeepSeek bật mặc định cho mọi người dùng và lưu trên đĩa. Mỗi yêu cầu đều tạo ra bộ nhớ đệm. Một yêu cầu sau đó chỉ cache khớp khi phần đầu của nó khớp hoàn toàn với một đơn vị tiền tố đã lưu — trùng một phần thì không được tính.
Các đơn vị này được tạo tại ranh giới yêu cầu: một ở cuối phần người dùng nhập, một ở cuối phần mô hình trả ra. Vì vậy lời khuyên thực dụng không phải "gửi cùng một prompt hai lần", mà là "giữ một khối giống hệt và ổn định ở ngay đầu mỗi yêu cầu trong cùng một phiên".
Cách kiểm tra: gửi hai lần cùng một phần đầu dài, rồi đọc khối usage ở phản hồi thứ hai. Nếu có token đầu vào cache khớp, bộ nhớ đệm đang hoạt động với luồng của bạn. Nếu không bao giờ thấy, phần đầu đang bị thay đổi ở đâu đó — dấu thời gian, danh sách công cụ bị đổi thứ tự, hay system message bị viết lại đều đủ để phá.
Bài kiểm tra năm phút cho bất kỳ endpoint DeepSeek nào
Làm theo thứ tự. Mỗi bước tạo ra bằng chứng cho bước sau, và toàn bộ chuỗi tốn ít hơn một trang nội dung.
1. Hỏi endpoint xem nó phục vụ những mô hình DeepSeek nào. Lấy mã mô hình từ danh sách trực tiếp, đừng lấy từ bài viết. Mã mô hình của dòng này lỗi thời nhanh hơn tài liệu, và một mã cũ trông y hệt một sự cố.
2. Gửi một yêu cầu tối thiểu. Giới hạn đầu ra nhỏ, prompt một dòng, đường dẫn tương thích OpenAI. Bạn không đọc câu trả lời — bạn đọc phần bao ngoài.
3. Đọc khối usage. Phản hồi đúng chuẩn tách đầu vào khỏi đầu ra, và tách cache khớp khỏi cache trượt khi có chạm bộ nhớ đệm. Lần gọi ngắn đầu tiên thường không hiện số liệu cache. Điều đó là bình thường.
4. Đối chiếu đúng yêu cầu đó trong sổ usage. So số token và số tiền bị trừ với bước 3. Đây là bước duy nhất nơi giá và mức dùng gặp nhau trên cùng một dòng — cũng là bước phân biệt một dịch vụ kiểm toán được với một dịch vụ chỉ nghe hợp lý.
5. Ép một lần lỗi, rồi xem lại sổ. Gửi một yêu cầu với mã mô hình không thể tồn tại. Trên KuaiAPI, yêu cầu thất bại không bị trừ phí — đó là cam kết đã công bố, nên nó là điều bạn kiểm tra trong một phút thay vì một ân huệ bạn phải chờ.
6. Lặp lại bước 2 với một phần đầu dài, giống hệt. Lần gọi thứ hai là nơi token cache khớp phải xuất hiện, với mức tính khác đầu vào mới. Đây là con số cho bạn nhiều thông tin nhất về một endpoint DeepSeek.
Nếu bước 6 không cho thấy gì, bạn vừa biết được điều hữu ích hơn mọi bảng so sánh đơn giá: bộ nhớ đệm không chạm tới luồng của bạn, và con số trên tiêu đề không phải con số bạn sẽ trả.
Đọc giá DeepSeek của một cổng trung gian mà không phải đoán
Một cổng trung gian niêm yết giá DeepSeek bằng đơn giá chính thức nhân với hệ số của nhóm, và một cổng tử tế công bố cả hai nửa. Trên KuaiAPI, phần tách đó nằm ở bảng mô hình: mỗi nhóm hiện hệ số của nó, và mỗi mô hình trong nhóm hiện riêng mức đầu vào, đầu ra và cache đọc, lấy từ dữ liệu trực tiếp chứ không từ bảng viết cứng.
Chính cấu trúc đó làm cho lời tuyên bố kiểm chứng được. Bạn tự nhân đơn giá chính thức với hệ số đã công bố và xem kết quả có khớp với mức hiển thị hay không. Nếu nhà cung cấp chỉ công bố kết quả, thì không có gì để kiểm tra.
Cách kiểm tra: chọn một mô hình DeepSeek, đọc hệ số nhóm của nó, rồi tự nhân với trang giá chính thức. Hai phút, và nó hoặc khớp hoặc không.
Ba thói quen giữ chi phí DeepSeek ổn định
Giữ phần đầu ổn định trong suốt phiên. Bộ nhớ đệm thưởng cho một phần đầu giống hệt; mọi framework viết lại system message ở mỗi lần gọi đang âm thầm huỷ khoản giảm đó. Ghim nó lại, đặt dấu thời gian ra ngoài khối được đệm, và cùng lưu lượng sẽ rẻ hơn mà không cần đổi mô hình.
Xếp việc theo lô vào giờ thấp điểm. Đơn giá theo khung giờ đã được công bố, nên đây là quyết định lập lịch chứ không phải đàm phán. Nếu việc có thể chờ, cho nó chờ là cách tối ưu rẻ nhất hiện có.
Nhìn token đầu ra, không chỉ đầu vào. Chế độ suy luận sinh nhiều hơn mức bạn yêu cầu, và đầu ra là hướng đắt tiền. Giới hạn đầu ra ở đây không phải nút chỉnh chất lượng — nó là nút chỉnh chi phí.
Câu hỏi thường gặp
API key DeepSeek có miễn phí không? API là dịch vụ trả phí; sản phẩm chat là thứ khác và không cùng một ưu đãi. Hãy coi mọi trang hứa "API key DeepSeek miễn phí" là trang nói về chuyện khác, và đọc trang giá chính thức để biết thứ đang được bán.
Vì sao chi phí của tôi cao hơn mức giá niêm yết? Gần như luôn là do cache trượt. Nếu phần đầu yêu cầu thay đổi ở mỗi lần gọi, mọi lần gọi đều bị tính như đầu vào mới, và cột cache khớp không bao giờ áp dụng cho bạn. Hãy đọc khối usage trước khi đổi nhà cung cấp — vấn đề thường đi theo ứng dụng.
Có cần endpoint khác cho DeepSeek so với GPT hay Claude không? Nền tảng của DeepSeek công bố cả base URL định dạng OpenAI và định dạng Anthropic, nên cả hai họ client đều được phục vụ. Trên một cổng trung gian, quy tắc vẫn như với mọi mô hình khác: client tương thích OpenAI trỏ vào đường dẫn /v1, Claude Code trỏ vào host, và khoá là cùng một khoá.
Bước tiếp theo
Hai trang trả lời phần lớn câu hỏi còn lại, không cần đăng nhập. Bảng mô hình công khai hệ số từng nhóm và mức đầu vào, đầu ra, cache đọc của từng mô hình, để bạn tách một mức giá ra thay vì so sánh một con số. Trang trạng thái cho biết từng nhóm đang chạy thế nào, kể cả khi nó chạy không tốt.
Cho các quyết định xung quanh, API Claude giá rẻ: cách so sánh giá mỗi triệu Token thật sự đi qua đúng cấu trúc bốn hạng mục trên một dòng mô hình khác, Mua API key giá rẻ: 7 điều cần kiểm tra trước khi nạp tiền nói về các câu hỏi ở tầng nhà vận hành, và API AI giá rẻ cho mọi client hướng dẫn phần cấu hình client khi một khoá phải phục vụ nhiều công cụ. Tài liệu tiếng Việt trình bày endpoint và cách cấu hình khoá.