Tiêu đề gốc: (DeepSeek V4 Pro phiên bản chính thức đã ra mắt)
Tác giả gốc: Động sát Beating


DeepSeek V4 Pro phiên bản chính thức đã có mặt.


Tối ngày 12 tháng 8, tài liệu API chính thức của DeepSeek đã cập nhật phiên bản mô hình tương ứng với deepseek-v4-pro thành DeepSeek-V4-Pro-0813. Hiện các nhà phát triển có thể gọi trực tiếp phiên bản mới thông qua API, với giá 3 nhân dân tệ/1 triệu Token cho đầu vào và 6 nhân dân tệ/1 triệu Token cho đầu ra; đối với đầu vào khi cache hit chỉ là 0,025 nhân dân tệ/1 triệu Token.


V4 Pro-0813 tiếp tục hỗ trợ cửa sổ ngữ cảnh 1 triệu Token, đầu ra tối đa đạt 384.000 Token; đồng thời hỗ trợ cả hai chế độ suy nghĩ và không suy nghĩ. Các tính năng như JSON Output, Tool Calls… cũng đã được mở.


Tính đến tối ngày 12 tháng 8, nhật ký cập nhật chính thức của DeepSeek vẫn chưa đăng riêng thông báo phát hành bản chính thức V4 Pro. Nhưng ở lần cập nhật trước đó khi V4 Flash ra bản chính thức, DeepSeek đã từng nêu rõ rằng bản chính thức V4 Pro sẽ được phát hành sau; và hiện tại, các nút mô hình phía backend của API đã chuyển từ phiên bản trước sang DeepSeek-V4-Pro-0813.


Tính đến thời điểm V4 xuất hiện lần đầu đã gần bốn tháng.


Ngày 24 tháng 4 năm nay, DeepSeek phát hành V4 Preview, đồng thời giới thiệu V4 Pro và V4 Flash. Trong đó V4 Pro là phiên bản flagship của cả dòng, tổng số tham số đạt 1.6T; mỗi Token kích hoạt khoảng 49B tham số và hỗ trợ ngữ cảnh 1 triệu Token. Ngay từ đầu, thế hệ V4 đã được tăng cường rõ rệt ở Coding, gọi công cụ và các tác vụ Agent kéo dài.


Ngày 31 tháng 7, DeepSeek cho ra mắt V4-Flash-0731. Theo công bố chính thức, phiên bản này giữ nguyên kiến trúc và quy mô mô hình cũ, chủ yếu được tinh chỉnh thêm qua hậu huấn luyện; năng lực của Agent được cải thiện rõ rệt, đồng thời được tích hợp sẵn Responses API và cũng đã được điều chỉnh cho Codex. Khi đó, DeepSeek cũng nhấn mạnh rằng bản cập nhật lần này chỉ liên quan đến Flash, còn các mô hình Pro và bản dành cho web không thay đổi; bản chính thức V4 Pro sau đó mới được phát hành.


Giờ đây, mảnh ghép cuối cùng của Pro cuối cùng cũng đã được lấp đầy.



Thế hệ mô hình của DeepSeek này ngày càng xoay quanh Agent


Thời điểm phát hành bản chính thức V4 Pro vừa đúng lúc ngành mô hình lớn bước vào một làn sóng chuyển dịch trọng tâm sản phẩm mới.


Trong năm nay, khi các hãng mô hình phát hành sản phẩm mới, phần nội dung chỉ để so sánh thuần túy hỏi đáp kiến thức, toán học và các Benchmark truyền thống đã ngày càng ít đi. Coding, Computer Use, Tool Use, tỷ lệ hoàn thành tác vụ dài, và rốt cuộc một lần hoàn thành nhiệm vụ tốn bao nhiêu tiền—đang trở thành các chỉ số cốt lõi mới.


Khi OpenAI phát hành GPT-5.6 vào tháng 7, họ đã dành nhiều nội dung để giới thiệu Agent và năng lực Coding. GPT-5.6 Sol hỗ trợ một max reasoning effort mới, tiếp tục đưa ra chế độ ultra, trong đó nhiều Agent thực hiện song song các nhiệm vụ phức tạp; Responses API cũng bắt đầu cho phép mô hình trực tiếp viết chương trình để điều phối công cụ, xử lý kết quả trung gian rồi quyết định bước tiếp theo. Thậm chí OpenAI còn chọn việc “mỗi đô la có thể hoàn thành được bao nhiêu công việc” làm một trong những điểm bán hàng chính cho thế hệ sản phẩm này.


Hướng đi của Anthropic cũng khá tương tự.


Claude Sonnet 5 do phát hành vào cuối tháng 6 chủ yếu cải thiện những mảng cũng tập trung vào Coding, Agent, Computer Use và tác vụ kéo dài. Anthropic cung cấp nhiều mức effort khác nhau để nhà phát triển chọn cường độ suy luận phù hợp với nhiệm vụ; đến ngày 10 tháng 8, Anthropic lại công bố giữ vĩnh viễn mức giá khuyến mãi ban đầu của Sonnet 5 là 2 USD/triệu lượt nhập và 10 USD/triệu lượt xuất.


Công ty mô hình hiện không còn chỉ đối mặt với bài toán “ai thông minh hơn”.


Một Agent có thể chạy liên tục hàng chục phút, thậm chí vài giờ, liên tục đọc/ghi mã, tìm kiếm tài liệu, gọi trình duyệt và các công cụ bên ngoài. Khi thực sự đi vào môi trường sản xuất, số lần gọi mô hình sẽ tăng nhanh chóng. Năng lực, tốc độ, mức tiêu hao Token và chi phí cho mỗi lần gọi bắt đầu cùng quyết định liệu một sản phẩm Agent có thể vận hành được hay không.


Thiết kế của DeepSeek V4 về cơ bản cũng đi theo hướng đó.


Ngữ cảnh 1 triệu Token cho phép mô hình đọc một lần vào kho mã lớn hơn, cơ sở tri thức của doanh nghiệp và lịch sử tác vụ; Tool Calls chịu trách nhiệm tương tác với môi trường bên ngoài; còn khả năng tương thích với API của Anthropic và Responses API—mà Flash đã tiên phong hỗ trợ—thì nhằm hạ thấp ngưỡng để mô hình đi vào hệ công cụ Agent hiện có. Khi DeepSeek phát hành V4 vào tháng 4, họ đã đồng thời mở cả OpenAI ChatCompletions và các giao diện theo định dạng của Anthropic.


Đây cũng là điểm đáng chú ý hơn cả ở việc bản chính thức V4 Pro không chỉ là “một mô hình DeepSeek lớn hơn” nữa. DeepSeek đang biến mô hình thành hạ tầng cơ bản mà Agent có thể gọi trực tiếp.


Sau khi bản chính thức V4 Pro ra mắt, cấu trúc theo từng lớp của dòng sản phẩm này ở DeepSeek cũng trở nên rõ ràng hơn.


Hiện tại, giá đầu vào của V4 Flash là 1 nhân dân tệ/triệu Token, còn Pro là 3 nhân dân tệ; Flash đầu ra là 2 nhân dân tệ, Pro là 6 nhân dân tệ. Hai mức giá này chênh nhau đúng gấp ba. V4 Pro và Flash đều hỗ trợ ngữ cảnh 1 triệu Token, nhưng Pro có quy mô tham số kích hoạt lớn hơn, hướng tới các nhiệm vụ suy luận phức tạp, Coding và các bài toán Agent khó hơn.


Flash đảm nhận nhiều nhiệm vụ lớn, tần suất cao và nhạy cảm về chi phí, còn Pro dành cho các công việc nặng hơn.


Cuộc cạnh tranh về mô hình lớn năm 2025 vẫn thường xoay quanh câu hỏi “mô hình flagship nào chạy điểm số đứng đầu”. Đến năm 2026, mô hình ngày càng giống như hạ tầng phần mềm thực thụ: vừa phải thông minh, vừa cần API ổn định, ngữ cảnh dài, khả năng gọi công cụ, mức độ đồng thời đủ cao và mức giá đủ để các nhà phát triển tính toán được.


Sau khi bản chính thức V4 Pro ra mắt, đường nét sản phẩm của thế hệ DeepSeek V4 cuối cùng đã được hoàn chỉnh.


Liên kết gốc