DeepSeek vừa bổ sung khả năng xử lý hình ảnh cho hệ thống API của mình, qua đó thu hẹp khoảng cách với những nền tảng AI đa phương thức đã xuất hiện trên thị trường từ trước. Model mới có tên DeepSeek-V4-Flash-Vision-Exp, được công bố ngày 21/8 và hiện vẫn mang nhãn thử nghiệm.


Đây là bước tiến đáng chú ý với DeepSeek. Trong nhiều tháng, các model của hãng chủ yếu tập trung vào văn bản, lập luận và sinh mã. Trong khi đó, những hệ thống như GPT, Gemini hay Claude đã sớm cung cấp API có thể tiếp nhận cả văn bản lẫn hình ảnh. Việc thiếu năng lực thị giác khiến DeepSeek gặp giới hạn khi được đưa vào các quy trình tự động hóa cần quan sát màn hình, đọc tài liệu hoặc phân tích giao diện.
DeepSeek-V4-Flash-Vision-Exp có gì mới?
DeepSeek-V4-Flash-Vision-Exp là phiên bản mở rộng khả năng thị giác của DeepSeek-V4-Flash, một model được định vị theo hướng nhẹ và phản hồi nhanh trong dòng V4. Model mới vẫn kế thừa năng lực xử lý văn bản, kiến thức tổng quát và lập luận của phiên bản gốc, đồng thời có thể tiếp nhận hình ảnh trong cùng một luồng yêu cầu.
Với nhà phát triển, điều này có nghĩa API không chỉ trả lời câu hỏi dựa trên nội dung văn bản. Model còn có thể được sử dụng để đọc ảnh chụp màn hình, nhận diện thông tin trên giao diện, xem lỗi hiển thị trong terminal hoặc trích xuất dữ liệu từ tài liệu hình ảnh. Đây là những tình huống mà model chỉ xử lý văn bản thường phải bỏ qua phần thông tin trực quan.
Tên gọi “Vision-Exp” cho thấy DeepSeek chưa xem đây là phiên bản hoàn thiện cuối cùng. Hãng chưa cam kết thời điểm model được đưa vào danh sách chính thức, vì vậy các doanh nghiệp và developer khi tích hợp vẫn cần chuẩn bị phương án thay thế nếu thông số, quyền truy cập hoặc mức độ ổn định thay đổi.
AI Agent là động lực phía sau bản cập nhật
Sự xuất hiện của model thị giác có liên quan trực tiếp đến DeepSeek Harness, framework AI Agent mã nguồn mở được hãng giới thiệu ngày 13/8. Công cụ này nhanh chóng thu hút sự quan tâm của cộng đồng lập trình viên và đạt hơn 160.000 lượt đánh dấu yêu thích trên GitHub chỉ sau 6 ngày.
AI Agent khác với chatbot thông thường ở chỗ hệ thống có thể thực hiện một chuỗi hành động để hoàn thành mục tiêu. Agent có thể đọc yêu cầu, gọi công cụ, kiểm tra kết quả, xử lý lỗi và tiếp tục thao tác mà không cần người dùng hướng dẫn từng bước. Tuy nhiên, để làm được điều đó trong môi trường thực tế, Agent thường phải hiểu nhiều loại dữ liệu, trong đó có ảnh chụp màn hình và giao diện phần mềm.
Điểm bất tiện nhanh chóng lộ ra trong quá trình phát triển Harness. Bản cập nhật rc.8 phát hành ngày 19/8 đã mở sẵn luồng nhận hình ảnh, cho phép Agent quan sát màn hình hoặc lỗi trong terminal. Thế nhưng model đứng sau lại chưa có khả năng đọc ảnh. DeepSeek-V4-Flash-Vision-Exp được công bố chỉ hai ngày sau đó, gần như lấp đúng khoảng trống mà framework mới tạo ra.
Việc ghép khả năng nhìn với khả năng gọi công cụ có thể mở rộng đáng kể phạm vi ứng dụng của Agent. Một hệ thống có thể kiểm tra ảnh chụp lỗi từ phần mềm, đọc biểu mẫu, nhận biết trạng thái trên trang web hoặc phân loại tài liệu trước khi chuyển sang bước xử lý tiếp theo. Dù vậy, chất lượng thực tế còn phụ thuộc vào cách xây dựng workflow, quyền truy cập và khả năng kiểm soát sai sót của nhà phát triển.
Kết quả thử nghiệm: cải thiện rõ ở tác vụ cần đọc ảnh
Theo số liệu do DeepSeek công bố, Vision-Exp vẫn giữ điểm số gần tương đương model chỉ xử lý văn bản trong các bài đánh giá văn bản thuần túy. Điều này cho thấy việc thêm năng lực thị giác không làm thay đổi quá lớn khả năng nền tảng vốn có của V4-Flash, ít nhất theo các phép đo do hãng thực hiện.
Mức cải thiện rõ hơn xuất hiện ở những bài kiểm tra yêu cầu Agent hiểu hình ảnh. Trên ApexBench, khi model text-only buộc phải bỏ qua phần ảnh, điểm số đạt 26,2. Với Vision-Exp, kết quả tăng lên 36,5 điểm. Con số này vẫn thấp hơn Claude Opus 4.8 của Anthropic, đạt 39,4 điểm trong cùng phép so sánh.
Ở hai bài đo khác là Agents’ Last Exam và ZeroBench, DeepSeek cho biết Vision-Exp thậm chí đạt kết quả nhỉnh hơn Opus 4.8. Tuy nhiên, các con số này cần được nhìn nhận thận trọng. Đây là kết quả do chính DeepSeek đo bằng framework của hãng, chưa có tổ chức độc lập xác minh. Khác biệt về phiên bản, cấu hình, cách thiết lập tác vụ và phương pháp chấm điểm đều có thể ảnh hưởng đến kết quả.
| Bài đánh giá | DeepSeek text-only | DeepSeek Vision-Exp | Claude Opus 4.8 |
|---|---|---|---|
| ApexBench | 26,2 | 36,5 | 39,4 |
| Agents’ Last Exam | Chưa công bố trong dữ liệu tham khảo | Nhỉnh hơn Opus 4.8 | Thấp hơn Vision-Exp |
| ZeroBench | Chưa công bố trong dữ liệu tham khảo | Nhỉnh hơn Opus 4.8 | Thấp hơn Vision-Exp |
Vì vậy, kết quả benchmark nên được xem là tín hiệu ban đầu thay vì bằng chứng khẳng định DeepSeek đã vượt qua toàn bộ đối thủ. Giá trị quan trọng hơn nằm ở việc model mới đã giải quyết được một giới hạn chức năng của nền tảng.
Chi phí xử lý ảnh vẫn là lợi thế của DeepSeek
DeepSeek quy đổi hình ảnh thành token để tính phí. Mỗi ảnh được giới hạn tối đa 384 token và áp dụng mức giá tương tự model văn bản V4-Flash. Theo mức giá trong giờ cao điểm được hãng công bố, một ảnh tiêu tốn khoảng 0,0011 tệ, tương đương chưa tới 5 đồng theo tỷ giá được nêu trong dữ liệu tham khảo.
Cách tính này giúp chi phí xử lý hình ảnh dễ dự đoán hơn khi xây dựng ứng dụng. Thay vì phải theo dõi một bảng giá riêng cho phần thị giác, developer có thể tính tổng chi phí dựa trên cơ chế token quen thuộc của model văn bản. Với những hệ thống cần xử lý số lượng lớn ảnh chụp màn hình, biểu mẫu hoặc tài liệu, chênh lệch nhỏ trên mỗi ảnh có thể tạo thành khoản tiết kiệm đáng kể.
DeepSeek cũng được cho là rẻ hơn các đối thủ cùng phân khúc như GPT-5.6 Luna và Gemini Flash-Lite trong cách so sánh được cung cấp. Các nền tảng này thường tính riêng phần xử lý hình ảnh thay vì gộp vào mức giá token văn bản như DeepSeek. Tuy nhiên, khi lựa chọn dịch vụ, doanh nghiệp không nên chỉ nhìn vào đơn giá. Độ chính xác, giới hạn tốc độ, thời gian phản hồi, khả năng bảo vệ dữ liệu và tính ổn định của API cũng ảnh hưởng trực tiếp đến tổng chi phí vận hành.
Cơ hội cho developer và doanh nghiệp Việt Nam
DeepSeek vốn được nhiều lập trình viên Việt Nam quan tâm nhờ mức giá cạnh tranh so với không ít model đến từ Mỹ. Khi có thêm khả năng đọc ảnh, API của hãng có thể phù hợp với nhiều ứng dụng nội địa hơn, đặc biệt là những sản phẩm cần kết hợp giữa hội thoại và xử lý tài liệu.
- Chatbot chăm sóc khách hàng có thể tiếp nhận ảnh chụp sản phẩm, hóa đơn hoặc lỗi dịch vụ trước khi chuyển cho nhân viên.
- Công cụ văn phòng có thể đọc biểu mẫu, ảnh chụp chứng từ và đưa dữ liệu vào quy trình xử lý tự động.
- AI Agent hỗ trợ kỹ thuật có thể phân tích ảnh chụp màn hình, nhận diện thông báo lỗi và đề xuất các bước kiểm tra.
- Ứng dụng nội bộ có thể kết hợp dữ liệu văn bản với hình ảnh mà không phải chuyển sang một nhà cung cấp API khác.
Đây cũng là nền tảng để các nhóm phát triển thử nghiệm những quy trình tự động hóa phức tạp hơn. Chẳng hạn, Agent có thể nhận một ảnh chụp giao diện, xác định thành phần cần thao tác, gọi công cụ phù hợp rồi kiểm tra lại kết quả. Dù vậy, các tác vụ liên quan đến tài khoản, dữ liệu khách hàng hoặc giao dịch vẫn cần có bước xác nhận của con người.
Việc AI có thể đọc ảnh không đồng nghĩa mọi thông tin do hệ thống nhận diện đều chính xác. Ảnh mờ, bố cục lạ, chữ viết tay hoặc nội dung thiếu ngữ cảnh có thể khiến model suy luận sai. Doanh nghiệp cũng nên hạn chế đưa dữ liệu nhạy cảm lên API nếu chưa đánh giá đầy đủ chính sách lưu trữ và xử lý dữ liệu. Những ứng dụng AI có quyền đọc và thao tác trên máy tính càng cần được kiểm soát chặt chẽ, tương tự các tranh luận về quyền riêng tư khi AI có thể đọc và gửi tin nhắn trên máy Mac.
Developer có thể truy cập model mới như thế nào?
Trong giai đoạn thử nghiệm, developer có thể gọi model bằng cách đặt tham số model thành deepseek-v4-flash-vision-exp trên nền tảng API của DeepSeek. Do model chưa được đưa vào danh sách chính thức, người dùng nên kiểm tra tài liệu kỹ thuật, hạn mức và điều kiện sử dụng trước khi đưa vào sản phẩm thương mại.
Một quy trình thử nghiệm hợp lý nên bắt đầu bằng tập dữ liệu đại diện cho nhu cầu thực tế. Developer cần đo riêng độ chính xác khi đọc ảnh, tỷ lệ lỗi, thời gian phản hồi và chi phí trên mỗi yêu cầu. Với AI Agent, nên kiểm tra thêm khả năng dừng đúng lúc, xử lý tình huống không chắc chắn và yêu cầu xác nhận trước khi thực hiện hành động có rủi ro.
Chi phí thấp là điểm hấp dẫn, nhưng không nên biến thành lý do duy nhất để chọn model. Khi AI được dùng cho tài liệu cá nhân, thông tin khách hàng hoặc quy trình nội bộ, các yêu cầu về bảo mật và tuân thủ phải được đặt ngang hàng với hiệu năng. Bạn có thể tham khảo thêm các thông tin liên quan đến quy định xử lý dữ liệu cá nhân trước khi triển khai hệ thống nhận ảnh tự động.
Bước tiến cần thiết, nhưng chưa phải điểm kết thúc
DeepSeek-V4-Flash-Vision-Exp đánh dấu lần đầu nền tảng này có một model đa phương thức thực sự hướng tới developer thông qua API. Sản phẩm giúp Harness hoạt động nhất quán hơn, mở rộng phạm vi của AI Agent và mang đến lựa chọn giá rẻ cho các ứng dụng cần xử lý hình ảnh.
Tuy nhiên, nhãn “Exp”, dữ liệu benchmark chưa được kiểm chứng độc lập và khả năng thay đổi trong giai đoạn thử nghiệm cho thấy model vẫn cần thêm thời gian để đánh giá. DeepSeek đã giải quyết được khoảng trống quan trọng, nhưng cuộc đua AI đa phương thức còn phụ thuộc vào độ tin cậy, khả năng bảo mật, hệ sinh thái công cụ và chất lượng vận hành trong thực tế.
