Gì cơ?!
GPT-5.6 Sol, hóa ra lại là một "bậc thầy thị giác" ẩn mình.
Gần đây, tổ chức đánh giá thị giác bên thứ ba Roboflow, đã kéo cả "họ hàng" GPT-5.6 vào chạy thử nghiệm trên bộ tiêu chuẩn VLM của họ.

Nội dung thử nghiệm đều là những công việc thiết thực nhất: tìm đồ vật, đếm đồ vật, nhận diện chữ viết, trích xuất thông tin.
Chỉ riêng mục phát hiện mục tiêu, thế hệ trước GPT-5.5 chỉ đạt 13.8 điểm. Điểm số này, trong giới mô hình thị giác, cơ bản tương đương với việc nộp giấy trắng.
Lần này Sol tăng vọt lên 46.2, gấp hơn ba lần.
Giám đốc dự án Roboflow SkalskiP thẳng thắn nói, "GPT-5.6 Sol là mô hình thị giác mạnh nhất từ trước đến nay của OpenAI"!

GPT-5.6 "Siêu cỡ", trí tuệ nhân tạo thị giác mạnh nhất của OpenAI
Mãi đến nay, phát hiện mục tiêu luôn là điểm yếu của dòng GPT. Nhiệm vụ rất đơn giản: yêu cầu mô hình khoanh vùng từng đồ vật trong ảnh.
Biểu hiện của thế hệ trước GPT-5.5, cơ bản tương đương với "biết trong ảnh có đồ vật, nhưng khoanh vào đâu thì toàn dựa vào đoán mò".
Điểm số của GPT-5.6 Sol, thẳng một mạch tăng vọt lên 46.2, gấp hơn ba lần.
Thú vị hơn nữa, Terra và Luna cũng theo sát ngay phía sau, lần lượt là 44.7 và 43.3.
Đáng chú ý là, Luna thuộc phân khúc rẻ nhất trong thế hệ này, điểm phát hiện của nó vẫn đè bẹp flagship của thế hệ trước.
Về khía cạnh đếm, điểm số cũng đang tăng.
Độ chính xác của Sol tăng từ 64.9% của GPT-5.5 lên 73%, Terra và Luna lần lượt là 67.6% và 66.2%.


Vậy thì, GPT-5.6 cụ thể mạnh ở điểm nào?
Nhận diện bố cục tài liệu là ấn tượng nhất, tiêu đề, nội dung chính, bảng biểu, hình minh họa, chữ ký, Sol đều có thể khoanh ra một cách gọn gàng.
Điều này không phải chuyện nhỏ với những người xử lý hợp đồng, hóa đơn, báo cáo: hầu như bước đầu tiên trong mọi quy trình xử lý tài liệu, đều là tìm xem "cần nhìn vào phần nào", rồi mới nhận diện chữ.

Ngay cả những cảnh dày đặc, GPT-5.6 cũng chịu được.
Những hình ảnh như thuốc viên, trứng gà - hàng chục vật thể giống nhau chen chúc nhau - vốn là sân khấu "lật kèo" truyền thống của VLM.
Bởi vì việc mô hình lớn vẽ khung, là việc đưa ra từng tọa độ một, càng nhiều đồ vật, đầu ra càng dài, xác suất bỏ sót, lặp lại, viết sai tọa độ càng cao.


Thậm chí còn có cái khó hơn: một tấm bia tập bắn, chỉ yêu cầu nó đếm những lỗ đạn rơi vào vùng vòng điểm chỉ định.
Sol làm đúng ngay, nó không chỉ biết phải đếm cái gì, mà còn biết quy tắc áp dụng đến đâu.
Không thể không nói, sự tiến bộ ở phần này là có thực.


Toàn năng? Không tồn tại đâu
Đoạn phản trực giác nhất là đây: khả năng nhận diện chữ viết của Sol, lại là thụt lùi.
Chuyển viết toàn bộ đoạn OCR, Sol đạt 90.7%, thấp hơn nửa điểm so với 91.2% của GPT-5.5, không khác biệt lớn.
Nhưng mục "trích xuất định hướng" này, không cần toàn văn, chỉ cần một thông tin đó, ví dụ như lôi ngày tháng trên hóa đơn ra, Sol chỉ đạt 82.5%, GPT-5.5 là 87.6%, giảm 5 điểm.
Nó không phải không đọc được chữ. Ghi chú viết tay nó có thể chuyển viết cả đoạn, cũng có thể chính xác chọn ra ngày tháng, mã số kích thước in trên mặt lốp xe bẩn nó đọc được.
Còn nữa, tỷ số trực tiếp trên màn hình phát sóng trận đấu khúc côn cầu, nó có thể đưa ra theo định dạng bạn chỉ định.
Hỏng là ở dòng hạn sử dụng trên vỉ thuốc: chữ nhỏ, xếp dọc, độ tương phản thấp, lại còn bị phản sáng.




Một mô hình có thể đọc hiểu hình ảnh phát sóng trận đấu, lại không đọc ra hộp thuốc trên tay bạn khi nào hết hạn.


OpenAI thừa nhận, ảnh lớn một cái là khung bay
Trên một số hình ảnh, khung phát hiện mà Sol trả về sẽ bay đến những chỗ chẳng liên quan gì trong khung hình.
Gần như không chồng lấn chút nào với vật thể thực, và những khung này thường sắp xếp cực kỳ ngay ngắn: một đường thẳng, hoặc một nhóm phân bố đều.
Roboflow đã gửi những mẫu này cho OpenAI. Phản hồi của đối phương rất dứt khoát: Sol trở nên không ổn định khi kích thước ảnh đạt khoảng 2000x2000 pixel trở lên, mức độ suy luận càng thấp, càng không ổn định.
Có hai cách giải quyết. Một là điều chỉnh mức suy luận lên cao, ổn định thì ổn định, nhưng lượng Token sử dụng, độ trễ, hóa đơn đều tăng theo.
Hai là cách thô sơ nhưng hiệu quả nhất: trước khi gửi cho API, hãy thu nhỏ ảnh lại hoặc cắt một nhát.

Xem xét lại toàn bộ hóa đơn, chi phí và tốc độ thực tế từ Roboflow:
Sol: khoảng 2.5 cent/ảnh, khoảng 10 giây; Terra: khoảng 1 cent/ảnh, khoảng 6 giây; Luna: dưới 0.5 cent/ảnh, khoảng 5 giây
Trong khi Gemini 3.5 Flash là 0.8 cent/ảnh, rẻ hơn Sol hai phần ba, mà phát hiện và đếm trên bộ tiêu chuẩn này vẫn tiếp tục dẫn đầu.
Đối mặt với các nhiệm vụ phát hiện đếm tần suất cao, số lượng lớn, Gemini Flash vẫn là "vua tỷ lệ giá-trị".
Vì vậy, điều thực sự bất ngờ lần này của GPT-5.6 Sol, là khả năng thị giác đang từ "hiểu một bức ảnh", bước sang "thực sự làm công việc thị giác".

Tìm mục tiêu, vẽ khung, đếm, hiểu mối quan hệ không gian, phân tích bố cục tài liệu.
Những lĩnh vực trước đây vốn giống như địa bàn của các mô hình thị giác chuyên dụng, giờ đây đang bị mô hình lớn ăn dần từng chút một.
Hiệp hai của mô hình thị giác lớn, đã từ "có hiểu được không" chuyển sang cuộc đua "làm việc có chính xác không".
GPT-5.6 đã phô diễn cơ bắp, nhưng cuộc chiến về tỷ lệ giá-trị, mới chỉ vừa bắt đầu.
Bài viết từ tài khoản công chúng WeChat "Tân Trí Nguyên", tác giả: ASI Khải Thị Lục








