Anthropic đã tung một bài toán có cái bẫy ẩn bên trong cho mô hình mới của họ.
Nhiệm vụ: đây là bản vẽ một chi tiết máy — hãy viết code để tái tạo nó thành mô hình 3D trên FreeCAD, phần mềm kỹ thuật miễn phí mà dân thiết kế dùng để mô phỏng vật thể thật. Cái bẫy ở đây: mô hình được giao file ảnh nhưng chẳng có cách nào thực sự “nhìn” thấy nó. Không có công cụ vision (nhìn ảnh). Chỉ là một file mà nó không thể mở theo cách bình thường.
Đại đa số AI sẽ dừng lại ở đó, hoặc bịa ra một thứ gì đó. Nhưng Claude Opus 5 thì không. Nó tự viết một chương trình vision nhỏ từ con số 0 — code để đọc trực tiếp pixel, tìm cạnh và hình khối, rồi rút ra chiều dài, góc độ từ chính tấm ảnh mà về lý thuyết nó không được phép “nhìn”. Sau đó, nó dùng thứ đó để dựng lại toàn bộ chi tiết máy ở dạng 3D. Làm đi làm lại nhiều lần. Anthropic khẳng định không đối thủ nào, dù được giao cùng điều kiện, có thể giải quyết bài toán này chỉ trong 5 lần thử.
Đây mới chính là điểm đáng chú ý trong đợt ra mắt này. Không phải giá, cũng chẳng phải thành tích benchmark, mà là hành động: khi chạm tường, mô hình tự mày mò chế công cụ để leo qua. Bây giờ, hãy cùng đi sâu xem Opus 5 thực chất là gì, sức mạnh ra sao, và trung thực mà nói, nó đứng thế nào so với ChatGPT — vì câu trả lời phức tạp hơn nhiều so với tiêu đề báo chí thường viết.
Claude Opus 5 thực chất là gì
Claude Opus 5 là mô hình mới nhất từ Anthropic, công ty đứng sau Claude. Nó chính thức đi vào hoạt động ngày 24 tháng 7 năm 2026, và bạn có thể dùng ngay bây giờ trên Claude.ai, qua Claude API, trong Claude Code, và cả Claude Cowork.
Nói một cách đơn giản nhất: Anthropic chia AI của họ thành nhiều phân khúc. Fable 5 là phân khúc đỉnh cao nhất, thông minh nhất nhưng cũng đắt đỏ nhất — dòng frontier (tiên phong). Opus nằm ngay bên dưới: vẫn cực kỳ mạnh mẽ, nhưng được thiết kế để trở thành công cụ xử lý chính bạn chạy suốt ngày dài. Thông điệp của Opus 5 là nó đạt được độ thông minh gần bằng Fable 5, nhưng chi phí chạy lại rẻ hơn rất nhiều. Như một trong những người sáng lập Cursor từng nhận xét: “độ thông minh gần bằng Fable 5, nhưng với tốc độ và chi phí của Opus”.
Còn nếu bạn cần con số cụ thể: ID của model là claude-opus-5. Giá là $5 cho mỗi 1 triệu input tokens và $25 cho mỗi 1 triệu output tokens — hoàn toàn giống với model nó kế nhiệm là Opus 4.8. (Một token Roughly bằng 3/4 từ tiếng Anh; 1 triệu token tương đương khoảng 750.000 từ tiếng Việt). Vậy cụm “rẻ hơn một nửa” nghĩa là rẻ hơn so với Fable 5, chứ không phải rẻ hơn Opus 4.8 — giá trên mỗi token là y hệt. Opus 5 hiện là model mặc định trên gói Claude Max, và là model mạnh nhất bạn có thể chọn trên Claude Pro.
Đi kèm với nó là hai tính năng nhỏ nhưng rất thực tế cho dân build ứng dụng: giờ đây bạn có thể đổi tool (công cụ) mà model đang dùng ngay giữa cuộc hội thoại trên nền tảng Claude, thay vì phải bắt đầu lại từ đầu. Plus, API có thể tự động chuyển fallback về Opus 4.8 nếu request Opus 5 gặp lỗi — một lớp lưới an toàn cho ai đang tích hợp Claude vào ứng dụng thật đang chạy.

Trang ra mắt của Anthropic, ngày 24 tháng 7 năm 2026 — Opus 5 là mặc định mới trên Claude Max và model mạnh nhất trên Claude Pro. Nguồn: Anthropic.
Tại sao khả năng giải quyết vấn đề mới lại quan trọng
Hầu hết các bài benchmark chỉ đo xem mô hình có “biết” kiến thức hay không. Câu chuyện FreeCAD đo một thứ khác — khả năng ứng biến. Vì không được cấp công cụ vision, Opus 5 tự viết lấy một cái. Nó coi điểm chết là bài toán cần tìm lối thoát kỹ thuật, chứ không phải lý do để bỏ cuộc.
Anthropic củng cố điều này bằng benchmark ARC-AGI-3, được thiết kế để test tư duy trên những bài toán mô hình chưa từng gặp — loại mà bạn không thể học thuộc lòng để qua mặt. Trên bài test này, Opus 5 đạt điểm cao gấp khoảng 3 lần mô hình đứng thứ hai. Tại sao dân không code cũng nên quan tâm? Vì “vấn đề mới” chính là mô tả cho phần lớn công việc thực tế: một khiếu nại khách hàng lạ tai không nằm trong bất kỳ kịch bản nào, một file Excel bị lỗi theo kiểu chẳng có tutorial nào hướng dẫn. Một model chỉ xử lý được tình huống sách giáo khoa chỉ giống trò biểu diễn. Còn một model biết tư duy để xử lý tình huống chưa ai viết hướng dẫn, mới đúng là công cụ bạn có thể dựa vào.
Các con số benchmark, nói thật
Đâu ra bài ra mắt nào cũng chỉ chọn lọc chiến thắng của mình, nên dưới đây là những con số công bố của Anthropic, kèm theo đầy đủ các lưu ý. Anthropic đưa Opus 5 so găng trực tiếp với GPT-5.6 của OpenAI — bản “Sol” — ngay trên trang chủ ra mắt.

Bảng so sánh chính thức của Anthropic, với GPT-5.6 Sol ở cột bên phải — Opus 5 dẫn đầu hầu hết các bài test, nhưng không phải tất cả. Nguồn: Anthropic.
Đọc thẳng vào, đây là kết quả thật, chứ không phải thành tích áp đảo hoàn toàn. Trên các bài test được Anthropic chọn, Opus 5 dẫn trước GPT-5.6 Sol ở hầu hết các mục:
- Agentic terminal coding (Frontier-Bench): 43,3% so với 34,4%
- Knowledge work (GDPval-AA): 1.861 so với 1.736
- Novel problem-solving (ARC-AGI-3): 30,2% so với 7,8%
- Computer use (OSWorld 2.0): 70,6% so với 62,6%
- Business workflows (AutomationBench): 26,0% so với 18,1%
- Agentic web search (BrowseComp): gần như hòa, 90,8% so với 90,4%
Nhưng đây mới là phần mà báo chí thường giấu đi: GPT-5.6 Sol thắng ở những nơi lập trình viên thực sự sống. Trên DeepSWE, một benchmark coding thực tế, GPT-5.6 Sol đạt 72,7% so với 68,8% của Opus 5 — thắng không chỉ Opus 5 mà cả Fable 5. Nó cũng nhỉnh hơn Opus 5 một chút trên bài test sức khỏe chuyên nghiệp HealthBench (60,5% so với 59,8%). Vậy nên “Opus 5 đánh bại ChatGPT” không phải là điều bảng này nói. Nó nói rằng: Opus 5 dẫn trước trên phần lớn bài test do Anthropic chọn, model của ChatGPT thực sự tốt hơn ở một số mảng coding, và khoảng cách không quá xa.
Hai lưu ý quan trọng trước khi bạn xăm bất cứ điều nào vào da mình. Thứ nhất, Anthropic là người chọn bài test và đối thủ so găng — phòng lab nào cũng benchmark trong ánh sáng đẹp nhất của mình, đó chính là lý do bạn nên chờ kết quả từ bên ngoài. Thứ hai, các trang đánh giá độc lập chưa chấm điểm cho Opus 5. Trên chỉ số trí tuệ của Artificial Analysis (thuộc về bên thứ ba, không của hãng nào), Fable 5 đang đứng ở mức 60, GPT-5.6 Sol ở 59, và Opus 4.8 ở 56 — Opus 5 chưa có mặt. Khi nó xuất hiện ở đó, đó mới là con số đáng tin hơn mọi biểu đồ ngày ra mắt.
Còn cái bài đăng lan truyền gần đây khẳng định “Opus 5 thắng GPT-5.6 trên SWE-Bench Pro”? Bảng của Anthropic hoàn toàn không dùng SWE-Bench Pro — và trên bài test coding họ có công bố, GPT-5.6 Sol mới là người giành chiến thắng. Hãy coi đó là tin đồn chưa được xác thực, không phải sự thật.
Tại Việt Nam, cộng đồng báo chí và developer đang tập trung vào một con số hơn cả — đó là giá, và giá này không đổi. Với dân dev và chủ doanh nghiệp nhỏ tại đây, những người dè dặt từng đồng chi API, thì “nhiều năng lực model hơn với cùng mức giá trên mỗi token” mới là tiêu đề thực sự đáng quan tâm.
Những điều nó không làm được, và những gì chúng ta vẫn chưa rõ
Mục nói thật, vì niềm tin còn giá trị hơn doanh số.
Opus 5 không phải model mạnh nhất của Anthropic — danh hiệu đó vẫn thuộc về Fable 5. Opus 5 là lựa chọn về giá: mang phần lớn năng lực frontier với một nửa chi phí, chứ không phải đỉnh núi cao nhất. Với các dự án chạy tự động hàng giờ liền, Anthropic vẫn khuyến nghị dùng Fable 5.
Nó được thiết kế cân bằng cố ý ở một điểm: an ninh mạng. Trên lĩnh vực này, Opus 5 giỏi ngang với một model chuyên biệt tên là Mythos 5 trong việc phát hiện lỗ hổng phần mềm — nhưng tụt xa hẳn so với Mythos 5 khi phải tự xây dựng exploit để khai thác. Khoảng cách này là có chủ đích: bạn muốn một model biết chỉ ra cánh cửa đang mở, chứ không muốn nó giỏi lao vào đạp cửa.
Cửa sổ ngữ cảnh (context window) vẫn chưa được xác nhận chính thức. Dòng Opus trước đó đã chạy với cửa sổ 1 triệu token (khoảng 750.000 từ) suốt nhiều tháng, và báo chí đầu tiên mặc định Opus 5 giữ nguyên con số này — nhưng tài liệu chính thức của Anthropic vẫn chưa nhắc đến tên Opus 5. Vậy hãy coi 1M là khả năng cao, nhưng chưa phải sự thật xác nhận. Và nhớ rằng mọi con số trên đều do Anthropic tự báo cáo trên các bài test họ chọn — đó là xu hướng, không phải chân lý tuyệt đối, và điểm số từ bên thứ ba thường sẽ cập nhật trong vòng vài tuần tới.
Điều này nghĩa là gì với bạn
Nếu bạn đang dùng Claude Pro hoặc Max, bạn đã được nâng cấp — không cần thao tác gì thêm. Opus 5 là mặc định trên Max và là lựa chọn mạnh nhất trên Pro. Bước tiếp theo là tin tưởng nó với những thứ phức tạp hơn — báo cáo lộn xộn, file tính toán rối rắm — thay vì cố chia nhỏ mọi thứ thành từng bước quá đơn giản.
Nếu bạn làm nghề viết lách, lập kế hoạch hoặc phân tích, đây là công cụ vận hành hàng ngày cực kỳ chắc tay với mức giá không làm bộ phận kế toán lo lắng. Và khi gặp task thực sự lạ hoắc — không template sẵn, không đường ray rõ ràng — đây chính là loại model được sinh ra để tư duy xuyên suốt thay vì đứng hình.
Nếu bạn code hoặc chạy tự động hóa, các con số về coding và agent là điểm sáng, cộng thêm tính năng đổi tool giữa chừng. Hãy thử nghiệm nghiêm túc trên chính codebase của bạn, đừng chỉ làm demo đồ chơi. Nhưng nhớ theo dõi chi phí token kỹ — một model rẻ hơn trên mỗi token vẫn có thể “đắt” hơn nếu nó mất nhiều thời gian suy nghĩ cho mỗi task.
Nếu bạn đang phân vân giữa Claude và ChatGPT, đừng chọn theo benchmark của tuần này. Hãy chọn theo cách bạn thực sự làm việc — giao diện, giọng văn viết, hệ sinh thái công cụ bạn đang dùng. Khả năng cốt lõi của chúng gần nhau đến mức độ phù hợp quan trọng hơn điểm số chênh lệch vài phần trăm. Nếu bạn còn phân vân giữa Claude và ChatGPT, khóa học ChatGPT vs Gemini vs Claude của chúng tôi sẽ hướng dẫn bạn cách chọn dựa trên quy trình làm việc thực tế của chính mình.
Tóm lại
Opus 5 không gây ấn tượng vì nó là AI thông minh nhất Trái Đất — nó không phải vậy. Nó gây chú ý vì đã kéo năng lực gần frontier xuống mức giá của một công cụ văn phòng, và chứng minh được khả năng tự tạo đường đi khi gặp ngõ cụt. Với phần lớn công việc thực tế, “phần lớn năng lực đỉnh cao với một nửa chi phí” là deal tốt hơn nhiều so với “tốt nhất tuyệt đối, kèm mức giá premium”.
Câu hỏi so với ChatGPT cũng không có kết luận một chiều — con số của Anthropic cho thấy Opus 5 dẫn trước ở hầu hết bài test, còn GPT-5.6 dẫn trước ở một số mảng coding, và các nhà đánh giá độc lập vẫn chưa ra quyết định. Vậy phản ứng đúng nhất trước một đợt ra mắt công nghệ mới không phải là đổi tool ngay lập tức. Đó là làm chủ đủ tốt các công cụ bạn đang dùng, để có thể đánh giá công cụ mới dựa trên chính kết quả bạn đạt được, một cách nhanh nhất. Kỹ năng đó — thực sự biết cách khai thác model để ra kết quả — mới là thứ trả tiền cho bạn, bất kể phòng lab nào đang thắng trong tháng này. Đó chính xác là mục tiêu của khóa học Claude AI: A Complete Guide — giúp bạn dùng thật tốt công cụ bạn đang có.
Nguồn: Anthropic · The Decoder · CNBC