16 tháng 4, 2026
GPT-5.4 và Claude Opus 4.7: Mô hình nào cho AI agent vận hành thực tế?
GPT-5.4 dẫn đầu computer use với 75% OSWorld. Opus 4.7 dẫn đầu agentic coding với 64.3% SWE-bench Pro. Đây là khung định tuyến mà các đội vận hành thực tế dùng.
Trọng tâm bài viết
GPT-5.4 và Claude Opus 4.7 đều không thắng trong mọi tình huống. Quyết định khi vận hành không phải chọn mô hình nào, mà là giao tác vụ nào cho mô hình nào.
Mục lục
GPT-5.4 và Claude Opus 4.7 đều không phải mô hình tốt hơn trong mọi tình huống. GPT-5.4 dẫn đầu computer use và tự động hóa desktop, đạt 75% trên OSWorld và vượt hiệu năng chuyên gia con người. Claude Opus 4.7 dẫn đầu agentic coding và viết phức tạp, đạt 64.3% trên SWE-bench Pro so với 57.7% của GPT-5.4. Quyết định khi vận hành không phải chọn mô hình nào, mà là giao tác vụ nào cho mô hình nào.
Đội ngũ định tuyến mù quáng đến một model sẽ trả tiền cho năng lực không cần ở bước đơn giản, hoặc chấp nhận chất lượng thấp hơn ở bước quan trọng nhất. Cả hai model ra mắt cách nhau sáu tuần, đều có cửa sổ ngữ cảnh 1M token và đều có trên các nền tảng cloud lớn. Khác biệt đáng chú ý hẹp và cụ thể hơn phần lớn bài viết so sánh thể hiện.
Điểm chính
- Claude Opus 4.7 dẫn đầu agentic coding: 64.3% SWE-bench Pro so với 57.7% của GPT-5.4, cùng số tác vụ vận hành thực tế xử lý cao gấp 3 lần trên benchmark codebase thật của Rakuten.
- GPT-5.4 dẫn đầu computer use: 75% OSWorld, là model AI đầu tiên vượt hiệu năng chuyên gia con người với 72.4% ở tự động hóa desktop.
- API tiêu chuẩn của GPT-5.4 rẻ hơn ở mức $2.50/$15 mỗi triệu token so với $5/$25 của Opus 4.7, nhưng mức giảm 90% nhờ prompt caching của Claude thu hẹp khoảng cách với agent có system prompt ổn định.
- GPT-5.4 Pro có giá $30/$180 mỗi triệu token, thuộc nhóm chi phí hoàn toàn khác và chỉ phù hợp với trường hợp rủi ro cao cụ thể.
- Phần lớn kiến trúc agent vận hành thực tế dùng cả hai model, định tuyến theo loại tác vụ thay vì chỉ cam kết với một model.
So sánh benchmark
Trước khung quyết định là các con số. Cả hai model đều đạt điểm tốt, nhưng mỗi model có một thế mạnh rõ ràng.
| Benchmark | Claude Opus 4.7 | GPT-5.4 | Bên dẫn đầu | | ------------------------------------ | --------------------- | ----------------- | ----------- | | SWE-bench Pro, agentic coding | 64.3% | 57.7% | Claude | | SWE-bench Verified | 87.6% | khoảng 77.2% | Claude | | OSWorld, computer use | khoảng 72.7% | 75.0% | GPT-5.4 | | Chất lượng viết, đánh giá mù Q1 2026 | 47% được ưa thích | 29% được ưa thích | Claude | | Cửa sổ ngữ cảnh | 1M token | 1M token | Hòa | | Giá đầu vào tiêu chuẩn | $5.00/M | $2.50/M | GPT-5.4 | | Giá đầu ra tiêu chuẩn | $25.00/M | $15.00/M | GPT-5.4 | | Tiết kiệm prompt/cache | tới 90% | 50%, tự động | Claude | | Cross-session memory | Có | Hạn chế | Claude |
Nguồn: SWE-bench Pro Leaderboard, Scale AI và Anthropic Claude Opus.
Bảng cho thấy câu chuyện khá rõ. GPT-5.4 thắng ở tự động hóa desktop và giá API tiêu chuẩn. Claude Opus 4.7 thắng ở độ chính xác lập trình, chất lượng viết và quy trình cần bộ nhớ bền vững. Không model nào thống trị mọi khía cạnh, chính vì vậy đội vận hành thực tế định tuyến qua cả hai.
GPT-5.4 dẫn đầu ở đâu: computer use và tự động hóa desktop
Năng lực đáng chú ý nhất của GPT-5.4 là computer use tích hợp sẵn. Mô hình đạt 75% trên OSWorld, benchmark đo khả năng agent điều hướng ứng dụng desktop bằng screenshot, bàn phím và chuột, đồng thời là model đa dụng đầu tiên vượt chuyên gia con người với mức 72.4%.
Đây không phải plugin hoặc lớp bọc. Computer use được xây vào model. Trong API, GPT-5.4 có thể vận hành ứng dụng trực tiếp, phát lệnh Playwright, nhấp phần tử giao diện và xử lý quy trình nhiều bước trên phần mềm desktop tiêu chuẩn.
Hãy xem ý nghĩa của điều này với đội data engineering chạy quy trình phụ thuộc UI. Pipeline cần đăng nhập cổng thông tin nhà cung cấp, trích xuất báo cáo, định dạng lại và đẩy hạ nguồn giờ đây có thể chạy như một bước agent thay vì script mong manh. Kiểu lỗi thay đổi: thay vì selector hỏng khi nhà cung cấp thiết kế lại UI, agent đọc màn hình và thích ứng.
GPT-5.4 cũng có Tool Search, tính năng API mới cho phép agent dùng chỉ mục công cụ nhẹ thay vì truyền mô tả đầy đủ của mọi công cụ trong system prompt. Với agent kết nối đồng thời HubSpot, Zendesk, Slack và API nội bộ, điều này giảm chi phí token và cải thiện độ chính xác chọn công cụ.
Dùng GPT-5.4 cho:
- agent kiểu RPA vận hành ứng dụng desktop hoặc web
- quy trình tự động hóa trình duyệt, nơi agent tương tác với UI thay vì scraping HTML
- agent quản lý registry công cụ lớn, nơi Tool Search giảm chi phí system prompt
- tác vụ computer use, nơi độ chính xác 75% OSWorld quan trọng hơn độ chính xác lập trình
Nếu xây quy trình phát triển AI agent vận hành thực tế có tự động hóa UI cùng các bước data engineering, GPT-5.4 có thể là model phù hợp cho lớp computer use.
Claude Opus 4.7 dẫn đầu ở đâu: agentic coding và viết
Hiệu năng mạnh nhất của Claude Opus 4.7 nằm ở tác vụ viết, kiểm tra code vận hành hoặc tạo đầu ra bằng văn bản phức tạp, nơi chất lượng và tuân thủ hướng dẫn quan trọng.
Trên SWE-bench Pro, Opus 4.7 đạt 64.3% so với 57.7% của GPT-5.4. Khoảng cách 6.6 điểm này lớn hơn vẻ ngoài trên benchmark đo issue GitHub thật trong codebase vận hành, không phải câu đố tổng hợp. Trên benchmark nội bộ Rakuten chạy code vận hành thật, Opus 4.7 xử lý số tác vụ gấp ba Opus 4.6, với mức tăng hai chữ số ở Code Quality và Test Quality. Trên benchmark 93 tác vụ nội bộ, Opus 4.7 giải được bốn tác vụ mà cả Opus 4.6 và Sonnet 4.6 không giải được.
Chênh lệch chất lượng viết cũng nhất quán. Trong đánh giá mù bởi con người vào Q1 2026, nội dung do Claude tạo được ưa thích 47% so với 29% của GPT-5.4. Với đội chạy research agent tạo bản tóm tắt phân tích hoặc tóm tắt điều hành, mức ưa thích đó xuất hiện trong chất lượng đầu ra thực tế.
Cross-session memory của Opus 4.7 thay đổi điều khả thi với quy trình dài hạn. Research agent theo dõi đối thủ qua nhiều tuần, hệ thống phân loại hỗ trợ học từ các vụ việc trước, hoặc RevOps agent tích lũy hiểu biết về mẫu giao dịch đều hưởng lợi từ ngữ cảnh bền vững không cần nạp lại thủ công. GPT-5.4 hỗ trợ hạn chế cho mô hình này; Opus 4.7 xử lý nó tự nhiên.
Một đội vận hành quy trình nghiên cứu đa agent gần đây đã đổi cấu trúc kiến trúc sau khi thử cả hai model trên việc tạo bản tóm tắt. GPT-5.4 tạo đầu ra nhanh hơn ở bước tìm kiếm. Ở lớp tổng hợp, hợp nhất mười nguồn thành tóm tắt điều hành ngắn gọn, Opus 4.7 tạo đầu ra mà đội tin để gửi lãnh đạo không cần chỉnh sửa. Quyết định định tuyến tự trở nên rõ ràng.
Dùng Claude Opus 4.7 cho:
- coding agent viết, kiểm tra hoặc gỡ lỗi code vận hành
- research agent tổng hợp nguồn thành đầu ra văn bản hoàn chỉnh
- quy trình dài hạn hưởng lợi từ cross-session memory
- cổng quyết định phức tạp, nơi chất lượng đầu ra tạo ra hệ quả kinh doanh hạ nguồn
- pipeline agentic liên quan mô hình dbt, tạo DAG hoặc script di trú
Bài dịch vụ phát triển AI agent của chúng tôi giải thích cách thiết kế định tuyến chuyển cấp và độ tin cậy khi việc chọn model cơ sở đã phù hợp.
Bài toán giá: GPT-5.4 rẻ hơn, cho đến khi không còn
Giá API tiêu chuẩn của GPT-5.4 là $2.50 mỗi triệu token đầu vào và $15 mỗi triệu token đầu ra. Claude Opus 4.7 có giá $5/$25. Nhìn bề ngoài, GPT-5.4 rẻ hơn 50% ở đầu vào và 40% ở đầu ra.
Hai điều làm thay đổi so sánh này.
Thứ nhất, prompt caching. Prompt caching của Anthropic giảm chi phí đầu vào tới 90% cho agent có system prompt lớn, ổn định. Research agent có system prompt 100,000 token gồm schema công cụ, hướng dẫn, tài liệu chính sách và ngữ cảnh truy xuất sẽ giảm chi phí đầu vào của phần cache từ $0.50 mỗi lượt xuống $0.05. Với 100 lần hoàn tất quy trình mỗi tháng, đó là $50/tháng so với $5/tháng cho riêng phần cache. Mức giảm cache tự động 50% của GPT-5.4 hữu ích, nhưng mức trần 90% của Claude thay đổi phép tính cho agent kiến trúc tốt chạy ở quy mô lớn.
Thứ hai, GPT-5.4 Pro. Với trường hợp cần hiệu năng tối đa, OpenAI cung cấp GPT-5.4 Pro ở mức $30/$180 mỗi triệu token. Đây là giá đầu vào gấp sáu lần và đầu ra gấp mười hai lần bản tiêu chuẩn. Ở mức này, nó là công cụ chuyên biệt cho tác vụ rủi ro cao cụ thể, không phải model mặc định cho quy trình agent vận hành.
Hướng dẫn thực tế là tính toán theo kích thước system prompt và khối lượng gọi cụ thể trước khi cho rằng GPT-5.4 rẻ hơn đáng kể ở quy mô lớn. Với agent có system prompt ổn định, được thiết kế tốt, khoảng cách chi phí khi có caching nhỏ hơn giá niêm yết cho thấy.
Khung định tuyến khi vận hành thực tế
Phần lớn đội đã đưa agent vào vận hành không chạy một model duy nhất. Họ định tuyến theo loại tác vụ và dùng model phù hợp nhất cho từng bước.
Kiến trúc research agent phản ánh thực hành tốt hiện nay:
Lập kế hoạch và phân rã tác vụ: Claude Opus 4.7. Suy luận dài hạn, phân rã chính xác yêu cầu mơ hồ và cross-session memory về nghiên cứu trước khiến đây là model phù hợp cho bước thiết lập mọi thứ hạ nguồn.
Tìm kiếm và truy xuất: Sonnet 4.6 hoặc Haiku 4.5. Phân loại và xếp hạng đơn giản với chi phí mỗi lượt gọi thấp hơn.
Bước computer use, truy cập cổng, điều hướng UI, trích xuất dữ liệu từ màn hình: GPT-5.4. Computer use tự nhiên với độ chính xác 75% OSWorld xử lý các bước này đáng tin hơn.
Tạo và kiểm tra code: Claude Opus 4.7. Khoảng cách SWE-bench Pro đủ nhất quán để tin dùng cho tác vụ code vận hành.
Tổng hợp bản tóm tắt hoặc báo cáo cuối: Claude Opus 4.7. Chất lượng viết và tuân thủ hướng dẫn cho đầu ra cần ít chỉnh sửa hơn trước khi giao.
Câu hỏi kiến trúc không phải “GPT-5.4 hay Claude Opus 4.7?” mà là “model nào xử lý mỗi bước đủ đáng tin để giao đầu ra, ở mức chi phí nào, và câu trả lời sai sẽ tạo hệ quả hạ nguồn đáng kể ở đâu?” Đặt human review tại các điểm có hệ quả đó thay vì mọi bước giúp kiến trúc gọn mà không hy sinh độ tin cậy. Chúng tôi đã nói về hiệu chỉnh này trong bài AI agent với kiểm duyệt của con người.
Mô hình định tuyến này cũng có ý nghĩa thực tế với đội bắt đầu mới: đừng khóa framework agent vào một nhà cung cấp model. LangGraph, CrewAI và Anthropic SDK đều hỗ trợ định tuyến đa model. Xây tính linh hoạt đó ngay từ đầu gần như không tốn nhiều, đồng thời tránh refactor đau đớn khi bản phát hành model tiếp theo thay đổi bối cảnh benchmark.
Kết luận
So sánh GPT-5.4 và Claude Opus 4.7 không phải câu hỏi bên nào thắng hết. GPT-5.4 tạo ra bước tiến thật ở computer use và tự động hóa desktop. Claude Opus 4.7 tạo ra bước tiến thật ở agentic coding và cross-session memory. Cả hai chạy với cửa sổ ngữ cảnh 1M token, đều có trên nền tảng lớn và đều có giá cho vận hành thực tế.
Đội tận dụng tốt nhất các bản phát hành này sẽ xem chọn model là quyết định kiến trúc định tuyến, không phải sở thích nhà cung cấp. Hãy chọn model xử lý mỗi bước đủ đáng tin để giao đầu ra với chi phí có thể biện minh, và xây tính linh hoạt để thay đổi phân công đó khi bản phát hành tiếp theo thay đổi benchmark.
Nếu đang xác định phạm vi AI agent vận hành thực tế và muốn có ý kiến thứ hai về kiến trúc lớp định tuyến model, hãy xem dịch vụ phát triển AI agent hoặc case study phân loại và chuyển cấp hỗ trợ bằng AI để xem ví dụ vận hành thực tế về định tuyến đa model dưới tải.
Câu hỏi thường gặp
Những câu hỏi người đọc thường đặt ra tiếp theo.
Các câu trả lời ngắn này làm rõ những câu hỏi thực tế thường xuất hiện sau khi đọc bài viết.
Bạn cần một hệ thống tương tự?
Nếu bài viết này phản ánh một quy trình đội ngũ bạn đang vận hành, bước tiếp theo thường là rà soát có phạm vi về hệ thống, ràng buộc và lộ trình triển khai.
Đặt lịch rà soát quy trình miễn phí tại đây.
