Đi đến nội dung chính
Quay lại bài viết

16 tháng 4, 2026

Claude Opus 4.7: Những thay đổi và khi nào nên dùng cho AI agent vận hành thực tế

Claude Opus 4.7 đạt 64.3% trên SWE-bench Pro, tăng 11 điểm so với 4.6. Những gì thay đổi cho AI agent vận hành thực tế và quyết định định tuyến mà nhiều đội ngũ bỏ lỡ.

Bởi Tran Tien Van12 phút đọc

Trọng tâm bài viết

Opus 4.7 là nâng cấp cho vận hành thực tế, không chỉ là cuộc đua benchmark. Đây là ý nghĩa của adaptive thinking, cross-session memory và mức tăng 13% về lập trình với các đội đang chạy AI agent.

Claude Opus 4.7 là mô hình phổ biến rộng rãi có năng lực cao nhất của Anthropic, được phát hành hôm nay. Mô hình đạt 64.3% trên SWE-bench Pro, tăng 11 điểm so với Opus 4.6, đồng thời có adaptive thinking, cross-session memory và xử lý hình ảnh đến 2,576px. Với đội ngũ đang vận hành AI agent, đây là nâng cấp có ý nghĩa theo những cách bảng benchmark không thể hiện hết.

Phần lớn nội dung về một lần ra mắt mô hình mới đọc như thông cáo báo chí. Bài này không như vậy. Phần dưới phân tích thực tế Opus 4.7 thay đổi gì, các số benchmark chuyển thành cải thiện quy trình ra sao và cách quyết định nên đưa mô hình vào stack vận hành ngay hôm nay hay sau ba tháng.

Điểm chính

  • Claude Opus 4.7 đạt 64.3% trên SWE-bench Pro, cao hơn GPT-5.4 với 57.7% và Gemini 3.1 Pro với 54.2%, đồng thời xử lý số tác vụ lập trình vận hành thực tế gấp 3 lần Opus 4.6.
  • Adaptive thinking tự điều chỉnh compute theo độ phức tạp tác vụ. Opus 4.7 suy nghĩ sâu hơn với vấn đề khó và phản hồi nhanh hơn với vấn đề đơn giản, điều này quan trọng với agent kết hợp gọi công cụ thường lệ cùng quyết định phức tạp.
  • Cross-session memory cho agent mang ngữ cảnh qua các phiên, thay đổi những gì khả thi với nghiên cứu dài hạn, RevOps và quy trình pipeline dữ liệu.
  • Giá $5/$25 mỗi triệu token không đổi so với Opus 4.6, nhưng prompt caching giảm chi phí thực tế tới 90% cho agent có system prompt lặp lại.
  • Dùng Opus 4.7 cho tác vụ agentic dài hạn, lập trình phức tạp và quyết định rủi ro cao. Dùng Sonnet 4.6 cho phần lớn bước agent tiêu chuẩn. Dùng Haiku 4.5 cho truy xuất và phân loại khối lượng lớn.

Có gì mới trong Claude Opus 4.7

Bốn thay đổi quan trọng về vận hành là adaptive thinking, cross-session memory, độ phân giải hình ảnh và hiệu năng lập trình.

Adaptive thinking

Opus 4.7 tự điều chỉnh lượng compute phân bổ theo độ phức tạp tác vụ. Với việc trích xuất thường lệ hoặc phân loại đơn giản, nó phản hồi nhanh. Với tác vụ gỡ lỗi code nhiều bước hoặc quyết định phức tạp có tín hiệu mâu thuẫn, nó phân bổ thêm suy luận nội bộ trước khi trả lời.

Với agent vận hành thực tế, điều này giảm một đánh đổi phổ biến. Trước đây, đội ngũ phải chọn giữa Opus, kỹ lưỡng nhưng chậm với tác vụ đơn giản, và Sonnet, nhanh nhưng đôi khi hời hợt với tác vụ khó. Adaptive thinking giúp Opus 4.7 phù hợp hơn trong toàn bộ khoảng này.

Ý nghĩa thực tế là quy trình kết hợp gọi công cụ độ phức tạp thấp với các quyết định phức tạp không còn cần tách định tuyến mạnh để quản lý độ trễ. Opus 4.7 xử lý được sự biến thiên đó.

Tự chủ dài hạn và cross-session memory được cải thiện

Opus 4.7 mang ngữ cảnh qua các phiên. Agent chạy quy trình nghiên cứu nhiều ngày có thể tiếp tục từ nơi đã dừng, tham chiếu quyết định trước đó và cập nhật hiểu biết mà người vận hành không phải nạp lại ngữ cảnh ở đầu mỗi lượt chạy.

Điều này quan trọng nhất cho ba loại quy trình: agent nghiên cứu tự chủ gửi bản tóm tắt hằng tuần, hệ thống phân loại hỗ trợ theo dõi lịch sử vụ việc qua các tương tác và agent pipeline dữ liệu giám sát rồi điều chỉnh hành vi theo sự cố tuần trước. Trong cả ba trường hợp, mô hình trước đây cần bàn giao ngữ cảnh thủ công hoặc bước chèn ngữ cảnh làm tăng độ trễ và chi phí. Opus 4.7 bỏ nút thắt đó cho các mô hình bộ nhớ được hỗ trợ.

Nâng cấp thị giác: độ phân giải 2,576px

Opus 4.7 xử lý hình ảnh có cạnh dài đến 2,576 pixel, cao hơn ba lần độ phân giải của các mô hình Claude trước. Với agent phân tích dashboard, đọc screenshot hệ thống bên ngoài hoặc kiểm tra bản scan tài liệu, điều này thu hẹp khoảng trống độ chính xác kéo dài trên hình ảnh dày đặc chi tiết.

Lập trình được cải thiện: SWE-bench Pro 64.3%

Trên SWE-bench Pro, Opus 4.7 đạt 64.3% so với 53.4% của Opus 4.6. Đây không phải cải tiến nhỏ. GPT-5.4 đạt 57.7% và Gemini 3.1 Pro đạt 54.2% trên cùng benchmark.

Trên SWE-bench Verified, điểm là 87.6%, tăng từ 80.8% của Opus 4.6. Trên đánh giá SWE-bench nội bộ của Rakuten chạy trên codebase vận hành thực tế, Opus 4.7 xử lý số tác vụ gấp ba lần Opus 4.6, với mức tăng hai chữ số cho cả Code Quality và Test Quality.

Trên benchmark nội bộ gồm 93 tác vụ, tỷ lệ xử lý tăng 13% so với Opus 4.6, trong đó có bốn tác vụ mà cả Opus 4.6 lẫn Sonnet 4.6 đều không giải được.

Đây không phải thay đổi biên trên bảng xếp hạng. Chúng thể hiện thay đổi thật về những gì agent có thể hoàn thành trong codebase vận hành thực tế.

Opus 4.7 so với GPT-5.4 và Gemini 3.1 Pro trên benchmark

So sánh benchmark đầy đủ, nguồn SWE-bench Pro Leaderboard, Scale AIAnthropic Claude Opus:

| Chỉ số | Opus 4.7 | Opus 4.6 | GPT-5.4 | Gemini 3.1 Pro | | ---------------------------- | ----------- | ------------ | -------- | -------------- | | SWE-bench Pro | 64.3% | 53.4% | 57.7% | 54.2% | | SWE-bench Verified | 87.6% | 80.8% | Không có | 80.6% | | Cửa sổ ngữ cảnh | 1M token | 1M token | Không có | Không có | | Giá đầu vào | $5/M token | $5/M token | Không có | $2/M token | | Giá đầu ra | $25/M token | $25/M token | Không có | $12/M token | | Tiết kiệm nhờ prompt caching | tới 90% | tới 90% | Không có | Không có | | Độ phân giải ảnh tối đa | 2,576px | khoảng 800px | Không có | Không có |

Có vài điểm đáng lưu ý trong bảng.

Opus 4.7 dẫn đầu mọi benchmark lập trình phản ánh điều kiện vận hành thực tế. Kết quả Rakuten-SWE-Bench với số tác vụ xử lý cao gấp 3 lần trên codebase thật là con số quan trọng nhất với đội cân nhắc nâng cấp coding agent. Điểm benchmark trên tác vụ tổng hợp dễ bị tối ưu theo hướng đối phó, còn xử lý codebase vận hành thực tế thì không.

Gemini 3.1 Pro rẻ hơn, $2/$12 mỗi triệu token so với $5/$25 của Opus 4.7. Nếu ngân sách là ràng buộc chính và độ chính xác lập trình ít quan trọng hơn, Gemini là phương án hợp lý. Nhưng với đội ngũ mà một pipeline viết sai hoặc bước agent thất bại tạo ra chi phí hạ nguồn đáng kể, chênh lệch độ chính xác xứng đáng với chênh lệch giá.

GPT-5.4 là mô hình mạnh, nhất là với suy luận có cấu trúc và tác vụ computer use. Nó không dẫn đầu ở các benchmark liên quan nhất đến phát triển AI agent và quy trình data engineering.

Khi nào dùng Opus 4.7, Sonnet 4.6 hay Haiku 4.5

Lỗi phổ biến nhất khi chọn mô hình là định tuyến mọi thứ qua mô hình mạnh nhất để khỏi phải suy nghĩ. Điều đó hiệu quả với demo. Trong vận hành thực tế, nó tạo chi phí và độ trễ không cần thiết cho các bước không cần đến nó.

Khung quyết định định tuyến thực tế:

Dùng Opus 4.7 khi:

  • tác vụ cần suy luận dài hạn hoặc chuỗi quyết định nhiều bước có phụ thuộc
  • agent viết, gỡ lỗi hoặc kiểm tra code vận hành thực tế
  • cổng quyết định cần độ tin cậy cao phải chính xác, như phê duyệt, định tuyến chuyển cấp hoặc kiểm tra đầu ra cuối
  • tính liên tục giữa các phiên quan trọng và quy trình chạy nhiều ngày
  • đầu vào có hiện vật trực quan phức tạp như dashboard dày đặc, sơ đồ hoặc tài liệu nhiều trang

Dùng Sonnet 4.6 khi:

  • tác vụ gồm gọi công cụ tiêu chuẩn, trích xuất có cấu trúc hoặc suy luận độ phức tạp vừa phải
  • độ trễ là ràng buộc rõ ràng và bước đó không cần phán đoán sâu
  • agent thực hiện quy trình đã xác định tốt, ít mơ hồ
  • chi phí cho mỗi lần hoàn tất quy trình quan trọng ở quy mô lớn

Dùng Haiku 4.5 khi:

  • phân loại, truy xuất hoặc tóm tắt khối lượng lớn với schema rõ ràng
  • tác vụ hẹp, lỗi trả lời sai có chi phí thấp và có thể khôi phục
  • cần thực thi nhanh, rẻ trên hàng nghìn lượt gọi mỗi giờ

Một kiến trúc research agent đã hoạt động tốt trong các bản triển khai gần đây: dùng Opus 4.7 cho bước lập kế hoạch, tổng hợp phân tích đối thủ và tạo bản tóm tắt cuối; Sonnet 4.6 cho tạo truy vấn tìm kiếm, đánh giá nguồn và tóm tắt trung gian; Haiku 4.5 cho xếp hạng truy xuất và loại trùng. Cấu trúc định tuyến này giảm khoảng 60% chi phí mỗi quy trình so với chạy mọi thứ bằng Opus, đồng thời giữ chất lượng đầu ra ở đúng các bước quan trọng.

Nếu đang thiết kế kiểu định tuyến này từ đầu, bài viết về dịch vụ phát triển AI agent của chúng tôi trình bày chi tiết hơn về mô hình chuyển cấp và định tuyến mô hình.

Opus 4.7 thay đổi gì với quy trình AI agent vận hành thực tế

Các số benchmark hữu ích để định hướng, nhưng không trả lời câu hỏi thực tế: bản phát hành này thay đổi gì cho đội đang chạy agent?

Agent nghiên cứu dài hạn và RevOps

Cải thiện cross-session memory là thay đổi có ý nghĩa vận hành nhất với quy trình nghiên cứu và RevOps. Đội vận hành agent theo dõi đối thủ, tạo bản tóm tắt hằng tuần trước đây phải duy trì kho bộ nhớ bên ngoài và nạp ở đầu mỗi lần chạy, hoặc chấp nhận agent bắt đầu mới ở mỗi phiên.

Cross-session memory của Opus 4.7 bỏ bước nạp lại với các mô hình bộ nhớ được hỗ trợ. Agent tích lũy hiểu biết làm việc về đối thủ nào quan trọng, tín hiệu nào đã được đánh dấu và ưu tiên hiện tại của đội mà người vận hành không phải nhắc lại ở mỗi lượt chạy.

Với quy trình nghiên cứu đa agent, điều này giảm chi phí thiết lập cho từng lượt chạy hằng tuần và giảm rủi ro ngữ cảnh cũ tạo ra đầu ra trùng lặp.

Agent pipeline dữ liệu và lập trình

Cải thiện benchmark lập trình không chỉ mang tính học thuật với quy trình data engineering. Agent pipeline viết và kiểm tra mô hình dbt, chẩn đoán lỗi DAG hoặc tạo script di trú đang làm đúng loại công việc lập trình vận hành phức tạp mà mức tăng của Opus 4.7 lớn nhất.

Trên benchmark 93 tác vụ, bốn tác vụ không thể được giải bởi Opus 4.6 hoặc Sonnet 4.6. Đây là phần đuôi của các vấn đề khó: trường hợp biên trong codebase vận hành, yêu cầu mơ hồ có ràng buộc mâu thuẫn và lỗi có nguyên nhân gốc không rõ. Trong kỹ thuật pipeline, đây là các tác vụ thường cần kỹ sư cấp cao can thiệp nhất. Opus 4.7 tự xử lý được nhiều hơn.

Với phát triển AI agent vận hành thực tế, điều này thay đổi phạm vi có thể giao an toàn cho bước agent so với phần cần chuyển lên người kiểm duyệt. Đặt ranh giới sai theo một trong hai hướng, quá rộng khiến con người thành nút thắt, quá hẹp khiến đầu ra xấu thoát ra, là một trong các nguyên nhân phổ biến làm agent vận hành thất bại. Chúng tôi đã nói về cách hiệu chỉnh trong bài AI agent với kiểm duyệt của con người.

Kỷ luật chi phí: prompt caching ở mức $5/$25/M

Opus 4.7 có giá $5 mỗi triệu token đầu vào và $25 mỗi triệu token đầu ra. Giá này không đổi so với Opus 4.6. Nhìn bề ngoài, đây là mức giá cao hơn Gemini 3.1 Pro với $2/$12.

Prompt caching thay đổi đáng kể chi phí thực tế. Với agent có system prompt lớn, ổn định gồm hướng dẫn, schema công cụ, tài liệu chính sách và chỉ mục truy xuất, prompt caching của Anthropic giảm chi phí gửi lại ngữ cảnh đó tới 90%. Xử lý batch giảm thêm 50% cho quy trình không nhạy về độ trễ.

Trên thực tế, research agent có system prompt 100,000 token chạy hằng ngày với 100 lần hoàn tất quy trình mỗi tháng sẽ giảm chi phí đầu vào ở phần được cache từ khoảng $50/tháng xuống $5/tháng. Với cấu trúc chi phí này, chênh lệch giữa Opus 4.7 và mô hình rẻ hơn thu hẹp đáng kể khi triển khai caching đúng.

Lưu ý là prompt caching cần kỷ luật kỹ thuật. Cache mất hiệu lực khi system prompt thay đổi, nên agent có hướng dẫn cập nhật thường xuyên sẽ có tỷ lệ cache hit thấp hơn. Kiến trúc prompt ổn định với cache đáng đầu tư cho mọi quy trình chạy hơn vài chục lần hoàn tất mỗi ngày.

Cách bắt đầu: truy cập API và giá

Claude Opus 4.7 có trên Claude API với model ID claude-opus-4-7. Tính đến hôm nay, mô hình cũng có trên Amazon Bedrock, Microsoft Azure Foundry và Vertex AI.

Tóm tắt giá:

  • Đầu vào: $5 mỗi triệu token
  • Đầu ra: $25 mỗi triệu token
  • Prompt caching: giảm tới 90% cho đầu vào được cache
  • Xử lý batch: giảm 50% cho khối lượng công việc ngoại tuyến
  • Cửa sổ ngữ cảnh: 1 triệu token

Với đội đang đánh giá nâng cấp agent từ Opus 4.6 lên Opus 4.7, giá giống nhau nên câu hỏi chỉ là cải thiện năng lực có biện minh cho việc di trú mô hình không. Với mức tăng 13% ở benchmark lập trình và cải thiện cross-session memory, quy trình liên quan đến tạo code phức tạp hoặc tính liên tục nhiều phiên là ứng viên nâng cấp mạnh. Quy trình đã hoạt động tốt trên Sonnet 4.6 nên tiếp tục dùng Sonnet.

Kết luận

Claude Opus 4.7 là nâng cấp cho vận hành thực tế, không chỉ là cuộc đua benchmark. Mức tăng 13% về lập trình, cross-session memory và adaptive thinking đều xử lý lỗi thực tế trong quy trình agent vận hành, không phải trường hợp biên trong đánh giá tổng hợp.

Số benchmark ít quan trọng hơn quyết định định tuyến: phần lớn đội không cần Opus 4.7 ở mọi bước agent và chạy nó ở mọi nơi là sai lầm về chi phí. Đội tận dụng bản phát hành này tốt nhất sẽ xác định các bước quy trình mà chiều sâu của Opus 4.7 thay đổi đầu ra một cách có ý nghĩa, định tuyến chúng đến mô hình mới và giữ Sonnet ở nơi Sonnet đã đủ.

Nếu đang xây hoặc hoàn thiện AI agent vận hành thực tế và muốn có ý kiến thứ hai về vị trí phù hợp của Opus 4.7, hãy xem dịch vụ phát triển AI agent hoặc case study phân loại và chuyển cấp hỗ trợ bằng AI để thấy ví dụ vận hành thực tế về định tuyến mô hình và kiểm duyệt của con người dưới tải.

Câu hỏi thường gặp

Những câu hỏi người đọc thường đặt ra tiếp theo.

Các câu trả lời ngắn này làm rõ những câu hỏi thực tế thường xuất hiện sau khi đọc bài viết.

Bạn cần một hệ thống tương tự?

Nếu bài viết này phản ánh một quy trình đội ngũ bạn đang vận hành, bước tiếp theo thường là rà soát có phạm vi về hệ thống, ràng buộc và lộ trình triển khai.

Đặt lịch rà soát quy trình miễn phí tại đây.