Đi đến nội dung chính
Quay lại bài viết

26 tháng 7, 2026

Claude Opus 5: Flagship mới của Anthropic có ý nghĩa gì đối với các đặc vụ AI

Hướng dẫn Claude Opus 5 dành cho nhóm sản xuất: so sánh mức độ phù hợp của quy trình làm việc, rủi ro, chi phí, gánh nặng xem xét và các rào cản triển khai trước khi vận chuyển.

Bởi Tran Tien Van13 phút đọc

Trọng tâm bài viết

Claude Opus 5 là mẫu hàng đầu mới của Anthropic, được phát hành vào ngày 24 tháng 7 năm 2026 cho công việc mã hóa, tác nhân và công việc tri thức.

Claude Opus 5 là mẫu hàng đầu mới của Anthropic, phát hành vào ngày 24 tháng 7 năm 2026 dành cho công việc mã hóa, tác vụ tác nhân và công việc tri thức. Claude Opus 5 mang lại hiệu suất vượt trội với một nửa giá của mẫu có khả năng nhất của Anthropic, Fable 5, và đối với các nhóm điều hành tác nhân AI, việc giảm giá đó sẽ thay đổi phép toán nhiều hơn bất kỳ tiêu chuẩn đơn lẻ nào.

Đối với các nhóm kỹ thuật, nền tảng và MLOps, vấn đề thực tế không còn là liệu một mô hình có thể soạn thảo mã hay không. Đó là do các chương trình đại lý trì hoãn các quyết định lựa chọn mô hình thủ công, chậm chạp và chi phí không thể đo lường được, đồng thời một mô hình có khả năng rẻ hơn sẽ cám dỗ các nhóm trao đổi mọi thứ cùng một lúc và hy vọng chất lượng đại lý được giữ nguyên. Tại Nhóm Van Data, chúng tôi coi việc phát hành mô hình mới là quyết định định tuyến và quản trị, chứ không phải hoán đổi mặc định: chúng tôi ánh xạ nhiệm vụ, công cụ, dữ liệu, gánh nặng đánh giá và khắc phục lỗi trước khi thay đổi mô hình của một tổng đài viên. Hướng dẫn này báo cáo những gì Anthropic đã vận chuyển, sau đó cung cấp cho bạn khung định tuyến, kế hoạch đánh giá và các biện pháp bảo vệ mà tác nhân tự tạo công cụ hiện yêu cầu. Bạn có thể xem cách chúng tôi cấu trúc việc phân phối tác nhân sản xuất trước khi áp dụng các nguyên tắc tương tự vào quy trình công việc kỹ thuật và doanh thu của bạn.

Bài học chính

Van Data Team biến việc khởi chạy mô hình thành kho nhiệm vụ, ma trận định tuyến, bộ đánh giá và triển khai có kiểm soát. Khám phá cách hoạt động của dịch vụ phát triển tác nhân AI của chúng tôi trong quá trình xây dựng, đánh giá, quản trị và báo cáo.

Anthropic công bố gì về Claude Opus 5

Anthropic đã phát hành Claude Opus 5 với tư cách là mẫu thứ tư trong dòng Claude 5 trong vòng chưa đầy hai tháng, sau Mythos 5, Fable 5 và Sonnet 5. Nó có sẵn trên nhiều nền tảng và thông qua API dưới tên claude-opus-5, và đây là mẫu mặc định trên Claude Max. Anthropic định vị Opus 5 là công cụ lao động hàng ngày cho công việc viết mã, tác vụ và kiến ​​thức.

Thuộc tínhBáo cáo chi tiếtHàm ý toán tử
sẵn có

Live on all platforms; API id

claude-opus-5

; default on Claude Max

Xác nhận quyền truy cập và điểm cuối dựa trên tài liệu mô hình chính thức trước khi đi dây

Giá tiêu chuẩn

$5 / 1 triệu token đầu vào, $25 / 1 triệu token đầu ra, bằng một nửa Fable 5

Điều chỉnh lại chi phí đại lý cơ bản cho mỗi nhiệm vụ được chấp nhận, không chỉ giá cho mỗi cuộc gọi

Chế độ nhanh

$10 / $50, about 2.5x faster

Sử dụng khi độ trễ thay đổi tính kinh tế của nhiệm vụ được chấp nhận, không phải theo mặc định

Điểm chuẩn

SOTA trên Frontier-Bench và GDPval-AA; sử dụng máy tính OSWorld 2.0 mạnh mẽ

Hãy coi như một tín hiệu để bạn tự đánh giá chứ không phải là một bản án hoàn chỉnh

Định vị

Công việc đại lý hàng ngày; Fable 5 về khả năng tự chủ lâu dài khó nhất

Lộ trình theo hạng nhiệm vụ, không uy tín kiểu mẫu

Bảng này tách biệt các sự kiện được báo cáo của Anthropic với các hàm ý của nhà điều hành, đó là các khuyến nghị của Van Data Team.

Điểm chuẩn, Đọc chính xác

Trên Frontier-Bench v0.1, một điểm chuẩn mã hóa thiết bị đầu cuối tác nhân, Claude Opus 5 đạt 43,3%, cao hơn gấp đôi so với 18,7% của Opus 4.8 và cao hơn 33,7% của Fable 5. Trên OSWorld 2.0 (sử dụng máy tính), Anthropic cho biết nó đánh bại mọi mô hình với bất kỳ mức giá nhất định nào và đứng đầu về kết quả tốt nhất của Fable 5 với chi phí chỉ bằng khoảng một phần ba và nó báo cáo công nghệ tiên tiến mới về đánh giá công việc kiến ​​thức GDPval-AA.

Kết quả nổi bật nhất là một tín hiệu chứ không phải một điểm số. Trong một nhiệm vụ của Frontier-Bench, Opus 5 được yêu cầu tái tạo lại một bộ phận máy dưới dạng mô hình CAD 3D từ một bản vẽ mà nó cố tình không có cách nào để xem; thay vì thất bại, nó đã viết đường dẫn thị giác máy tính của riêng mình để trích xuất hình học từ các pixel thô và làm như vậy nhiều lần trong khi không có mô hình cạnh tranh nào giải quyết được nhiệm vụ trong năm lần thử. Đó là tiêu đề dành cho các nhóm đặc vụ: một mô hình có khả năng giờ đây sẽ xây dựng một công cụ còn thiếu để tháo gỡ thay vì dừng lại.

Phân tích của Van Data Team: khả năng lãnh đạo điểm chuẩn không giống như khả năng dẫn đầu tốt nhất cho kho lưu trữ, chuỗi công cụ hoặc mức độ rủi ro của bạn. Mỗi bộ khai thác mã hóa thiết bị đầu cuối và một hộp cát sử dụng máy tính đều kiểm tra một lát cắt hẹp. Trong quá trình sản xuất, tác nhân thường gặp lỗi hơn do chọn sai công cụ nội bộ, đọc dữ liệu cũ, vượt quá quyền hoặc tạo ra thay đổi mà người đánh giá không thể chấp nhận một cách an toàn. Xác minh mô hình dựa trên nhóm nhiệm vụ của riêng bạn, và coi điểm được công bố là lý do để kiểm tra chứ không phải lý do để bỏ qua kiểm tra. Hướng dẫn đánh giá tác nhân AI của chúng tôi trình bày cách xây dựng nhóm nhiệm vụ đó.

Một nửa kinh tế đại lý thay đổi giá, không chỉ hóa đơn API

Một lời nhắc và phản hồi hầu như không nhận thấy sự thay đổi về giá. Một đại lý hoạt động lâu dài. Vòng lặp tác nhân sử dụng mã thông báo để lập kế hoạch, gọi công cụ, thử lại và tự sửa lỗi qua nhiều bước, do đó, việc giảm một nửa giá mỗi mã thông báo của một mô hình có khả năng là sự khác biệt giữa vòng lặp tác nhân quá đắt để chạy liên tục và vòng lặp tác nhân có thể tiếp tục. Nhưng đơn vị quan trọng không phải là chi phí cho mỗi cuộc gọi, mà là chi phí cho mỗi kết quả được chấp nhận: mức sử dụng mô hình cộng với việc thực thi công cụ cộng với số lần thử cộng với đánh giá của con người cộng với khả năng khôi phục, chia cho kết quả đầu ra vượt qua thanh chất lượng xác định.

Đó là nơi kỹ thuật dữ liệu tái hiện lại bức tranh. Các quyết định của nhân viên chỉ có hiệu quả khi dữ liệu cung cấp cho họ, do đó, các quy trình tập hợp dữ liệu đó, cho dù là mô hình dbt, công việc Luồng khí hay truyền tải dữ liệu qua Kafka vào kho BigQuery hoặc nhà kho, đều cần có kỷ luật thực sự. Giữ các bảng mà tổng đài viên đọc để đảm bảo độ mới, dòng dõiSLA rõ ràng, đồng thời thực thi chất lượng dữ liệu và kiểm tra lược đồ đối với chúng. Trường sai hoặc cũ không chỉ tạo ra câu trả lời tồi; nó gây ra một hành động xấu, một bản vá được gửi đi hoặc một email của khách hàng, trước khi bất kỳ ai xem xét nó. Theo dõi sự trôi dạt của lược đồ và các bản ghi đến muộn hoặc bị lấp đầy vì tác nhân sẽ hành động ngay lập tức đối với chúng. Sách hướng dẫn phân phối dbt và BigQuery của chúng tôi bao gồm phần kho của nền tảng đó.

Lộ trình theo lớp nhiệm vụ, không phải uy tín mẫu

Hình minh họa sau đây tóm tắt lộ trình chỉ khi nhiệm vụ yêu cầu:

Đường dẫn định tuyến nhiệm vụ từ cấp mô hình rẻ hơn đến Opus 5 và Fable 5 khi độ phức tạp và quyền tự chủ tăng lên.

Hình 1. Hãy định tuyến mỗi khối lượng công việc đến cấp có chi phí thấp nhất nhưng vẫn vượt qua đánh giá, dành Fable 5 cho công việc tự chủ dài hạn khó nhất.

Phản ứng đúng đắn đối với một mô hình biên giới mới không phải là định tuyến mọi thứ cho nó. Nó nhằm xác định chính sách định tuyến trên dòng Claude 5 và các nhà cung cấp khác của bạn, sau đó để hiệu suất đo được quyết định. Opus 5 là lựa chọn tốt nhất cho công việc kiến ​​thức và mã hóa tác nhân hàng ngày, nơi bạn muốn chất lượng vượt trội ở mức giá được kiểm soát; Fable 5 là sự phù hợp mạnh mẽ hơn cho những công việc tự trị khó nhất, có thời hạn dài nhất mà Anthropic vẫn dành riêng cho nó; và cấp độ rẻ hơn, nhanh hơn là lựa chọn phù hợp cho các nhiệm vụ có giới hạn và được kiểm tra kỹ lưỡng. Chọn cấp đơn giản nhất để xóa thanh chất lượng của bạn và trước tiên hãy kiểm tra bất kỳ lộ trình mới nào trên mẫu được gắn nhãn trước khi bạn định tuyến khối lượng trực tiếp qua mẫu đó.

# model-routing policy (illustrative, validate against your own evals)
default_route: claude-opus-5 # everyday agentic + coding + knowledge work
routes:
  - when: task == "bounded" and reversible
    use: cheaper-tier # summaries, extraction, classification
  - when: task == "agentic-coding" and risk == "standard"
    use: claude-opus-5
  - when: task == "long-horizon-autonomy" or risk == "high"
    use: claude-fable-5 # Anthropic's pick for the hardest jobs
guardrails:
  require_human_approval: [outward_message, code_merge, spend, schema_change]
  stop_conditions: [repeated_failure, stale_data, permission_denied, budget_exceeded]
  observability: [action_trace, token_cost_per_task, eval_pass_rate]

Chính sách này là điểm khởi đầu, không phải là hệ thống phân cấp cố định. Điều chỉnh lại cơ bản khi xuất xưởng các mẫu tàu mới, dòng Claude 5 đã bổ sung thêm bốn mẫu trong vòng chưa đầy hai tháng, vì vậy "tính đến hôm nay" là khuôn khổ trung thực duy nhất cho bất kỳ quyết định định tuyến nào. Đối với lớp điều phối, các mẫu như máy trạng thái LangGraph, tác nhân LangChain hoặc CrewAI, lệnh gọi hàm gốc và vòng lặp Lập kế hoạch và Thực thi đều vẫn hợp lệ; giữ cho bộ định tuyến độc lập với bất kỳ khung công tác nào và tiêu chuẩn hóa quyền truy cập công cụ thông qua các giao diện mở như MCP.

Kết quả của việc tự tạo công cụ là một cảnh báo về quản trị

Phần trình diễn CAD rất ấn tượng, nhưng đối với bất kỳ ai đang điều hành các đại lý trong sản xuất thì đó cũng là một lời cảnh báo. Một mô hình viết đường dẫn thị giác máy tính của riêng nó để thoát khỏi lỗi là một mô hình sẽ tạo ra các công cụ, tập lệnh và các tác dụng phụ mà bạn không lường trước được. Điều đó làm cho hộp cát, quyền có đặc quyền tối thiểu, ghi nhật ký theo dõi và cổng phê duyệt trở nên quan trọng hơn chứ không kém phần quan trọng. Một đại lý có thể xây dựng một cây cầu khi con đường kết thúc cũng có thể xây dựng một cây cầu ở nơi mà bạn không cho phép.

Đặt một lớp chính sách xung quanh mô hình: hạn chế những hành động có thể thực hiện mà không cần có sự xem xét của con người, ghi lại mọi lệnh gọi công cụ và kết quả của nó, đồng thời duy trì bước phê duyệt của con người đối với bất kỳ điều gì có tính hướng ngoại, không thể đảo ngược hoặc được đặc quyền. Sách hướng dẫn về hoạt động tác nhân AI sản xuất và quy trình chuyển giao của con người của chúng tôi trình bày chi tiết về các mô hình thử lại, sự cố và chuyển giao giúp quyền tự chủ đủ an toàn để thực sự triển khai.

Danh sách kiểm tra áp dụng thực tế

Trước khi Claude Opus 5 trở thành mặc định trong ngăn xếp của bạn, hãy xử lý vấn đề vận hành chứ không phải thông báo:

  • Xác minh quyền truy cập, thẻ mẫu chính thức và mức giá dựa trên tài liệu của Anthropic kể từ ngày triển khai, sau đó đo lường độ trễ thực tế và chi phí trên khối lượng công việc của riêng bạn.
  • Xây dựng một bộ đánh giá cụ thể theo nhiệm vụ gồm các ví dụ tốt và xấu, đồng thời chấm điểm Opus 5, Fable 5 và cấp độ rẻ hơn trên đó trước khi thay đổi bất kỳ lộ trình nào.
  • Định tuyến theo nhiệm vụ và chi phí, giới hạn và quan sát các lần chạy tự động với chi phí cho mỗi nhiệm vụ và đo từ xa tỷ lệ đánh giá.
  • Thực thi các đảm bảo về chất lượng, độ mới, dòng dõi và SLA của dữ liệu trên mỗi bảng mà tổng đài viên đọc hoặc ghi.
  • Giữ sự chấp thuận của con người đối với các hành động không thể đảo ngược và ghi lại các quyết định của đại lý để kiểm tra.

Dụng cụ và cảnh quan phù hợp

Hãy coi bản phát hành như một menu chứ không phải một ngăn xếp. Lớp mô hình (Opus 5, Fable 5, các tầng rẻ hơn) là một quyết định; lớp điều phối (LangGraph, LangChain, CrewAI, gọi hàm gốc, Lập kế hoạch và thực thi) là một lớp riêng biệt; lớp giao thức (MCP và các giao diện công cụ khác) là lớp thứ ba; và lớp dữ liệu (dbt, Airflow, Kafka, BigQuery, với chất lượng dữ liệu, dòng dõi, độ mới và các điều khiển SLA) là nền tảng mà ba lớp còn lại phụ thuộc vào. Nhóm Van Data tập hợp những điều này thành việc phân phối đại lý được quản lý, xây dựng, đánh giá, định tuyến, báo cáo và đánh giá dựa trên rủi ro, thay vì mặc định dựa trên điểm chuẩn. So sánh vị trí của Opus 5 với phân tích trước đây của chúng tôi về Claude Opus 4.7 dành cho tác nhân AI sản xuấtClaude Fable 5.

Kết luận

Câu chuyện thực sự của Claude Opus 5 không phải là một bảng xếp hạng, đó là khả năng tác nhân tiên phong với mức giá chỉ bằng một nửa so với mô hình hàng đầu của Anthropic, giúp công việc tác nhân liên tục trở nên khả thi về mặt kinh tế cho nhiều nhóm hơn. Động thái chiến thắng không phải là hoán đổi mọi tuyến đường với nó mà là định tuyến theo lớp nhiệm vụ, đánh giá công việc của chính bạn và thắt chặt các biện pháp bảo vệ mà tác nhân tự tạo công cụ hiện yêu cầu. Nhóm Van Data giúp các nhóm biến việc khởi chạy mô hình thành chính sách định tuyến, bộ đánh giá và triển khai được quản lý. Xem cách dịch vụ phát triển tác nhân AI của chúng tôi mang lại điều đó.

Câu hỏi thường gặp

Những câu hỏi người đọc thường đặt ra tiếp theo.

Các câu trả lời ngắn này làm rõ những câu hỏi thực tế thường xuất hiện sau khi đọc bài viết.

Bạn cần một hệ thống tương tự?

Nếu bài viết này phản ánh một quy trình đội ngũ bạn đang vận hành, bước tiếp theo thường là rà soát có phạm vi về hệ thống, ràng buộc và lộ trình triển khai.

Đặt lịch rà soát quy trình miễn phí tại đây.