Bỏ qua đến nội dung chính

Choosing the right model

📖 Nội dung bài học

Video

Chọn model phù hợp

Bạn đang triển khai một ứng dụng dùng Claude. Bạn chọn model nào? Nếu bạn mặc định chọn model thông minh nhất, hóa đơn API của bạn sẽ khiến bạn bất ngờ. Chọn model rẻ nhất, và đầu ra có thể không đạt yêu cầu. Mỗi model có những đánh đổi khác nhau, và việc chọn đúng model ảnh hưởng đến cả chất lượngchi phí.

Các cấp độ model

Anthropic hiện cung cấp bốn cấp độ model, và bạn chọn giữa chúng bằng tham số model trong lệnh gọi API của mình.

Lưu ý rằng tại thời điểm khóa học này, Claude Fable chưa được phát hành rộng rãi và không được đề cập trong video trên. Tìm hiểu thêm về Claude Fable và Claude Mythos tại đây.

  • Claude Fable là model mạnh mẽ nhất của chúng tôi cho đến nay — một cấp độ mới nằm trên Opus, được xây dựng cho những thách thức khó khăn nhất của bạn. Nó có chi phí cao hơn đáng kể so với Opus, vì vậy hãy dành nó cho những công việc mà khả năng vượt trội đó đáng để chi trả.
  • Claude Opus là model mạnh nhất trong ba dòng model cốt lõi, nhưng cũng chậm nhất và chi phí cao nhất. Dùng nó cho suy luận sâu, phân tích phức tạp, coding nhiều bước và viết lách tinh tế.
  • Claude Haiku là model nhanh nhất và chi phí thấp nhất, được tối ưu hóa cho tốc độ và hiệu quả chi phí thay vì trí thông minh tối đa. Dùng nó cho các công việc khối lượng lớn, độ phức tạp thấp như classification, extraction và routing.
  • Claude Sonnet nằm ở vị trí lý tưởng: sự kết hợp cân bằng giữa trí thông minh, tốc độ và chi phí, hoạt động tốt cho hầu hết các công việc sản xuất.

Three cards comparing the Claude model tiers: Haiku (fastest, lowest cost, for classification and routing), Sonnet (capable and fast, for most production work), and Opus (most intelligent, highest cost, for deep reasoning and complex analysis)

Bắt đầu với một evaluation đơn giản

Trước khi bạn viết code sản xuất, hãy thiết lập một evaluation (đánh giá) đơn giản: một tập hợp các input mẫu mà bạn chạy qua từng model và chấm điểm dựa trên ý nghĩa của đầu ra tốt cho trường hợp sử dụng của bạn. Bạn không cần gì phức tạp — 20 hoặc 30 ví dụ đại diện từ khối lượng công việc thực tế của bạn là đủ để bắt đầu.

Sau đó, bạn tiến hành theo các cấp độ:

  1. Chạy các ví dụ của bạn qua Haiku trước. Nếu chất lượng đạt yêu cầu, bạn đã xong — và bạn vừa tiết kiệm được rất nhiều tiền.
  2. Nếu không, hãy chuyển sang Sonnet.
  3. Chỉ dùng đến Opus khi tác vụ thực sự cần.

So sánh các cấp độ cạnh nhau

Hãy cùng xem sự khác biệt giữa các cấp độ, không chỉ nói suông. Chúng ta sẽ gửi cùng một prompt qua cả ba model và theo dõi latency (độ trễ) và số lượng token:

models = ["claude-haiku-4-5", "claude-sonnet-4-6", "claude-opus-4-7"]

for model in models:
    response = client.messages.create(
        model=model,
        max_tokens=300,
        messages=[{"role": "user", "content": prompt}],
    )
    print(model, response.usage)

Có hai điều đang diễn ra ở đây:

  • Vòng lặp thay đổi trường model trong mỗi request. Cùng một prompt, cùng max tokens — chỉ có model thay đổi.
  • response.usage cung cấp cho bạn input và output tokens trực tiếp từ API, đây là cơ sở để tính hóa đơn của bạn.

Terminal output from running the same prompt through Opus, Sonnet, and Haiku, showing each model's latency and input/output token counts

Chạy nó và bạn sẽ thấy ba model và ba bộ số. Opus mất nhiều thời gian nhất và cho ra kết quả trau chuốt nhất — nhưng đối với một định nghĩa hai câu, sự trau chuốt đó là lãng phí. Sonnet làm cho văn bản chặt chẽ hơn một chút. Và Haiku trả về, thường dưới một giây, với một câu trả lời hai câu rất tốt. Thực sự nó hoàn hảo cho loại kịch bản này.

Và đó là mấu chốt: model phù hợp là model rẻ nhất mà đầu ra của nó bạn thực sự sẽ triển khai. Đối với một định nghĩa, Haiku là đủ. Để soạn thảo một phản hồi quy định, bạn sẽ chạy so sánh tương tự và có thể sẽ chọn Opus. Quy trình eval luôn giống nhau.

Định tuyến các công việc khác nhau đến các model khác nhau

Trong một ứng dụng thực tế, bạn sẽ định tuyến các loại công việc khác nhau đến các model khác nhau trong cùng một endpoint. Lấy ví dụ một bảng điều khiển hoạt động với một tuyến xử lý tài liệu:

  • Mọi file đến đều được phân loại bằng Haiku.
  • Các bản cập nhật từ khách hàng được soạn thảo bằng Sonnet.
  • Chỉ các phản hồi RFP mới dùng đến Opus.

Một hàng đợi, ba model, được chọn theo từng tác vụ.

Tóm tắt

  • Anthropic cung cấp ba cấp độ model: Opus cho các vấn đề khó, Sonnet cho công việc hàng ngày và Haiku cho khối lượng lớn.
  • Thiết lập một evaluation đơn giản — 20 hoặc 30 ví dụ đại diện từ khối lượng công việc thực tế của bạn — trước khi viết code sản xuất.
  • Chạy eval từ Haiku trở lên và dừng lại ở model rẻ nhất mà đầu ra của nó bạn thực sự sẽ triển khai.
  • response.usage báo cáo input và output tokens, đây là cơ sở tính hóa đơn của bạn.
  • Trong môi trường sản xuất, hãy định tuyến các tác vụ khác nhau đến các model khác nhau trong cùng một endpoint thay vì chọn một model cho mọi thứ.

🎬 Bản ghi video

Source video: UAeTSBsK71A

Không có transcript — xem phần nội dung bài học bên trên.

🔁 Bài học liên quan

📚 Nguồn & ghi nhận

Góp ý / Báo lỗiPhát hiện sai sót hoặc có ý tưởng cải thiện?