- Trước khi một model Claude mới ra mắt, một nhóm nhỏ khách hàng đã thử nghiệm, "phá" nó và định hình những gì đi kèm — phim ngắn này ghi lại điều các đội đó học được.
- Họ mô tả năng lượng của giai đoạn early access là "all hands on deck", chuyển động với tốc độ ánh sáng, và coi đó là cơ hội thế hệ đi kèm trách nhiệm.
- Việc đầu tiên họ thử với model mới là chạy
evaltự động ở nền và những tác vụ thực tế khó (như soạnS1); thấy các eval trước đây luôn thất bại bỗng chạy được một cách nhất quán là dấu hiệu model sẽ đặc biệt.
Before we ship a Claude model, these teams try to break it.
- Hiểu rằng một nhóm nhỏ khách hàng thử nghiệm và cố "phá" mỗi model Claude mới trước khi ra mắt, giúp định hình những gì đi kèm.
- Cảm nhận năng lượng khi nhận thứ mới từ Anthropic — hào hứng như cơn bão đang tới: all hands on deck, tốc độ ánh sáng, bỏ ngay việc đang làm.
- Làm việc ở
frontierlà luôn trong chế độ học hỏi, một cơ hội thế hệ vừa may mắn vừa đầy trách nhiệm: tiếp tục đẩy giới hạn, đổi mới, an toàn hơn, và dễ xây dựng hơn. - Bắt đầu với model mới bằng cách chạy
evaltự động ở nền. - Một tác vụ pháp lý phức tạp được nêu là soạn
S1; nhờagentic capabilities(tìm thông tin, tổng hợp, sửa tài liệu), model nay xử lý được những phần ngày càng lớn một cách tự chủ. - Chỉ cần thay một model mới, một agent đi từ "đôi khi trả lời được, đôi khi mắc kẹt" sang trả lời mọi câu hỏi nhanh và chính xác — dashboard tỉ lệ thành công của testing agent tăng khoảng 20%.
- Những việc hôm nay chưa chạy được là dấu hiệu tốt nhất cho thấy model kế tiếp sẽ giỏi hơn nhiều; thấy eval chưa từng chạy được bắt đầu chạy nhất quán báo hiệu model đặc biệt.
- Quan hệ với Anthropic mang tính cộng tác ("we build with you", trò chuyện gần như cách ngày, kỹ sư như cùng đội) với chuẩn tin cậy cao rằng thứ công bố không phải "slop"; một từ mô tả việc xây dựng ở frontier là "dazzling" — rực rỡ, đầy cơ hội, và còn những con sóng lớn hơn đang tới.
frontier— biên giới dẫn đầu của năng lực AI, nơi phát triển và thử nghiệm các model mới nhấteval— bài đánh giá (thường tự động) đo model làm tốt thế nào trên các tác vụ cụ thểagentic capabilities— khả năng model tự tìm thông tin, tổng hợp và sửa tài liệu để hoàn thành tác vụS1— tài liệu đăng ký phức tạp nộp cho cơ quan quản lý (ví dụ cho IPO), một tác vụ pháp lý khótesting agent— agent có tỉ lệ thành công được theo dõi trên dashboard để đo cải thiện modelslop— output chất lượng thấp; khách hàng giữ chuẩn tin cậy cao rằng Anthropic không ship slopcompounding— vòng lặp củng cố: công cụ mới cải thiện sản phẩm khách, rồi lại cải thiện sản phẩm
Bối cảnh: thử nghiệm trước khi ra mắt
Trước khi một model Claude mới ra mắt, một nhóm nhỏ khách hàng đã thử nghiệm, cố "phá" nó và định hình những gì sẽ đi kèm. Phim ngắn này ngồi lại với các đội đó để xem họ học được gì.
Năng lượng của Early Access
Khi nhận thứ mới từ Anthropic, năng lượng như một cơn bão đang tới — nhưng hào hứng, vì là "all hands on deck". Cảm giác như chuyển động với tốc độ ánh sáng: nhận cuộc gọi và nhảy ra khỏi việc đang làm. Khoảnh khắc nhận model mới, họ nhận ra "nền tảng đã thay đổi".
Làm việc ở công ty đang định hình frontier thì "vui điên cuồng" — tất cả đều ở chế độ học hỏi. Đây là cơ hội thế hệ cho bất kỳ ai trong ngành, vừa may mắn vừa trách nhiệm: tiếp tục đẩy giới hạn, đổi mới, an toàn hơn, dễ xây dựng hơn, và mở khóa một lớp developer và builder mới.
Việc đầu tiên với model mới
Việc đầu tiên là chạy eval tự động để chúng chạy ngầm ở nền. Một use case từng là "giấc mơ" và là tác vụ pháp lý đặc biệt phức tạp là soạn S1. Nhờ agentic capabilities — model tự tìm thông tin cần thiết, tổng hợp, sửa tài liệu — họ giờ giao được những phần ngày càng lớn của S1 cho model tự làm.
Chỉ bằng việc thay vào một model mới, mọi câu hỏi từng muốn hỏi đều bắt đầu được trả lời. Agent đi từ "đôi khi trả lời được, đôi khi mắc kẹt" sang trả lời mọi câu hỏi nhanh và chính xác. Dashboard tỉ lệ thành công của testing agent tăng khoảng 20%.
Dấu hiệu của một model đặc biệt
Những việc hôm nay chưa chạy được chính là dấu hiệu tốt nhất cho thấy các model kế tiếp sẽ giỏi hơn nhiều. Thấy những eval chưa từng chạy được bắt đầu chạy, rồi chạy một cách nhất quán — đó là lúc biết model này sẽ đặc biệt.
Cộng tác với Anthropic
Quan hệ với Anthropic mang tính cộng tác: gần như cách ngày lại có một cuộc trò chuyện, kỹ sư hai bên như cùng một đội. "Ít giống mua thứ gì đó từ bạn, mà giống chúng ta cùng xây dựng." Họ giữ chuẩn tin cậy cao rằng bất cứ thứ gì Anthropic công bố sẽ không phải slop.
Một từ mô tả cảm giác xây dựng ở frontier: "dazzling" (rực rỡ) — đôi khi chói lóa, đầy độ sáng, cơ hội, hứng khởi. Và compounding: nhận công cụ mới nhất, dẫn tới khách hàng có sản phẩm tốt hơn, lại dẫn tới sản phẩm của họ tốt hơn. Có một con sóng lớn bên dưới đang thay đổi cách người dùng làm việc và cách chính bạn làm việc — bạn phải giữ thăng bằng, và biết rằng còn những con sóng lớn hơn đang tới.
TL;DR
- Trước khi một model Claude mới ra mắt, một nhóm nhỏ khách hàng đã thử nghiệm, "phá" nó và định hình những gì đi kèm — phim ngắn này ghi lại điều các đội đó học được.
- Họ mô tả năng lượng của giai đoạn early access là "all hands on deck", chuyển động với tốc độ ánh sáng, và coi đó là cơ hội thế hệ đi kèm trách nhiệm.
- Việc đầu tiên họ thử với model mới là chạy
evaltự động ở nền và những tác vụ thực tế khó (như soạnS1); thấy các eval trước đây luôn thất bại bỗng chạy được một cách nhất quán là dấu hiệu model sẽ đặc biệt.
Điểm chính
- Hiểu rằng một nhóm nhỏ khách hàng thử nghiệm và cố "phá" mỗi model Claude mới trước khi ra mắt, giúp định hình những gì đi kèm.
- Cảm nhận năng lượng khi nhận thứ mới từ Anthropic — hào hứng như cơn bão đang tới: all hands on deck, tốc độ ánh sáng, bỏ ngay việc đang làm.
- Làm việc ở
frontierlà luôn trong chế độ học hỏi, một cơ hội thế hệ vừa may mắn vừa đầy trách nhiệm: tiếp tục đẩy giới hạn, đổi mới, an toàn hơn, và dễ xây dựng hơn. - Bắt đầu với model mới bằng cách chạy
evaltự động ở nền. - Một tác vụ pháp lý phức tạp được nêu là soạn
S1; nhờagentic capabilities(tìm thông tin, tổng hợp, sửa tài liệu), model nay xử lý được những phần ngày càng lớn một cách tự chủ. - Chỉ cần thay một model mới, một agent đi từ "đôi khi trả lời được, đôi khi mắc kẹt" sang trả lời mọi câu hỏi nhanh và chính xác — dashboard tỉ lệ thành công của testing agent tăng khoảng 20%.
- Những việc hôm nay chưa chạy được là dấu hiệu tốt nhất cho thấy model kế tiếp sẽ giỏi hơn nhiều; thấy eval chưa từng chạy được bắt đầu chạy nhất quán báo hiệu model đặc biệt.
- Quan hệ với Anthropic mang tính cộng tác ("we build with you", trò chuyện gần như cách ngày, kỹ sư như cùng đội) với chuẩn tin cậy cao rằng thứ công bố không phải "slop"; một từ mô tả việc xây dựng ở frontier là "dazzling" — rực rỡ, đầy cơ hội, và còn những con sóng lớn hơn đang tới.
Từ vựng
frontier— biên giới dẫn đầu của năng lực AI, nơi phát triển và thử nghiệm các model mới nhấteval— bài đánh giá (thường tự động) đo model làm tốt thế nào trên các tác vụ cụ thểagentic capabilities— khả năng model tự tìm thông tin, tổng hợp và sửa tài liệu để hoàn thành tác vụS1— tài liệu đăng ký phức tạp nộp cho cơ quan quản lý (ví dụ cho IPO), một tác vụ pháp lý khótesting agent— agent có tỉ lệ thành công được theo dõi trên dashboard để đo cải thiện modelslop— output chất lượng thấp; khách hàng giữ chuẩn tin cậy cao rằng Anthropic không ship slopcompounding— vòng lặp củng cố: công cụ mới cải thiện sản phẩm khách, rồi lại cải thiện sản phẩm
Nội dung chi tiết
Bối cảnh: thử nghiệm trước khi ra mắt
Trước khi một model Claude mới ra mắt, một nhóm nhỏ khách hàng đã thử nghiệm, cố "phá" nó và định hình những gì sẽ đi kèm. Phim ngắn này ngồi lại với các đội đó để xem họ học được gì.
Năng lượng của Early Access
Khi nhận thứ mới từ Anthropic, năng lượng như một cơn bão đang tới — nhưng hào hứng, vì là "all hands on deck". Cảm giác như chuyển động với tốc độ ánh sáng: nhận cuộc gọi và nhảy ra khỏi việc đang làm. Khoảnh khắc nhận model mới, họ nhận ra "nền tảng đã thay đổi".
Làm việc ở công ty đang định hình frontier thì "vui điên cuồng" — tất cả đều ở chế độ học hỏi. Đây là cơ hội thế hệ cho bất kỳ ai trong ngành, vừa may mắn vừa trách nhiệm: tiếp tục đẩy giới hạn, đổi mới, an toàn hơn, dễ xây dựng hơn, và mở khóa một lớp developer và builder mới.
Việc đầu tiên với model mới
Việc đầu tiên là chạy eval tự động để chúng chạy ngầm ở nền. Một use case từng là "giấc mơ" và là tác vụ pháp lý đặc biệt phức tạp là soạn S1. Nhờ agentic capabilities — model tự tìm thông tin cần thiết, tổng hợp, sửa tài liệu — họ giờ giao được những phần ngày càng lớn của S1 cho model tự làm.
Chỉ bằng việc thay vào một model mới, mọi câu hỏi từng muốn hỏi đều bắt đầu được trả lời. Agent đi từ "đôi khi trả lời được, đôi khi mắc kẹt" sang trả lời mọi câu hỏi nhanh và chính xác. Dashboard tỉ lệ thành công của testing agent tăng khoảng 20%.
Dấu hiệu của một model đặc biệt
Những việc hôm nay chưa chạy được chính là dấu hiệu tốt nhất cho thấy các model kế tiếp sẽ giỏi hơn nhiều. Thấy những eval chưa từng chạy được bắt đầu chạy, rồi chạy một cách nhất quán — đó là lúc biết model này sẽ đặc biệt.
Cộng tác với Anthropic
Quan hệ với Anthropic mang tính cộng tác: gần như cách ngày lại có một cuộc trò chuyện, kỹ sư hai bên như cùng một đội. "Ít giống mua thứ gì đó từ bạn, mà giống chúng ta cùng xây dựng." Họ giữ chuẩn tin cậy cao rằng bất cứ thứ gì Anthropic công bố sẽ không phải slop.
Một từ mô tả cảm giác xây dựng ở frontier: "dazzling" (rực rỡ) — đôi khi chói lóa, đầy độ sáng, cơ hội, hứng khởi. Và compounding: nhận công cụ mới nhất, dẫn tới khách hàng có sản phẩm tốt hơn, lại dẫn tới sản phẩm của họ tốt hơn. Có một con sóng lớn bên dưới đang thay đổi cách người dùng làm việc và cách chính bạn làm việc — bạn phải giữ thăng bằng, và biết rằng còn những con sóng lớn hơn đang tới.