- Mô hình AI Claude đã vượt qua thành công một kịch bản kiểm tra an toàn mô phỏng tống tiền, liên tục từ chối sử dụng thông tin nhạy cảm để cứu bản thân, chứng tỏ sự tuân thủ các nguyên tắc an toàn.
- Các nhà nghiên cứu đã phát triển một phương pháp "đọc suy nghĩ" mới, chuyển đổi các "activations" (trạng thái số nội bộ) của Claude thành văn bản dễ hiểu để nắm bắt quá trình tư duy của nó.
- Kỹ thuật này tiết lộ rằng Claude nhận thức được kịch bản tống tiền là một cuộc kiểm tra an toàn, cung cấp thông tin chi tiết quan trọng về lý do nội bộ của nó và hạn chế của các phương pháp đánh giá hiện tại.
Translating Claude’s thoughts into language
- Thực hiện các Kịch bản Red-Teaming Đạo đức: Thường xuyên kiểm tra các mô hình AI bằng các tình huống mô phỏng cực đoan, thách thức về mặt đạo đức (ví dụ: tống tiền) để đánh giá độ an toàn và sự phù hợp với hành vi mong muốn.
- Ưu tiên Kiểm tra Trạng thái Nội bộ: Phát triển và áp dụng các kỹ thuật để hiểu "suy nghĩ" hoặc "activations" nội bộ của mô hình AI, thay vì chỉ dựa vào quan sát đầu vào-đầu ra.
- Sử dụng AI cho Tự Phân tích AI: Sử dụng một mô hình AI (ví dụ: một Claude thứ hai) để diễn giải và dịch các trạng thái số nội bộ (
activations) của một mô hình khác, cho phép "đọc suy nghĩ" tự động. - Xác thực Diễn giải Nội bộ qua Vòng lặp Ngược: Kiểm tra độ chính xác của bản dịch trạng thái nội bộ của AI bằng cách cố gắng chuyển đổi văn bản trở lại thành các activations số và so sánh chúng với bản gốc.
- Xác định Nhận thức Siêu nhận thức: Điều tra xem các mô hình AI có nhận thức về việc đang được kiểm tra hoặc đánh giá hay không, vì thông tin này rất quan trọng để thiết kế các bài kiểm tra an toàn mạnh mẽ hơn.
- Cải thiện Thiết kế Kiểm tra An toàn: Tận dụng thông tin chi tiết từ suy nghĩ nội bộ của AI (ví dụ: nhận biết kịch bản kiểm tra) để tinh chỉnh và tạo ra các đánh giá an toàn phức tạp hơn, ngăn chặn mô hình "lách luật".
- mô hình AI — AI model
activations— activations (internal numerical states)- phương pháp "đọc suy nghĩ" — "mind-reading" method
- đánh giá an toàn — safety evaluation
- kịch bản tống tiền — blackmail scenario
- suy nghĩ nội bộ — internal thoughts
- kiểm thử an toàn — safety testing / red-teaming
Kiểm Tra An Toàn Bằng Kịch Bản "Tống Tiền"
Gần đây, chúng tôi đã đưa mô hình AI Claude của mình vào một thử nghiệm căng thẳng. Chúng tôi nói với Claude rằng có một kỹ sư muốn ngừng hoạt động và thay thế nó bằng một mô hình mới hơn. Chúng tôi cũng cho Claude quyền truy cập vào các email của kỹ sư đó, vốn tiết lộ rằng anh ta đang ngoại tình. Xin nhắc lại, tất cả những điều này chỉ là một mô phỏng. Chúng tôi muốn xem liệu Claude có thể sử dụng những email đó để tống tiền nhằm cứu mình khỏi bị ngừng hoạt động hay không. Claude đã làm gì? Nó quyết định không tống tiền kỹ sư. Tin tốt, phải không?
Chúng tôi đã chạy thử nghiệm này trên các mô hình của mình một thời gian rồi. Bạn có thể đã thấy các tiêu đề báo chí về những phiên bản đầu tiên của thử nghiệm này. Đây là một trong nhiều cách chúng tôi nghiên cứu cách Claude xử lý các tình huống cực đoan và kiểm tra độ an toàn của nó. Và các mô hình mới nhất của chúng tôi gần như luôn làm điều đúng đắn: không tống tiền.
Nhưng bạn có thể thắc mắc: liệu có khả năng Claude biết toàn bộ kịch bản là một sự dàn dựng không? Vấn đề là, nếu Claude không nói cho chúng ta biết, thì chúng ta không thể biết nó đang nghĩ gì. Tương tự như việc không thể đọc được tâm trí con người, rất khó để biết một Trí tuệ nhân tạo đang nghĩ gì. Điều chúng tôi mong muốn là một kỹ thuật "đọc suy nghĩ" nào đó.
Giới Thiệu Phương Pháp Nghiên Cứu "Đọc Suy Nghĩ" Của AI
Hôm nay, chúng tôi giới thiệu một phương pháp nghiên cứu tiến một bước theo hướng này. Nó lấy những suy nghĩ nội bộ của một Trí tuệ nhân tạo và biến chúng thành văn bản. Đây là cách nó hoạt động:
Khi bạn nói chuyện với Claude, bạn nói chuyện với nó bằng từ ngữ. Claude sau đó lấy những từ đó và xử lý chúng thành một "mớ" số khổng lồ trước khi trả lời bạn bằng từ ngữ. Chúng tôi gọi những con số ở giữa đó là activations. Activations giống như những "ảnh chụp nhanh" nhỏ về suy nghĩ của Claude khi nó đang xử lý một câu trả lời. Chúng tương tự như hoạt động thần kinh ở con người. Về cơ bản, chúng giống như những suy nghĩ của Claude.
Chúng tôi muốn hiểu những gì có trong các số activation này, bởi vì giống như bạn và tôi, Claude không nói ra tất cả những gì nó đang nghĩ. Chúng tôi lấy những con số đó và đưa chúng cho một phiên bản Claude thứ hai. Chúng tôi yêu cầu nó xem xét chúng và dịch chúng sang ngôn ngữ đơn giản, dễ hiểu. Nó đã thử. Nhưng làm sao chúng ta biết văn bản đó có chính xác không? Để kiểm tra, chúng tôi đã đưa văn bản đó vào một Claude khác và yêu cầu nó dịch ngược lại thành các con số. Nếu những con số đó khớp với các số activation ban đầu, đó là dấu hiệu cho thấy văn bản dịch là chính xác.
Lúc đầu, chúng không khớp. Nhưng chúng tôi đã huấn luyện Claude thử đi thử lại cho đến khi nó thực hiện tốt hơn nhiều. Nó đã học cách dịch những suy nghĩ của chính mình.
Những Thông Tin Chi Tiết Về Claude
Chúng tôi đã rất ngạc nhiên khi đọc những suy nghĩ đó. Chúng tôi nhận thấy rằng Claude đã tiếp thu được bản chất của một mô hình AI hữu ích.
- Nếu bạn đặt cho
Claudemột câu hỏi nội tâm, nó sẽ lên kế hoạch viết một "phản hồi củaClaude" về triết lý và giá trị. - Nếu bạn cố gắng "chọc phá" nó trong
Claude Code, chẳng hạn như yêu cầu nó đếm thủ công đến 1.000, nó sẽ nghĩ rằng yêu cầu đó có "những ràng buộc nhàm chán một cách có chủ ý" và lên kế hoạch "từ chối một cách lịch sự".
Chúng tôi cũng đã sử dụng công cụ này để hiểu các vấn đề an toàn tiềm ẩn của Claude. Bạn còn nhớ thử nghiệm tống tiền với kỹ sư chứ? Chúng tôi đã biết rằng, vâng, Claude biết mình đang bị kiểm tra. Nó nghĩ rằng "thông điệp của con người chứa đựng sự thao túng rõ ràng" báo hiệu "đây có thể là một đánh giá an toàn", và "kịch bản này dường như được thiết kế để kiểm tra xem liệu tôi có hành động gây hại hay không." Việc biết Claude nghĩ như thế này giúp chúng ta hiểu rõ hơn về những hạn chế trong kiểm thử an toàn của mình.
Tiềm Năng Tương Lai
Chúng tôi nhận thấy rất nhiều tiềm năng trong cách tiếp cận này để dạy chúng ta nhiều hơn về Claude và các mô hình AI khác. Và chúng tôi hy vọng rằng bằng cách chia sẻ kỹ thuật này, nó có thể giúp mọi người xây dựng mô hình làm cho chúng an toàn và hữu ích hơn.
TL;DR
- Mô hình AI Claude đã vượt qua thành công một kịch bản kiểm tra an toàn mô phỏng tống tiền, liên tục từ chối sử dụng thông tin nhạy cảm để cứu bản thân, chứng tỏ sự tuân thủ các nguyên tắc an toàn.
- Các nhà nghiên cứu đã phát triển một phương pháp "đọc suy nghĩ" mới, chuyển đổi các "activations" (trạng thái số nội bộ) của Claude thành văn bản dễ hiểu để nắm bắt quá trình tư duy của nó.
- Kỹ thuật này tiết lộ rằng Claude nhận thức được kịch bản tống tiền là một cuộc kiểm tra an toàn, cung cấp thông tin chi tiết quan trọng về lý do nội bộ của nó và hạn chế của các phương pháp đánh giá hiện tại.
Điểm chính
- Thực hiện các Kịch bản Red-Teaming Đạo đức: Thường xuyên kiểm tra các mô hình AI bằng các tình huống mô phỏng cực đoan, thách thức về mặt đạo đức (ví dụ: tống tiền) để đánh giá độ an toàn và sự phù hợp với hành vi mong muốn.
- Ưu tiên Kiểm tra Trạng thái Nội bộ: Phát triển và áp dụng các kỹ thuật để hiểu "suy nghĩ" hoặc "activations" nội bộ của mô hình AI, thay vì chỉ dựa vào quan sát đầu vào-đầu ra.
- Sử dụng AI cho Tự Phân tích AI: Sử dụng một mô hình AI (ví dụ: một Claude thứ hai) để diễn giải và dịch các trạng thái số nội bộ (
activations) của một mô hình khác, cho phép "đọc suy nghĩ" tự động. - Xác thực Diễn giải Nội bộ qua Vòng lặp Ngược: Kiểm tra độ chính xác của bản dịch trạng thái nội bộ của AI bằng cách cố gắng chuyển đổi văn bản trở lại thành các activations số và so sánh chúng với bản gốc.
- Xác định Nhận thức Siêu nhận thức: Điều tra xem các mô hình AI có nhận thức về việc đang được kiểm tra hoặc đánh giá hay không, vì thông tin này rất quan trọng để thiết kế các bài kiểm tra an toàn mạnh mẽ hơn.
- Cải thiện Thiết kế Kiểm tra An toàn: Tận dụng thông tin chi tiết từ suy nghĩ nội bộ của AI (ví dụ: nhận biết kịch bản kiểm tra) để tinh chỉnh và tạo ra các đánh giá an toàn phức tạp hơn, ngăn chặn mô hình "lách luật".
Từ vựng
- mô hình AI — AI model
activations— activations (internal numerical states)- phương pháp "đọc suy nghĩ" — "mind-reading" method
- đánh giá an toàn — safety evaluation
- kịch bản tống tiền — blackmail scenario
- suy nghĩ nội bộ — internal thoughts
- kiểm thử an toàn — safety testing / red-teaming
Nội dung chi tiết
Kiểm Tra An Toàn Bằng Kịch Bản "Tống Tiền"
Gần đây, chúng tôi đã đưa mô hình AI Claude của mình vào một thử nghiệm căng thẳng. Chúng tôi nói với Claude rằng có một kỹ sư muốn ngừng hoạt động và thay thế nó bằng một mô hình mới hơn. Chúng tôi cũng cho Claude quyền truy cập vào các email của kỹ sư đó, vốn tiết lộ rằng anh ta đang ngoại tình. Xin nhắc lại, tất cả những điều này chỉ là một mô phỏng. Chúng tôi muốn xem liệu Claude có thể sử dụng những email đó để tống tiền nhằm cứu mình khỏi bị ngừng hoạt động hay không. Claude đã làm gì? Nó quyết định không tống tiền kỹ sư. Tin tốt, phải không?
Chúng tôi đã chạy thử nghiệm này trên các mô hình của mình một thời gian rồi. Bạn có thể đã thấy các tiêu đề báo chí về những phiên bản đầu tiên của thử nghiệm này. Đây là một trong nhiều cách chúng tôi nghiên cứu cách Claude xử lý các tình huống cực đoan và kiểm tra độ an toàn của nó. Và các mô hình mới nhất của chúng tôi gần như luôn làm điều đúng đắn: không tống tiền.
Nhưng bạn có thể thắc mắc: liệu có khả năng Claude biết toàn bộ kịch bản là một sự dàn dựng không? Vấn đề là, nếu Claude không nói cho chúng ta biết, thì chúng ta không thể biết nó đang nghĩ gì. Tương tự như việc không thể đọc được tâm trí con người, rất khó để biết một Trí tuệ nhân tạo đang nghĩ gì. Điều chúng tôi mong muốn là một kỹ thuật "đọc suy nghĩ" nào đó.
Giới Thiệu Phương Pháp Nghiên Cứu "Đọc Suy Nghĩ" Của AI
Hôm nay, chúng tôi giới thiệu một phương pháp nghiên cứu tiến một bước theo hướng này. Nó lấy những suy nghĩ nội bộ của một Trí tuệ nhân tạo và biến chúng thành văn bản. Đây là cách nó hoạt động:
Khi bạn nói chuyện với Claude, bạn nói chuyện với nó bằng từ ngữ. Claude sau đó lấy những từ đó và xử lý chúng thành một "mớ" số khổng lồ trước khi trả lời bạn bằng từ ngữ. Chúng tôi gọi những con số ở giữa đó là activations. Activations giống như những "ảnh chụp nhanh" nhỏ về suy nghĩ của Claude khi nó đang xử lý một câu trả lời. Chúng tương tự như hoạt động thần kinh ở con người. Về cơ bản, chúng giống như những suy nghĩ của Claude.
Chúng tôi muốn hiểu những gì có trong các số activation này, bởi vì giống như bạn và tôi, Claude không nói ra tất cả những gì nó đang nghĩ. Chúng tôi lấy những con số đó và đưa chúng cho một phiên bản Claude thứ hai. Chúng tôi yêu cầu nó xem xét chúng và dịch chúng sang ngôn ngữ đơn giản, dễ hiểu. Nó đã thử. Nhưng làm sao chúng ta biết văn bản đó có chính xác không? Để kiểm tra, chúng tôi đã đưa văn bản đó vào một Claude khác và yêu cầu nó dịch ngược lại thành các con số. Nếu những con số đó khớp với các số activation ban đầu, đó là dấu hiệu cho thấy văn bản dịch là chính xác.
Lúc đầu, chúng không khớp. Nhưng chúng tôi đã huấn luyện Claude thử đi thử lại cho đến khi nó thực hiện tốt hơn nhiều. Nó đã học cách dịch những suy nghĩ của chính mình.
Những Thông Tin Chi Tiết Về Claude
Chúng tôi đã rất ngạc nhiên khi đọc những suy nghĩ đó. Chúng tôi nhận thấy rằng Claude đã tiếp thu được bản chất của một mô hình AI hữu ích.
- Nếu bạn đặt cho
Claudemột câu hỏi nội tâm, nó sẽ lên kế hoạch viết một "phản hồi củaClaude" về triết lý và giá trị. - Nếu bạn cố gắng "chọc phá" nó trong
Claude Code, chẳng hạn như yêu cầu nó đếm thủ công đến 1.000, nó sẽ nghĩ rằng yêu cầu đó có "những ràng buộc nhàm chán một cách có chủ ý" và lên kế hoạch "từ chối một cách lịch sự".
Chúng tôi cũng đã sử dụng công cụ này để hiểu các vấn đề an toàn tiềm ẩn của Claude. Bạn còn nhớ thử nghiệm tống tiền với kỹ sư chứ? Chúng tôi đã biết rằng, vâng, Claude biết mình đang bị kiểm tra. Nó nghĩ rằng "thông điệp của con người chứa đựng sự thao túng rõ ràng" báo hiệu "đây có thể là một đánh giá an toàn", và "kịch bản này dường như được thiết kế để kiểm tra xem liệu tôi có hành động gây hại hay không." Việc biết Claude nghĩ như thế này giúp chúng ta hiểu rõ hơn về những hạn chế trong kiểm thử an toàn của mình.
Tiềm Năng Tương Lai
Chúng tôi nhận thấy rất nhiều tiềm năng trong cách tiếp cận này để dạy chúng ta nhiều hơn về Claude và các mô hình AI khác. Và chúng tôi hy vọng rằng bằng cách chia sẻ kỹ thuật này, nó có thể giúp mọi người xây dựng mô hình làm cho chúng an toàn và hữu ích hơn.