Bỏ qua đến nội dung chính

Memory and dreaming for self learning agents

TL;DR

  • Ravi, người dẫn dắt đội API knowledge tại Anthropic, giới thiệu hai tính năng mới cho Claude Managed Agentsmemorydreaming — cho phép agent học theo thời gian và cải thiện từ tác vụ này sang tác vụ khác.
  • Memory được mô hình hóa như một hệ thống tệp để Claude dùng các công cụ quen thuộc (bash, grep) đọc, cập nhật và tổ chức những gì nó lưu, với hỗ trợ đa agent (scope chỉ-đọc và đọc-ghi), optimistic concurrency control, lịch sử phiên bản, attribution, và một API độc lập.
  • Dreaming là một tiến trình batch tách rời (out-of-band) phân tích transcript phiên qua nhiều agent, tìm mẫu trong lỗi và sự kém hiệu quả, và tạo ra một snapshot bộ nhớ được xác minh, tổ chức tốt hơn — với khách hàng như Harvey thấy tỷ lệ hoàn thành tăng gấp sáu lần trên benchmark pháp lý.

Điểm chính

  • Con đường đến memory đi qua MCP (2024, công cụ/dữ liệu bên ngoài), Claude CodeAgent SDK (2025, hạ rào cản xây agent), skills (trừu tượng chung cho năng lực mới), và Claude Managed Agents (chạy agent đáng tin cậy); mạch chung là agent làm được nhiều hơn trên thời gian dài hơn, với nghiên cứu METR 2025 thấy độ dài tác vụ tăng gấp đôi mỗi bảy tháng.
  • Memory để agent mang theo bài học, cải thiện hiệu năng từ tác vụ này sang tác vụ khác, môi trường này sang môi trường khác, và agent này sang agent khác — kể cả các "bầy" agent duy trì hiểu biết chung về tổ chức.
  • Memory cho Claude Managed Agents là hệ thống tiên tiến tối đa hóa trí tuệ ngay từ đầu; xây cùng các đội đối tác, Rakuten thấy lỗi lần đầu giảm 97% và WiseDocs giảm các vấn đề thường gặp nhờ cross-session memory; phản hồi chung là primitive này cho phép đội tập trung vào sản phẩm, không phải hạ tầng.
  • Memory được mô hình hóa như hệ thống tệp vì Claude (đặc biệt Opus 4.7, đứng đầu về memory dựa trên file system) giỏi điều hướng file system bằng bashgrep và phân biệt ngữ cảnh nào cần lưu — nguyên tắc là "nhường đường cho Claude" và "để nó nấu" (let it cook).
  • Với đa agent, memory hỗ trợ scope chỉ-đọc (ví dụ bộ nhớ toàn tổ chức ít cập nhật, mọi agent đọc được) và scope đọc-ghi (kho chi tiết để agent ghi tự do), tạo phân cấp mở rộng được, với optimistic concurrency control ngăn agent ghi đè lẫn nhau.
  • Memory có kiểm soát cấp doanh nghiệp: version control tạo audit trail, có thể diff giữa các phiên bản, có attribution xem agent nào ghi phần nào, và một API độc lập cung cấp CRUD cùng các thao tác như export và redaction.
  • Khi mở rộng mẫu ghi bộ nhớ sang đa agent, các agent lặp cùng lỗi và sự kém hiệu quả, cập nhật bộ nhớ theo cách tối ưu cục bộ (không toàn cục) với trùng lặp và phân mảnh — nên một feedback loop trong lớp xử lý, gọi là dreaming, được xây để khắc phục.
  • Dreaming là tiến trình batch, out-of-band (tách khỏi agent loop, không thêm độ trễ) phân tích transcript phiên, kiểm tra trạng thái bộ nhớ và đề xuất tối ưu đã xác minh; có thể chạy ad hoc, hằng đêm, hằng giờ, hoặc kích hoạt bởi sự kiện; Harvey thấy tỷ lệ hoàn thành tăng gấp sáu lần, và bản thân dreaming được xây trên Claude Managed Agents, tạo các sub-agent phân tích transcript song song.

Từ vựng

  • memory — memory
  • dreaming — dreaming
  • Claude Managed Agents — Claude Managed Agents
  • scope chỉ-đọc — read-only scope
  • scope đọc-ghi — read-write scope
  • optimistic concurrency control — optimistic concurrency control
  • out-of-band — out-of-band
  • skills — skills
  • MCP — Model Context Protocol

Nội dung chi tiết

Bối cảnh: Các cột mốc dẫn đến Memory

Ravi dẫn dắt đội API knowledge tại Anthropic, tập trung tạo các khối xây dựng để agent tương tác với mọi dạng tri thức. Anh giới thiệu hai tính năng tâm đắc: memorydreaming, giúp agent học theo thời gian và cải thiện từ tác vụ này sang tác vụ khác.

Dòng thời gian các cột mốc:

  • 2024 — MCP (Model Context Protocol): Cho mô hình truy cập công cụ và dữ liệu bên ngoài một cách có nguyên tắc.
  • 2025 — Claude CodeAgent SDK: Hạ rào cản dùng và xây agent.
  • 2025 — skills: Một trừu tượng chung, đơn giản và linh hoạt để gắn năng lực mới.
  • Tháng trước — Claude Managed Agents: Nền tảng chạy agent đáng tin cậy.

Mạch chung: agent làm được nhiều hơn trên thời gian dài hơn. Nghiên cứu METR 2025 cho thấy độ dài tác vụ agent hoàn thành được tăng gấp đôi mỗi bảy tháng. Nhưng quản lý ngữ cảnh trên tác vụ dài hạn vẫn là việc đang làm — đó là chỗ memory bước vào.

Memory: Để agent học qua từng tác vụ

Memory để agent mang theo bài học từ các tác vụ trước. Mục tiêu: hiệu năng cải thiện từ tác vụ 1 sang 2, 2 sang 3... thay vì mỗi agent luôn bắt đầu từ con số không. Việc học diễn ra từ tác vụ sang tác vụ, môi trường sang môi trường, và agent sang agent — kể cả các "bầy" agent duy trì hiểu biết chung về tổ chức.

Memory cho Claude Managed Agents được xây cùng các đội đối tác và cho kết quả ấn tượng: Rakuten giảm 97% lỗi lần đầu (first-pass errors) trong production; WiseDocs giảm các vấn đề thường gặp nhờ cross-session memory. Phản hồi chung: primitive này cho phép đội tập trung vào sản phẩm, không phải hạ tầng.

Thiết kế Memory như một hệ thống tệp

Memory không hoàn toàn mới, nhưng cách tiếp cận đã tiến hóa. Trước đây tập trung vào năng lực trong harness (như Claude.md cho Claude Code, hay công cụ memory chuyên dụng trong SDK). Nay, giống như với skills, nguyên tắc là "nhường đường cho Claude" — mô hình hóa memory như một hệ thống tệp.

Lý do: Claude rất giỏi điều hướng file system và dùng bash, grep để đọc/cập nhật/tổ chức file. Opus 4.7 đứng đầu về memory dựa trên file system, ngày càng giỏi phân biệt ngữ cảnh nào quan trọng cần lưu và cấu trúc nó ra sao. Hay như họ nói: "để nó nấu" (let it cook).

Đa agent và kiểm soát doanh nghiệp

Để hoạt động qua nhiều agent (cùng hoặc khác môi trường), memory cần:

  • Scope chỉ-đọc: ví dụ bộ nhớ toàn tổ chức (SLO policy, runbook, on-call mapping), ít cập nhật, mọi agent đọc được.
  • Scope đọc-ghi: các kho chi tiết, riêng cho tác vụ, agent ghi tự do.
  • Optimistic concurrency control: ngăn một agent ghi đè lên thay đổi của agent khác.

Kiểm soát cấp doanh nghiệp gồm: version control tạo audit trail, diff giữa các phiên bản, attribution (agent nào ghi phần nào), và một API độc lập cung cấp CRUD cùng export và redaction.

Dreaming: Tối ưu bộ nhớ toàn cục

Khi mở rộng mẫu "agent ghi bộ nhớ khi làm việc" sang đa agent, xuất hiện giới hạn: các agent lặp cùng lỗi, có cùng kiểu kém hiệu quả, và cập nhật bộ nhớ theo cách tối ưu cục bộ chứ không toàn cục (trùng lặp, phân mảnh). Giải pháp là một feedback loop trong lớp xử lý, gọi là dreaming.

Dreaming (hiện ở research preview) tìm mẫu trong lỗi qua các agent và phiên, tự động tổ chức và tinh chỉnh bộ nhớ. Harvey thấy tỷ lệ hoàn thành tăng gấp sáu lần trên benchmark pháp lý. Đặc điểm:

  • Là tiến trình batch, out-of-band, hoàn toàn tách khỏi agent loop, không thêm độ trễ (ngoài hot path).
  • Có thể chạy ad hoc, hằng đêm, hằng giờ, hoặc kích hoạt bởi sự kiện (kết thúc phiên), điều khiển qua API.
  • Mỗi lần chạy phân tích transcript phiên, kiểm tra trạng thái bộ nhớ, và đề xuất tối ưu — đầu ra là snapshot bộ nhớ đã xác minh, tổ chức tốt hơn mà agent có thể chọn áp dụng.

Việc tách rời còn giúp phát hiện mẫu xuyên phiên/xuyên agent mà một agent đơn lẻ khó thấy, và cho mục tiêu rõ ràng (không phải đánh đổi giữa cải thiện bộ nhớ và hoàn thành tác vụ).

Demo: Agent SRE với Memory và Dreaming

Demo là nền tảng agent cho SRE: hệ thống xem các alert/page đến, và với một số, tạo agent để triage và sửa. Nó có một kho memory chỉ-đọc toàn tổ chức (SLO policy, runbook, on-call mapping) và các kho đọc-ghi riêng cho tác vụ.

Ví dụ thú vị: một agent tìm ra nguyên nhân gốc của alert, đưa ra fix, và ghi vào bộ nhớ rằng "fix đang trên đường". Phiên sau gặp vấn đề tương tự đã biết fix đang tới và hành động dựa trên đó — đúng tinh thần cross-session memory.

Trên Claude console, có thể xem các kho memory, lịch sử phiên bản, attribution. Ở tab Dreams, kick off một dream với kho SRE và một batch ~5 phiên trong 7 ngày. Bản thân dreaming được xây trên Claude Managed Agents — nó tạo các sub-agent phân tích transcript song song. Khi hoàn tất, có thể xem diff: ví dụ phát hiện mẫu lặp "alert kích hoạt 60 giây sau CPU spike", nghi vấn vấn đề ở hành vi retry, và ghi chú để agent sau hành động.

Kết luận

Kết hợp lại: một lớp memory mạnh chia sẻ qua agent và môi trường, cùng dreaming tối ưu và hòa giải bộ nhớ toàn cục. Chia sẻ bộ nhớ liên tục cải thiện nâng sàn cho mọi agent, và dreaming nâng cao hơn nữa. Có thể nghĩ về dreaming như test-time compute: bỏ chút công sức trước để tạo bộ nhớ chất lượng cao hơn, mang lại lợi ích cho mọi agent về sau. Ravi kỳ vọng năm nay agent sẽ chạy trong nhiều ngày, và hệ thống memory là phần quan trọng để mở khóa năng lực đó.

Góp ý / Báo lỗiPhát hiện sai sót hoặc có ý tưởng cải thiện?