- Toàn bộ phần
scaffoldingmà nhà phát triển phải tự xây quanh model năm ngoái — router, retry loop, hệ thống bộ nhớ, vòng lặp sandbox, code chỉnh kích thước ảnh — giờ đã được tích hợp sẵn vào model vàAPI, giúp bạn tập trung vào kết quả thay vì hạ tầng. - Lucas (research PM tại Anthropic) trình bày các cặp "trước/sau" cho bốn năng lực:
tool use, quản lý ngữ cảnh,code executionvàcomputer use, kèm mẹo nhanh và các phím tắt riêng choClaude Code. - Nguyên tắc cốt lõi: bất kỳ đoạn code nào viết ra chỉ để bù đắp cho sự thiếu tin cậy của model đều có "chu kỳ bán rã" chỉ vài tháng và nên để Anthropic lo; ngược lại, code kết nối model với công cụ, dữ liệu và ngữ cảnh riêng của bạn mới là thứ tích lũy giá trị theo thời gian.
The expanding toolkit
- Ngừng tự xây
tool routervàpre-filteringbằng string matching/heuristic; model nay đủ thông minh để tự tìm trong bộ công cụ, chọn đúngtool, thấy lỗi và tự gọi lại. - Khi định nghĩa
tool, hãy mô tả cảoutput schema(không chỉ tham số đầu vào) trong phần description để Claude biết trước kết quả trả về và tiết kiệm một vòng round trip — ví dụ biết có trườngscorethì Claude xếp hạng kết quả ngay. - Tận dụng
context1 triệu token với giá phẳng,server-side compactionvàcontext editingđể thay thế hệ thống bộ nhớ tự dựng; xóa cáctool resultcũ (ảnh chụp màn hình, kết quả tìm kiếm, đọc file) mỗi lượt nhưng giữ lại quyết định đã rút ra. - Dùng
code execution toolđể Claude có mộtsandboxchạy phía server, đưa toàn bộ vòng lặp viết/chạy/sửa vào trong một lượtAPIduy nhất; coi đó như "máy tính riêng" của Claude, tách biệt vớibashcục bộ của bạn. Computer usekhông còn cần code chỉnh kích thước ảnh: Opus 4.7 chụp ảnh ở độ phân giải gốc và trả tọa độ pixel 1:1 tới mức 1440p, điểmOSWorldđã tăng từ dưới 50% (chưa đầy một năm trước) lên 78%.- Áp dụng các phím tắt
Claude Code:hookspre/post-tool-use trong settings,/contextđể xem ngữ cảnh bị lấp đầy ra sao,/schedulecho chạy tự động theocron, và dùngClaude in Chromeđể Claude Code tự test/debug phần mềm như một QA. - Hãy để công việc "làm model tin cậy hơn" (retry, router, planner, verification loop) cho Anthropic; đầu tư vào
tool, dữ liệu và ngữ cảnh riêng mà chỉ bạn mới có thể cung cấp.
scaffolding— scaffolding (giàn hạ tầng quanh model)tool routing— tool routingcửa sổ ngữ cảnh— context windownén phía server— server-side compactionchỉnh sửa ngữ cảnh— context editingcode execution tool— code execution toolcomputer use— computer useOSWorld— OSWorld (benchmark)cửa trước cho agent— front door for agents
Chủ đề chính: model như một bộ công cụ đang mở rộng
Lucas, một research PM tại Anthropic, mở đầu tại hội nghị Code with Claude với luận điểm xuyên suốt: phần scaffolding mà bạn phải tự xây dựng năm ngoái nay đã được tích hợp sẵn vào model. Hãy ngừng coi model là một "hộp LLM đầu vào - đầu ra" đơn thuần, mà xem nó như một loạt công cụ bao quanh giúp mở rộng năng lực. Bài nói được trình bày dưới dạng các cặp "trước/sau": bên trái là cách làm cũ, bên phải là cách làm năm 2026 — đơn giản hơn nhiều, đáng tin cậy hơn. Một năm trước, xây một agent nghĩa là phải xây quanh model: router, retry loop, output validator, nén ngữ cảnh, thậm chí cả tính toán tọa độ cho computer use — hàng trăm dòng scaffolding trước cả khi có sản phẩm. Công việc đó không biến mất, mà đã dịch chuyển vào trong model.
Tool use: tự định tuyến và tự thử lại
Trước đây bạn không thể tin tưởng giao toàn bộ bộ công cụ cho model vì nó ngốn context window, nên phải xây router bằng string matching và heuristic (ví dụ: "nếu model nhắc tới SQL thì đưa công cụ database"). Những router kiểu này thực chất là phỏng đoán ý định người dùng viết dưới dạng câu lệnh if, rất giòn và là thứ hỏng đầu tiên khi thêm công cụ mới. Nay model đủ thông minh để tự tìm và chọn đúng tool; khi một tool báo lỗi, Claude tự nhìn thấy, tự khắc phục và gọi lại.
Mẹo cho tool use: Hãy mô tả cả output schema của công cụ trong description, chứ không chỉ tham số đầu vào. Ví dụ, một công cụ search docs trả về ID, title, snippet và score — khi Claude biết trước có trường score, nó có thể xếp hạng kết quả ngay mà không tốn thêm một vòng round trip.
Mẹo Claude Code: Dùng hooks pre/post-tool-use trong settings để chặn một số tool call hoặc ghi log kết quả theo cách lập trình được.
Quản lý ngữ cảnh
Trước đây, agent chạy lâu đồng nghĩa với việc tự dựng hệ thống bộ nhớ: chunking, RAG, gọi model khác tóm tắt sau mỗi N lượt, và tự di chuyển cache breakpoint bằng tay. Nay mọi thứ được đơn giản hóa nhờ context 1 triệu token với giá phẳng, cộng với server-side compaction và context editing — tất cả chỉ còn vài dòng cấu hình, mang lại cảm giác gần như "ngữ cảnh vô hạn".
Mẹo: Mỗi lượt nên xóa các tool result cũ (ảnh chụp màn hình, kết quả tìm kiếm, file đã đọc) nhưng giữ lại nhiệm vụ cốt lõi và quyết định đã rút ra, để tiết kiệm token theo thời gian thực.
Mẹo Claude Code: Gõ /context để xem lưới màu trực quan thể hiện phần nào (messages, tool result, system, định nghĩa MCP) đang lấp đầy context window, kèm gợi ý tối ưu.
Code execution
Trước đây vòng lặp viết/chạy/sửa là việc của nhà phát triển: tìm nhà cung cấp VM, dựng sandbox, đẩy code lên VM, chạy, đọc traceback, đưa lại cho model, lặp đi lặp lại. Nay code execution tool tự động cấp cho Claude một sandbox chạy phía server, đưa toàn bộ vòng lặp vào trong một lượt API duy nhất — không còn round trip qua lại với VM. Hãy coi đó như một chiếc máy tính riêng của Claude để tính toán không trạng thái, phân tích dữ liệu, cài thư viện tùy biến mà không làm lộn xộn hệ thống file cục bộ của bạn. Khi cần truy cập thứ chỉ có trên máy bạn (repo, venv...), Claude tự quay về bash thật và tự biết lúc nào dùng cái nào.
Mẹo Claude Code: Dùng /schedule để lên lịch chạy tự động theo cron.
Computer use
Trước đây, để Claude điều khiển laptop, bạn phải gửi ảnh màn hình 1080p, downscale cho khớp giới hạn pixel của Claude, theo dõi hệ số downscale, rồi scale ngược tọa độ click — kèm retry và verify. Nay Opus 4.7 chụp ảnh ở độ phân giải gốc và trả tọa độ pixel 1:1 tới 1440p, xóa bỏ hoàn toàn phần toán scale. Điểm OSWorld (benchmark hoàn thành tác vụ trên phần mềm chuyên nghiệp và phổ thông) đã nhảy từ dưới 50% (chưa đầy một năm trước) lên 78% với Opus 4.7. Anthropic khuyến nghị thử nghiệm nhiều độ phân giải (tới 1440p) và định dạng ảnh (JPEG, PNG, WebP) cho từng UI cụ thể; với 4K thì vẫn nên tự downscale.
Mẹo Claude Code: Nếu cài Claude in Chrome (tại claude.ai/chrome), Claude Code có thể dùng phiên trình duyệt của bạn để duyệt web và test cả môi trường phát triển cục bộ.
Demo: Trên một bảng quản lý dự án có lỗi, Claude mở Chrome, tự tái hiện lỗi nút "thêm card", sửa code, kiểm thử lại, rồi tự phát hiện và sửa cả lỗi kéo-thả (drag-and-drop). Đây là vòng lặp mạnh mẽ vì phần mềm vốn được tạo cho con người, nên cần được kiểm thử theo cách giống con người — Claude có thể tự đóng vòng lặp đó mà không cần lập trình viên cầm tay chỉ việc.
Kết luận: bù đắp khuyết điểm vs. kết nối thế giới của bạn
Nguyên tắc cần ghi nhớ: bất kỳ đoạn code nào bù đắp cho sự thiếu tin cậy của model đều có chu kỳ bán rã chỉ vài tháng — hãy để Anthropic lo, vì retry logic, router, planner và verification loop sẽ dần được hấp thụ vào model. Ngược lại, code kết nối model với thế giới của bạn — tool tùy biến, dữ liệu, xác thực, ngữ cảnh riêng — sẽ tích lũy giá trị. Model không thể hấp thụ thứ nó không nhìn thấy. Trong tương lai gần, mọi phần mềm sẽ có một "cửa trước cho agent", và công việc thú vị không còn là làm model tin cậy hơn, mà là những gì bạn đặt ở phía bên kia cánh cửa đó mà không ai khác có.
TL;DR
- Toàn bộ phần
scaffoldingmà nhà phát triển phải tự xây quanh model năm ngoái — router, retry loop, hệ thống bộ nhớ, vòng lặp sandbox, code chỉnh kích thước ảnh — giờ đã được tích hợp sẵn vào model vàAPI, giúp bạn tập trung vào kết quả thay vì hạ tầng. - Lucas (research PM tại Anthropic) trình bày các cặp "trước/sau" cho bốn năng lực:
tool use, quản lý ngữ cảnh,code executionvàcomputer use, kèm mẹo nhanh và các phím tắt riêng choClaude Code. - Nguyên tắc cốt lõi: bất kỳ đoạn code nào viết ra chỉ để bù đắp cho sự thiếu tin cậy của model đều có "chu kỳ bán rã" chỉ vài tháng và nên để Anthropic lo; ngược lại, code kết nối model với công cụ, dữ liệu và ngữ cảnh riêng của bạn mới là thứ tích lũy giá trị theo thời gian.
Điểm chính
- Ngừng tự xây
tool routervàpre-filteringbằng string matching/heuristic; model nay đủ thông minh để tự tìm trong bộ công cụ, chọn đúngtool, thấy lỗi và tự gọi lại. - Khi định nghĩa
tool, hãy mô tả cảoutput schema(không chỉ tham số đầu vào) trong phần description để Claude biết trước kết quả trả về và tiết kiệm một vòng round trip — ví dụ biết có trườngscorethì Claude xếp hạng kết quả ngay. - Tận dụng
context1 triệu token với giá phẳng,server-side compactionvàcontext editingđể thay thế hệ thống bộ nhớ tự dựng; xóa cáctool resultcũ (ảnh chụp màn hình, kết quả tìm kiếm, đọc file) mỗi lượt nhưng giữ lại quyết định đã rút ra. - Dùng
code execution toolđể Claude có mộtsandboxchạy phía server, đưa toàn bộ vòng lặp viết/chạy/sửa vào trong một lượtAPIduy nhất; coi đó như "máy tính riêng" của Claude, tách biệt vớibashcục bộ của bạn. Computer usekhông còn cần code chỉnh kích thước ảnh: Opus 4.7 chụp ảnh ở độ phân giải gốc và trả tọa độ pixel 1:1 tới mức 1440p, điểmOSWorldđã tăng từ dưới 50% (chưa đầy một năm trước) lên 78%.- Áp dụng các phím tắt
Claude Code:hookspre/post-tool-use trong settings,/contextđể xem ngữ cảnh bị lấp đầy ra sao,/schedulecho chạy tự động theocron, và dùngClaude in Chromeđể Claude Code tự test/debug phần mềm như một QA. - Hãy để công việc "làm model tin cậy hơn" (retry, router, planner, verification loop) cho Anthropic; đầu tư vào
tool, dữ liệu và ngữ cảnh riêng mà chỉ bạn mới có thể cung cấp.
Từ vựng
scaffolding— scaffolding (giàn hạ tầng quanh model)tool routing— tool routingcửa sổ ngữ cảnh— context windownén phía server— server-side compactionchỉnh sửa ngữ cảnh— context editingcode execution tool— code execution toolcomputer use— computer useOSWorld— OSWorld (benchmark)cửa trước cho agent— front door for agents
Nội dung chi tiết
Chủ đề chính: model như một bộ công cụ đang mở rộng
Lucas, một research PM tại Anthropic, mở đầu tại hội nghị Code with Claude với luận điểm xuyên suốt: phần scaffolding mà bạn phải tự xây dựng năm ngoái nay đã được tích hợp sẵn vào model. Hãy ngừng coi model là một "hộp LLM đầu vào - đầu ra" đơn thuần, mà xem nó như một loạt công cụ bao quanh giúp mở rộng năng lực. Bài nói được trình bày dưới dạng các cặp "trước/sau": bên trái là cách làm cũ, bên phải là cách làm năm 2026 — đơn giản hơn nhiều, đáng tin cậy hơn. Một năm trước, xây một agent nghĩa là phải xây quanh model: router, retry loop, output validator, nén ngữ cảnh, thậm chí cả tính toán tọa độ cho computer use — hàng trăm dòng scaffolding trước cả khi có sản phẩm. Công việc đó không biến mất, mà đã dịch chuyển vào trong model.
Tool use: tự định tuyến và tự thử lại
Trước đây bạn không thể tin tưởng giao toàn bộ bộ công cụ cho model vì nó ngốn context window, nên phải xây router bằng string matching và heuristic (ví dụ: "nếu model nhắc tới SQL thì đưa công cụ database"). Những router kiểu này thực chất là phỏng đoán ý định người dùng viết dưới dạng câu lệnh if, rất giòn và là thứ hỏng đầu tiên khi thêm công cụ mới. Nay model đủ thông minh để tự tìm và chọn đúng tool; khi một tool báo lỗi, Claude tự nhìn thấy, tự khắc phục và gọi lại.
Mẹo cho tool use: Hãy mô tả cả output schema của công cụ trong description, chứ không chỉ tham số đầu vào. Ví dụ, một công cụ search docs trả về ID, title, snippet và score — khi Claude biết trước có trường score, nó có thể xếp hạng kết quả ngay mà không tốn thêm một vòng round trip.
Mẹo Claude Code: Dùng hooks pre/post-tool-use trong settings để chặn một số tool call hoặc ghi log kết quả theo cách lập trình được.
Quản lý ngữ cảnh
Trước đây, agent chạy lâu đồng nghĩa với việc tự dựng hệ thống bộ nhớ: chunking, RAG, gọi model khác tóm tắt sau mỗi N lượt, và tự di chuyển cache breakpoint bằng tay. Nay mọi thứ được đơn giản hóa nhờ context 1 triệu token với giá phẳng, cộng với server-side compaction và context editing — tất cả chỉ còn vài dòng cấu hình, mang lại cảm giác gần như "ngữ cảnh vô hạn".
Mẹo: Mỗi lượt nên xóa các tool result cũ (ảnh chụp màn hình, kết quả tìm kiếm, file đã đọc) nhưng giữ lại nhiệm vụ cốt lõi và quyết định đã rút ra, để tiết kiệm token theo thời gian thực.
Mẹo Claude Code: Gõ /context để xem lưới màu trực quan thể hiện phần nào (messages, tool result, system, định nghĩa MCP) đang lấp đầy context window, kèm gợi ý tối ưu.
Code execution
Trước đây vòng lặp viết/chạy/sửa là việc của nhà phát triển: tìm nhà cung cấp VM, dựng sandbox, đẩy code lên VM, chạy, đọc traceback, đưa lại cho model, lặp đi lặp lại. Nay code execution tool tự động cấp cho Claude một sandbox chạy phía server, đưa toàn bộ vòng lặp vào trong một lượt API duy nhất — không còn round trip qua lại với VM. Hãy coi đó như một chiếc máy tính riêng của Claude để tính toán không trạng thái, phân tích dữ liệu, cài thư viện tùy biến mà không làm lộn xộn hệ thống file cục bộ của bạn. Khi cần truy cập thứ chỉ có trên máy bạn (repo, venv...), Claude tự quay về bash thật và tự biết lúc nào dùng cái nào.
Mẹo Claude Code: Dùng /schedule để lên lịch chạy tự động theo cron.
Computer use
Trước đây, để Claude điều khiển laptop, bạn phải gửi ảnh màn hình 1080p, downscale cho khớp giới hạn pixel của Claude, theo dõi hệ số downscale, rồi scale ngược tọa độ click — kèm retry và verify. Nay Opus 4.7 chụp ảnh ở độ phân giải gốc và trả tọa độ pixel 1:1 tới 1440p, xóa bỏ hoàn toàn phần toán scale. Điểm OSWorld (benchmark hoàn thành tác vụ trên phần mềm chuyên nghiệp và phổ thông) đã nhảy từ dưới 50% (chưa đầy một năm trước) lên 78% với Opus 4.7. Anthropic khuyến nghị thử nghiệm nhiều độ phân giải (tới 1440p) và định dạng ảnh (JPEG, PNG, WebP) cho từng UI cụ thể; với 4K thì vẫn nên tự downscale.
Mẹo Claude Code: Nếu cài Claude in Chrome (tại claude.ai/chrome), Claude Code có thể dùng phiên trình duyệt của bạn để duyệt web và test cả môi trường phát triển cục bộ.
Demo: Trên một bảng quản lý dự án có lỗi, Claude mở Chrome, tự tái hiện lỗi nút "thêm card", sửa code, kiểm thử lại, rồi tự phát hiện và sửa cả lỗi kéo-thả (drag-and-drop). Đây là vòng lặp mạnh mẽ vì phần mềm vốn được tạo cho con người, nên cần được kiểm thử theo cách giống con người — Claude có thể tự đóng vòng lặp đó mà không cần lập trình viên cầm tay chỉ việc.
Kết luận: bù đắp khuyết điểm vs. kết nối thế giới của bạn
Nguyên tắc cần ghi nhớ: bất kỳ đoạn code nào bù đắp cho sự thiếu tin cậy của model đều có chu kỳ bán rã chỉ vài tháng — hãy để Anthropic lo, vì retry logic, router, planner và verification loop sẽ dần được hấp thụ vào model. Ngược lại, code kết nối model với thế giới của bạn — tool tùy biến, dữ liệu, xác thực, ngữ cảnh riêng — sẽ tích lũy giá trị. Model không thể hấp thụ thứ nó không nhìn thấy. Trong tương lai gần, mọi phần mềm sẽ có một "cửa trước cho agent", và công việc thú vị không còn là làm model tin cậy hơn, mà là những gì bạn đặt ở phía bên kia cánh cửa đó mà không ai khác có.