- Một diễn giả từ Cursor giải thích: với model giỏi như hiện nay, nút thắt không còn là trí thông minh của model mà là việc con người cấp công cụ, ngữ cảnh và những nhiệm vụ đủ tham vọng — nên nhiệm vụ của Cursor là "thả tự do" cho agent một cách an toàn.
- Cursor trải qua ba giai đoạn: cấp công cụ và ngữ cảnh để agent tự chủ, học cách tận dụng model mạnh hơn, và cuối cùng là "xây hệ thống tự xây hệ thống".
- Họ tạo một
onboarding agentchạy bằng Claude (cursor.com/onboard), một CLI dev, vàcomputer useđể agent thấy và chạy ứng dụng; đúc kết các nguyên tắc tự chủ và tạo vòng lặp tự cải tiến nơi agent tự báo cáo và sửa lỗi trải nghiệm phát triển.
Giving coding agents their own computers: How Cursor built cloud agents
- Nút thắt đã chuyển từ trí thông minh của model sang việc con người cấp công cụ, ngữ cảnh và mục tiêu tham vọng; cách Cursor đóng khung vấn đề là "thả tự do agent một cách an toàn" để xử lý nhiệm vụ lớn hơn.
- Họ mô phỏng quy trình onboarding của con người cho agent: một
onboarding agentkhám phá codebase không phải để sửa mà để hiểu cách chạy nó, xử lý biến môi trường và quyền một cách tương tác với lập trình viên. - Công cụ CLI "any dev" giúp cloud agent khởi động dịch vụ, chờ và kiểm tra trạng thái, tạo tài khoản test — tạo vòng phản hồi tích cực: môi trường dev tốt hơn dẫn đến dùng agent nhiều hơn.
- Nguyên tắc tự chủ: cho agent "đôi mắt" (mọi thứ bạn thấy thì agent phải thấy, kể cả chat của agent khác để debug), cho công cụ chạy app/dịch vụ với ràng buộc bảo mật hợp lý, và giữ codebase chất lượng cao vì agent có tính
auto-regressive. Computer use(pixel thô vào, chuột và bàn phím ra) là lĩnh vực then chốt tiếp theo sau coding; phần khó không phải click chính xác mà là khả năng siêu nhận thức và quay lui, vì GUI giống một trò chơi điện tử có "cửa một chiều" và trạng thái "game over".Claude 4.7là model computer use của Cursor; agent ghi lại video demo end-to-end của tính năng nó xây, cho lập trình viên một cách review băng thông cao trước khi đọc code — cực kỳ giá trị khi chạy nhiều agent cùng lúc.- "Security through freedom" (an toàn nhờ tự do): chạy agent trên cloud giải phóng lập trình viên khỏi quản lý tài nguyên, chuyển ngữ cảnh, và lo agent động vào biến môi trường — đồng thời khiến việc lập trình thú vị hơn bất ngờ.
- Skill quan trọng nhất của Cursor là "Work on the Factory" (WCF): mọi cloud agent báo cáo bất cứ điều gì khó chịu, hỏng hoặc gây bối rối; báo cáo dồn vào một
system of record, được phân loại thành lỗi kỹ thuật/quyền/thiếu hiểu biết, rồi được agent và con người sửa với mức can thiệp của con người giảm dần.
cloud agent— agent coding chạy trên cloud với máy tính riêngonboarding agent— agent Claude khám phá codebase để học cách chạy nócomputer use— khả năng nhận pixel thô và xuất thao tác chuột/bàn phímauto-regressive— tính chất chất lượng đầu ra phụ thuộc chất lượng đầu vàosecurity through freedom— an toàn nhờ tự doWork on the Factory(WCF) — skill cốt lõi yêu cầu agent báo cáo vấn đềsystem of record— kho lưu các vấn đề agent báo cáoagent experience— trải nghiệm của agent (đối ứng với developer experience)
Nút thắt mới và ba giai đoạn
Model ngày càng giỏi, và với ngày càng nhiều công việc, nút thắt không còn là trí thông minh của model mà là việc con người cấp công cụ, ngữ cảnh và những nhiệm vụ/mục tiêu tham vọng để model phát huy tiềm năng. Cursor xem nhiệm vụ của mình là "thả tự do" agent một cách an toàn.
Họ trải qua ba giai đoạn:
- Cấp cho agent công cụ và ngữ cảnh để tự chủ hơn.
- Học cách tận dụng các model mạnh hơn — cập nhật lại các pattern và hành vi, và quan sát nơi agent gặp khó.
- "Xây hệ thống tự xây hệ thống": thay vì cả ngày dắt tay agent từ task A đến D, hãy dành thời gian xây hệ thống giải được từ A đến Z.
Onboarding agent như onboarding con người
Cursor mô phỏng quy trình onboarding nhân viên mới: cấp máy tính, thiết lập môi trường dev, và rất nhiều tài liệu. Trước đó, "onboarding" cho model chỉ là ném nó vào codebase với hàng nghìn dòng code lướt qua — kỳ diệu là nó vẫn hoạt động khá tốt.
Vì vậy họ xây một onboarding agent bằng Claude (tại cursor.com/onboard): agent khám phá codebase không phải để sửa mà để hiểu cách chạy nó, xử lý các biến môi trường, quyền cần thiết, rồi quay lại với một bản demo — một quá trình tương tác với lập trình viên để đảm bảo dịch vụ chạy đúng.
Sau onboarding, vì mỗi lập trình viên chạy nhiều agent mỗi ngày, mọi vấn đề bị nhân lên. Mỗi lần chạy, agent phải khởi động môi trường dev từ đầu. Họ xây công cụ CLI "any dev" để khởi động dịch vụ, chờ và kiểm tra trạng thái, tạo tài khoản test — tạo vòng phản hồi tích cực: môi trường dev tốt hơn dẫn đến dùng agent nhiều hơn.
Các nguyên tắc tự chủ và Computer Use
- Cho agent "đôi mắt": mọi thứ bạn thấy thì agent phải thấy được; nếu bạn đổi trạng thái trong app, agent phải thấy thay đổi đó; thậm chí xem được chat của agent khác để debug.
- Cho agent công cụ: để làm được mọi việc bạn làm, với ràng buộc bảo mật hợp lý.
- Giữ codebase chất lượng cao: agent là
auto-regressive— đầu vào tốt thì đầu ra tốt.
Computer use là primitive nền tảng cho sự tự chủ: pixel thô vào, chuột/bàn phím ra. Phần khó không phải click đúng chỗ — nếu coding như cờ vua thấy hết quân trên bàn, thì điều hướng GUI giống trò chơi điện tử chỉ thấy một lát cắt, có "cửa một chiều" và trạng thái "game over", đòi hỏi siêu nhận thức và khả năng quay lui mà dòng Claude rất giỏi. Claude 4.7 là model computer use của họ. Agent còn ghi video demo end-to-end của tính năng nó xây, cho lập trình viên cách review băng thông cao trước khi đọc code — rất giá trị khi chạy nhiều agent song song.
Giao việc lớn hơn và "Security through freedom"
Có hai chế độ giao việc: (1) thay vì ghi bug/issue vào sổ tay, hãy ném thẳng vào ô prompt và kích hoạt; (2) các dự án lớn hơn nhiều, giao cho cloud agent những đơn vị công việc lớn để nó chạy lâu hơn.
Một bất ngờ lớn là yếu tố bảo mật mà cloud mang lại. Ý tưởng "security through freedom" nghe như tuyên truyền kiểu Orwell, nhưng khi thả agent tự do trên cloud, chính lập trình viên cũng được giải phóng: bớt lo quản lý tài nguyên, chuyển ngữ cảnh, và lo agent động vào biến môi trường. Bất ngờ hơn, việc lập trình trở nên thú vị hơn nhiều.
Khi agent thất bại, rất đáng để dừng lại tìm hiểu nguyên nhân và sửa, vì bản sửa sẽ được nhân ra toàn đội/công ty. Failure mode nếu tồn dai dẳng sẽ làm thất bại cộng dồn và khiến mọi người ngại dùng agent; ngược lại, đầu tư cải thiện agent thì ai cũng muốn dùng nhiều hơn và xây dựng được niềm tin.
Vòng lặp tự cải tiến: Work on the Factory
Khi dạy agent làm việc tốt hơn, mọi thứ lại "giống như coding". Cách quan trọng nhất là để agent tự lặp lại cải tiến quy trình của chính nó — họ gọi đây là agent experience, cần được chăm sóc ngang hoặc hơn developer experience.
Agent được yêu cầu báo cáo vấn đề khi gặp; báo cáo dồn vào một system of record. Quản lý review, phân loại, dedupe thành: lỗi kỹ thuật, vấn đề quyền (agent chưa có truy cập), và vấn đề thiếu hiểu biết (agent chưa biết cách giải, cần con người chỉ). Sau đó cả agent lẫn con người cùng sửa, với mục tiêu giảm dần sự can thiệp của con người.
Skill quan trọng nhất là "Work on the Factory" (WCF): mọi cloud agent đều có skill này — khi thấy điều gì khó chịu, hỏng hoặc gây bối rối thì dành chút thời gian báo cáo để cải thiện công cụ và quy trình, thay vì cắm cúi vượt qua. Model trước đây làm việc này kém, nhưng nay chúng biết "khó chịu", phát hiện cái hỏng và báo cáo.
Để giải quyết vấn đề một cách đáng tin (nhiều vấn đề có tính "flake" — chỉ thỉnh thoảng xảy ra), agent giải quyết sẽ kích hoạt thêm nhiều cloud agent với thay đổi đó để kiểm chứng qua một tập eval, nhờ vậy PR quay lại review của con người có độ tin cậy cao. Diễn giả ví các skill này như tiến trình "garbage collection"/dọn dẹp nền của hệ điều hành, và tin rằng các pattern này sẽ khái quát hóa tốt ra ngoài lĩnh vực coding.
TL;DR
- Một diễn giả từ Cursor giải thích: với model giỏi như hiện nay, nút thắt không còn là trí thông minh của model mà là việc con người cấp công cụ, ngữ cảnh và những nhiệm vụ đủ tham vọng — nên nhiệm vụ của Cursor là "thả tự do" cho agent một cách an toàn.
- Cursor trải qua ba giai đoạn: cấp công cụ và ngữ cảnh để agent tự chủ, học cách tận dụng model mạnh hơn, và cuối cùng là "xây hệ thống tự xây hệ thống".
- Họ tạo một
onboarding agentchạy bằng Claude (cursor.com/onboard), một CLI dev, vàcomputer useđể agent thấy và chạy ứng dụng; đúc kết các nguyên tắc tự chủ và tạo vòng lặp tự cải tiến nơi agent tự báo cáo và sửa lỗi trải nghiệm phát triển.
Điểm chính
- Nút thắt đã chuyển từ trí thông minh của model sang việc con người cấp công cụ, ngữ cảnh và mục tiêu tham vọng; cách Cursor đóng khung vấn đề là "thả tự do agent một cách an toàn" để xử lý nhiệm vụ lớn hơn.
- Họ mô phỏng quy trình onboarding của con người cho agent: một
onboarding agentkhám phá codebase không phải để sửa mà để hiểu cách chạy nó, xử lý biến môi trường và quyền một cách tương tác với lập trình viên. - Công cụ CLI "any dev" giúp cloud agent khởi động dịch vụ, chờ và kiểm tra trạng thái, tạo tài khoản test — tạo vòng phản hồi tích cực: môi trường dev tốt hơn dẫn đến dùng agent nhiều hơn.
- Nguyên tắc tự chủ: cho agent "đôi mắt" (mọi thứ bạn thấy thì agent phải thấy, kể cả chat của agent khác để debug), cho công cụ chạy app/dịch vụ với ràng buộc bảo mật hợp lý, và giữ codebase chất lượng cao vì agent có tính
auto-regressive. Computer use(pixel thô vào, chuột và bàn phím ra) là lĩnh vực then chốt tiếp theo sau coding; phần khó không phải click chính xác mà là khả năng siêu nhận thức và quay lui, vì GUI giống một trò chơi điện tử có "cửa một chiều" và trạng thái "game over".Claude 4.7là model computer use của Cursor; agent ghi lại video demo end-to-end của tính năng nó xây, cho lập trình viên một cách review băng thông cao trước khi đọc code — cực kỳ giá trị khi chạy nhiều agent cùng lúc.- "Security through freedom" (an toàn nhờ tự do): chạy agent trên cloud giải phóng lập trình viên khỏi quản lý tài nguyên, chuyển ngữ cảnh, và lo agent động vào biến môi trường — đồng thời khiến việc lập trình thú vị hơn bất ngờ.
- Skill quan trọng nhất của Cursor là "Work on the Factory" (WCF): mọi cloud agent báo cáo bất cứ điều gì khó chịu, hỏng hoặc gây bối rối; báo cáo dồn vào một
system of record, được phân loại thành lỗi kỹ thuật/quyền/thiếu hiểu biết, rồi được agent và con người sửa với mức can thiệp của con người giảm dần.
Từ vựng
cloud agent— agent coding chạy trên cloud với máy tính riêngonboarding agent— agent Claude khám phá codebase để học cách chạy nócomputer use— khả năng nhận pixel thô và xuất thao tác chuột/bàn phímauto-regressive— tính chất chất lượng đầu ra phụ thuộc chất lượng đầu vàosecurity through freedom— an toàn nhờ tự doWork on the Factory(WCF) — skill cốt lõi yêu cầu agent báo cáo vấn đềsystem of record— kho lưu các vấn đề agent báo cáoagent experience— trải nghiệm của agent (đối ứng với developer experience)
Nội dung chi tiết
Nút thắt mới và ba giai đoạn
Model ngày càng giỏi, và với ngày càng nhiều công việc, nút thắt không còn là trí thông minh của model mà là việc con người cấp công cụ, ngữ cảnh và những nhiệm vụ/mục tiêu tham vọng để model phát huy tiềm năng. Cursor xem nhiệm vụ của mình là "thả tự do" agent một cách an toàn.
Họ trải qua ba giai đoạn:
- Cấp cho agent công cụ và ngữ cảnh để tự chủ hơn.
- Học cách tận dụng các model mạnh hơn — cập nhật lại các pattern và hành vi, và quan sát nơi agent gặp khó.
- "Xây hệ thống tự xây hệ thống": thay vì cả ngày dắt tay agent từ task A đến D, hãy dành thời gian xây hệ thống giải được từ A đến Z.
Onboarding agent như onboarding con người
Cursor mô phỏng quy trình onboarding nhân viên mới: cấp máy tính, thiết lập môi trường dev, và rất nhiều tài liệu. Trước đó, "onboarding" cho model chỉ là ném nó vào codebase với hàng nghìn dòng code lướt qua — kỳ diệu là nó vẫn hoạt động khá tốt.
Vì vậy họ xây một onboarding agent bằng Claude (tại cursor.com/onboard): agent khám phá codebase không phải để sửa mà để hiểu cách chạy nó, xử lý các biến môi trường, quyền cần thiết, rồi quay lại với một bản demo — một quá trình tương tác với lập trình viên để đảm bảo dịch vụ chạy đúng.
Sau onboarding, vì mỗi lập trình viên chạy nhiều agent mỗi ngày, mọi vấn đề bị nhân lên. Mỗi lần chạy, agent phải khởi động môi trường dev từ đầu. Họ xây công cụ CLI "any dev" để khởi động dịch vụ, chờ và kiểm tra trạng thái, tạo tài khoản test — tạo vòng phản hồi tích cực: môi trường dev tốt hơn dẫn đến dùng agent nhiều hơn.
Các nguyên tắc tự chủ và Computer Use
- Cho agent "đôi mắt": mọi thứ bạn thấy thì agent phải thấy được; nếu bạn đổi trạng thái trong app, agent phải thấy thay đổi đó; thậm chí xem được chat của agent khác để debug.
- Cho agent công cụ: để làm được mọi việc bạn làm, với ràng buộc bảo mật hợp lý.
- Giữ codebase chất lượng cao: agent là
auto-regressive— đầu vào tốt thì đầu ra tốt.
Computer use là primitive nền tảng cho sự tự chủ: pixel thô vào, chuột/bàn phím ra. Phần khó không phải click đúng chỗ — nếu coding như cờ vua thấy hết quân trên bàn, thì điều hướng GUI giống trò chơi điện tử chỉ thấy một lát cắt, có "cửa một chiều" và trạng thái "game over", đòi hỏi siêu nhận thức và khả năng quay lui mà dòng Claude rất giỏi. Claude 4.7 là model computer use của họ. Agent còn ghi video demo end-to-end của tính năng nó xây, cho lập trình viên cách review băng thông cao trước khi đọc code — rất giá trị khi chạy nhiều agent song song.
Giao việc lớn hơn và "Security through freedom"
Có hai chế độ giao việc: (1) thay vì ghi bug/issue vào sổ tay, hãy ném thẳng vào ô prompt và kích hoạt; (2) các dự án lớn hơn nhiều, giao cho cloud agent những đơn vị công việc lớn để nó chạy lâu hơn.
Một bất ngờ lớn là yếu tố bảo mật mà cloud mang lại. Ý tưởng "security through freedom" nghe như tuyên truyền kiểu Orwell, nhưng khi thả agent tự do trên cloud, chính lập trình viên cũng được giải phóng: bớt lo quản lý tài nguyên, chuyển ngữ cảnh, và lo agent động vào biến môi trường. Bất ngờ hơn, việc lập trình trở nên thú vị hơn nhiều.
Khi agent thất bại, rất đáng để dừng lại tìm hiểu nguyên nhân và sửa, vì bản sửa sẽ được nhân ra toàn đội/công ty. Failure mode nếu tồn dai dẳng sẽ làm thất bại cộng dồn và khiến mọi người ngại dùng agent; ngược lại, đầu tư cải thiện agent thì ai cũng muốn dùng nhiều hơn và xây dựng được niềm tin.
Vòng lặp tự cải tiến: Work on the Factory
Khi dạy agent làm việc tốt hơn, mọi thứ lại "giống như coding". Cách quan trọng nhất là để agent tự lặp lại cải tiến quy trình của chính nó — họ gọi đây là agent experience, cần được chăm sóc ngang hoặc hơn developer experience.
Agent được yêu cầu báo cáo vấn đề khi gặp; báo cáo dồn vào một system of record. Quản lý review, phân loại, dedupe thành: lỗi kỹ thuật, vấn đề quyền (agent chưa có truy cập), và vấn đề thiếu hiểu biết (agent chưa biết cách giải, cần con người chỉ). Sau đó cả agent lẫn con người cùng sửa, với mục tiêu giảm dần sự can thiệp của con người.
Skill quan trọng nhất là "Work on the Factory" (WCF): mọi cloud agent đều có skill này — khi thấy điều gì khó chịu, hỏng hoặc gây bối rối thì dành chút thời gian báo cáo để cải thiện công cụ và quy trình, thay vì cắm cúi vượt qua. Model trước đây làm việc này kém, nhưng nay chúng biết "khó chịu", phát hiện cái hỏng và báo cáo.
Để giải quyết vấn đề một cách đáng tin (nhiều vấn đề có tính "flake" — chỉ thỉnh thoảng xảy ra), agent giải quyết sẽ kích hoạt thêm nhiều cloud agent với thay đổi đó để kiểm chứng qua một tập eval, nhờ vậy PR quay lại review của con người có độ tin cậy cao. Diễn giả ví các skill này như tiến trình "garbage collection"/dọn dẹp nền của hệ điều hành, và tin rằng các pattern này sẽ khái quát hóa tốt ra ngoài lĩnh vực coding.