Công nghệ 'Ghi kỹ năng' của AI Agent: Cuộc cách mạng tự động hóa cho người dùng Blockchain
Trong tuần qua, thị trường AI chứng kiến một động thái đáng chú ý: cả Claude Cowork (Anthropic) và OpenAI Codex đồng loạt ra mắt tính năng 'Ghi kỹ năng' (Record a Skill), cho phép người dùng ghi lại các thao tác trên máy tính để tạo ra một quy trình tự động có thể tái sử dụng. Đây không phải là một đột phá về kiến trúc mô hình, mà là một sự đổi mới kỹ thuật có tính kết hợp: tích hợp ghi màn hình, tương tác giao diện người dùng, nhận dạng giọng nói và khả năng tạo mã của LLM để biến hành vi demo thành workflow có thể tái sử dụng. Vậy điều này có ý nghĩa gì đối với cộng đồng blockchain, nơi mà tự động hóa và phi tập trung là những giá trị cốt lõi?
Bối cảnh: Từ DeFi đến DAO, người dùng blockchain thường xuyên phải thực hiện các thao tác lặp đi lặp lại như swap token, cung cấp thanh khoản, vote quản trị, hay kiểm tra dữ liệu on-chain. Việc tự động hóa các tác vụ này thường đòi hỏi kiến thức lập trình hoặc sử dụng bot phức tạp. Tính năng 'ghi kỹ năng' của AI Agent, khi áp dụng vào blockchain, có thể hạ thấp rào cản này một cách đáng kể. Người dùng chỉ cần thực hiện một lần các bước trên giao diện dApp, và AI sẽ ghi lại chuỗi hành động (click, nhập liệu, xác nhận giao dịch) để tạo thành một Skill. Lần sau, chỉ với một câu lệnh, AI có thể tự động thực hiện toàn bộ quy trình đó, từ việc kết nối ví Metamask, swap trên Uniswap, đến gửi token vào smart contract.
Phân tích kỹ thuật: Về bản chất, cơ chế này là một dạng 'bắt chước hành vi' (behavioral cloning) kết hợp với mô hình đa phương thức. AI không hiểu sâu về logic smart contract, mà học cách tương tác với giao diện đồ họa của dApp. Điều này mang lại lợi thế về tính linh hoạt: Skill có thể hoạt động trên bất kỳ dApp nào, miễn là giao diện không thay đổi quá nhiều. Tuy nhiên, cũng tiềm ẩn rủi ro lớn về bảo mật. Việc ghi lại màn hình và thao tác bàn phím có thể bao gồm cả private key, mật khẩu, hoặc thông tin nhạy cảm khác. Nếu dữ liệu này được gửi lên cloud của Anthropic hoặc OpenAI để xử lý, rủi ro lộ lọt là rất cao. Đối với người dùng blockchain, nơi mà 'not your keys, not your coins' là nguyên tắc vàng, việc tin tưởng giao toàn bộ quyền kiểm soát thao tác cho một bên thứ ba là một bước lùi về mặt triết lý phi tập trung.
Góc nhìn phản biện: Một số người cho rằng đây chỉ là một bản sao của các công cụ RPA (Robotic Process Automation) truyền thống, nhưng được AI thổi hồn. Dù vậy, điểm khác biệt nằm ở khả năng hiểu ngữ cảnh và tổng quát hóa của AI: Skill có thể thích ứng với các biến thể nhỏ của giao diện, nhờ vào khả năng hiểu ngữ nghĩa của mô hình. Tuy nhiên, tôi cho rằng thách thức lớn nhất là độ tin cậy. Trong môi trường blockchain, giao dịch không thể rollback. Nếu Skill thực hiện sai (ví dụ: click nhầm nút trong quá trình approve token), hậu quả có thể rất nghiêm trọng. Dựa trên kinh nghiệm audit smart contract của tôi, các hệ thống tự động hóa cần có cơ chế sandbox và xác nhận nhiều bước trước khi thực thi. Cả Claude và OpenAI hiện chưa công bố chi tiết về cơ chế này.
Kết luận: Công nghệ ghi kỹ năng mở ra một hướng đi mới cho tự động hóa trong Web3, nhưng không phải là 'viên đạn bạc'. Người dùng cần thận trọng với dữ liệu nhạy cảm, và các nhà phát triển nên cân nhắc tích hợp các giải pháp bảo mật như xử lý cục bộ (local processing) hoặc mã hóa đầu cuối. Cuộc đua giữa Claude và OpenAI sẽ thúc đẩy sự cải tiến, nhưng người chiến thắng thực sự có thể là cộng đồng, nếu biết tận dụng công nghệ một cách thông minh và an toàn. Câu hỏi đặt ra: Liệu chúng ta có sẵn sàng tin tưởng giao quyền điều khiển tài sản số cho một AI đám mây, hay sẽ xây dựng những Agent phi tập trung của riêng mình?