Mỗi Agent được tối ưu – một giao dịch ít tốn kém hơn.
Context: Cuộc đua AI và sự im lặng của những con số
Giữa tháng 6 năm 2025, Google âm thầm phát hành Gemini 3.6 Flash. Không phải một sự kiện bùng nổ như ra mắt GPT-4o hay Claude 4. Đây là một bản cập nhật kỹ thuật, nhắm vào một nhóm người dùng rất cụ thể: các nhà phát triển Agent và kỹ sư đang xây dựng tự động hóa quy trình làm việc. Là một Zero-Knowledge Researcher và người đã audit hàng trăm hợp đồng thông minh, tôi luôn có thói quen nhìn vào các con số chi phí và hiệu suất thay vì những lời hứa hẹn. Và những con số của Gemini 3.6 Flash kể một câu chuyện thú vị.
Thị trường AI đầu năm 2025 đã bước vào giai đoạn 'thị trường gấu' của riêng nó: chi phí tính toán tăng cao, các quỹ đầu tư mạo hiểm trở nên thận trọng, và các startup AI đang tập trung vào việc sống sót hơn là đốt tiền. Trong bối cảnh đó, việc Google phát hành một mô hình 'tối ưu hóa cho Agent' không chỉ là một bản nâng cấp, mà là một tín hiệu: cuộc chơi không còn là về mô hình mạnh nhất, mà là về mô hình hiệu quả nhất.
Core: Phân tích mã nguồn của chi phí
Hãy cùng đi sâu vào các con số. Tôi sẽ không dùng lời lẽ hoa mỹ. Dựa trên kinh nghiệm audit các giao thức DeFi và xây dựng framework cho zkSync, tôi nhìn nhận mọi tuyên bố về hiệu năng như một smart contract cần được kiểm tra.
- Giảm 'token đầu ra': Google tuyên bố mô hình sử dụng token đầu ra ít hơn 17% so với Gemini 3.5 Flash. Điều này có nghĩa là gì? Trong thế giới DeFi, mỗi giao dịch là một chi phí gas. Trong thế giới AI, mỗi token là một chi phí tính toán. Khi tôi audit hợp đồng Uniswap V2, tôi đã phát hiện ra rằng việc tối ưu hóa một hàm
swap()có thể tiết kiệm 5-10% gas. Google đang làm điều tương tự, nhưng ở cấp độ cao hơn: họ đang cắt giảm các bước suy luận không cần thiết trong các tác vụ Agent. Cụ thể, việc giảm 'số bước suy luận' và 'vòng lặp thực thi' đồng nghĩa với việc mô hình ít 'vòng vo' hơn trong việc lập kế hoạch và gọi công cụ. Đây là một tối ưu hóa kỹ thuật thuần túy, không phải một sự thay đổi về kiến trúc cơ bản.
- Chi phí đầu ra giảm, đầu vào giữ nguyên: Giá token đầu ra giảm từ $9 xuống $7.5 mỗi triệu token. Token đầu vào vẫn giữ nguyên. Sự bất đối xứng này cho thấy điểm mấu chốt: Google đang tập trung vào các tác vụ 'suy nghĩ nhiều, gọi nhiều' (Agent, code generation), nơi token đầu ra chiếm ưu thế. Trong khi đó, các tác vụ 'đọc nhiều, trả lời ít' (chat thông thường) vẫn bị tính phí như cũ. Điều này giống hệt cách Aave và Compound thiết lập các mô hình lãi suất tùy tiện, không liên quan đến cung cầu thị trường thực. Ở đây, Google đang trợ giá cho các tác vụ Agent để chiếm thị phần, trong khi vẫn giữ tỷ suất lợi nhuận cao ở các tác vụ khác.
- Kết hợp chi phí và hiệu suất: Sự kết hợp giữa giảm 17% token sử dụng và giảm 16.7% giá đầu ra dẫn đến mức giảm chi phí tổng thể khoảng 31%. Con số này không phải là ‘thần kỳ’. Nó là kết quả của một quá trình kỹ thuật có chủ đích: sử dụng kỹ thuật chưng cất (distillation) từ một mô hình lớn hơn, áp dụng các cải tiến trong alignment (SFT/RLHF) để tạo ra các chuỗi suy luận ngắn hơn và hiệu quả hơn. Như tôi đã học được từ việc phát triển framework audit cho zkSync, một vấn đề có thể được giải quyết bằng nhiều cách, nhưng con đường tối ưu là con đường ít tốn kém nhất mà vẫn đảm bảo tính đúng đắn.
Contrarian: Lớp DA bị thổi phồng và sự thật về các Agent
Các nhà phân tích thường tung hô việc ra mắt Gemini 3.6 Flash như một 'bước tiến vượt bậc'. Tôi cho rằng điều này là sai lầm.

Từ góc nhìn của một người làm việc sâu với zk-SNARKs, tôi thấy so sánh này đang bỏ qua một điểm mù quan trọng: tính trung thực của benchmark. Các benchmark như DeepSWE và MLE Bench đều là các tác vụ Agent. Việc đạt được 49% trên DeepSWE (từ 37%) và 63.9% trên MLE Bench là ấn tượng, nhưng đây là điểm số trong môi trường có cấu trúc. Các benchmark này có các bước giải quyết vấn đề được xác định rõ ràng. Trong thế giới thực, các tác vụ Agent thường hỗn loạn hơn nhiều: API thay đổi, dữ liệu đầu vào không chính xác, các lỗi không lường trước.
Hãy nhìn vào Ordinals trên Bitcoin. Nếu không có làn sóng inscription, mô hình bảo mật của Bitcoin đã gặp rắc rối vì thiếu phí giao dịch. Các benchmark AI cũng vậy: chúng là 'narrative' và 'doanh thu phí' cho thị trường AI, nhưng chúng không phải là bản chất của vấn đề. Sự tăng trưởng này chủ yếu đến từ tối ưu hóa quá trình Agent, không phải từ một mô hình ngôn ngữ thông minh hơn đột nhiên có thể giải quyết các vấn đề phần mềm thực sự phức tạp.
Điểm mù thứ hai là vấn đề bảo mật. Với tư cách là một người đã phát hiện lỗi trong hợp đồng thông minh, tôi biết rằng việc đưa ra quyết định nhanh hơn (ít bước suy luận hơn) có thể dẫn đến bỏ qua các bước kiểm tra bảo mật quan trọng. Một Agent được tối ưu để thực thi nhanh có thể dễ bị tấn công hơn, giống như một giao thức DeFi được tối ưu hóa về gas có thể có lỗ hổng reentrancy. Google không đề cập đến bất kỳ thay đổi nào về bảo mật, và đó là một hồi chuông cảnh báo.

Takeaway: Dự báo về các lỗ hổng trong tương lai
Liệu Gemini 3.6 Flash có giải quyết được bài toán chi phí thực sự của các Agent doanh nghiệp không? Hay nó chỉ là một bản vá, giống như việc thêm một lớp DA chuyên dụng vào một rollup không bao giờ tạo đủ dữ liệu?
Tôi dự đoán rằng, trong 6 tháng tới, chúng ta sẽ chứng kiến sự gia tăng của các lỗ hổng bảo mật trong các hệ thống Agent sử dụng Gemini 3.6 Flash, không phải vì mô hình kém, mà vì các nhà phát triển quá tập trung vào việc tối ưu hóa chi phí mà quên mất các lớp bảo vệ cần thiết. Các cuộc tấn công 'injection' vào Agent sẽ trở nên tinh vi hơn, và việc khai thác các 'vòng lặp thực thi' được tối ưu hóa sẽ là vector tấn công mới.
Liệu Google có chuẩn bị cho một phiên bản 'Security-focused' của Gemini 3.6 Flash hay không? Đó là câu hỏi mà cộng đồng bảo mật, và đặc biệt là những ai đang xây dựng các giải pháp không cần tin tưởng (trustless), cần đặt ra ngay từ bây giờ.