Vừa qua, gã khổng lồ công nghệ Google đã chính thức phát hành bộ ba mô hình trí tuệ nhân tạo thế hệ mới thuộc dòng Flash bao gồm: Gemini 3.6 Flash, Gemini 3.5 Flash-Lite, và Gemini 3.5 Flash Cyber. Cả ba mô hình đều chia sẻ một mục tiêu cốt lõi: xử lý được nhiều công việc phức tạp hơn nhưng tiêu tốn ít token hơn, từ đó tối ưu hóa chi phí vận hành và tốc độ cho các hệ thống AI.
Trong đợt nâng cấp này, Gemini 3.6 Flash đóng vai trò là phiên bản chủ lực đa năng, Gemini 3.5 Flash-Lite tối ưu tuyệt đối về chi phí và tốc độ, còn Gemini 3.5 Flash Cyber là công cụ an ninh mạng chuyên biệt. Bài viết này Thành Nhân TNC sẽ cùng bạn phân tích chi tiết tính năng, thông số benchmark, tác dụng của AI trong thực tế cũng như định vị của từng mô hình trong hệ sinh thái Google.
Trong môi trường triển khai thực tế, các nhà phát triển và doanh nghiệp khi xây dựng các AI Agent luôn đòi hỏi hiệu quả sử dụng token cao hơn, độ trễ thấp hơn và độ tin cậy tuyệt đối. Dòng mô hình Flash của Google được thiết kế nhằm đạt đến tối ưu giữa chi phí vận hành và chất lượng xử lý.

Phát triển dựa trên nền tảng Gemini 3.5 Flash, Google mang đến những bước tiến vượt bậc:
Ngoài ra, Google cũng xác nhận phiên bản cao cấp Gemini 3.5 Pro hiện đang được thử nghiệm tích cực với các đối tác chiến lược và sẽ sớm ra mắt. Đồng thời, hãng đã khởi động quá trình huấn luyện trước tham vọng nhất từ trước đến nay cho thế hệ Gemini 4.
Mỗi phiên bản trong đợt ra mắt này được Google định vị ở một vị trí khác nhau trên biểu đồ cân bằng giữa chi phí và năng lực xử lý.
Gemini 3.6 Flash được Google gọi là mô hình chủ lực dành cho các hệ thống cần sự cân bằng giữa trí tuệ, tốc độ và chi phí. Mô hình được nâng cấp trực tiếp từ những phản hồi của cộng đồng lập trình viên đang vận hành Gemini 3.5 Flash, tập trung mạnh vào lập trình, công việc tri thức, xử lý đa phương thức và quy trình gọi công cụ nhiều bước. Hiện tại, Gemini 3.6 Flash đã ở trạng thái giới thiệu rộng rãi. Các nhà phát triển có thể truy cập ngay thông qua Gemini API trong Google AI Studio, Android Studio và Google Antigravity. Khách hàng doanh nghiệp có thể triển khai qua Gemini Enterprise Agent Platform và ứng dụng Gemini Enterprise. Người dùng phổ thông cũng có thể trải nghiệm trực tiếp ngay trên ứng dụng Gemini.

Về năng lực kỹ thuật, Gemini 3.6 Flash tiếp nhận đầu vào đa dạng bao gồm văn bản, hình ảnh, video, âm thanh và tài liệu PDF. Mô hình hỗ trợ cửa sổ ngữ cảnh lên tới 1 triệu token với giới hạn đầu ra là 64.000 token. Tính năng thao tác máy tính đã được tích hợp sẵn vào API và Gemini Enterprise, song song cùng tính năng gọi hàm , xuất dữ liệu có cấu trúc và tìm kiếm như một công cụ. Điểm ăn tiền nhất của Gemini 3.6 Flash là việc tiết kiệm token. Nhờ khả năng tư duy thông minh hơn, mô hình đưa ra câu trả lời ngắn gọn, súc tích hơn, đồng thời đi đến kết luận qua ít bước suy luận và ít lượt gọi công cụ hơn.
Không hướng tới vị trí mô hình thông minh nhất, Gemini 3.5 Flash-Lite đặt cược hoàn toàn vào tốc độ và chi phí. Đây là mô hình đạt tốc độ phản hồi cực nhanh với 350 token đầu ra/giây và mức giá siêu rẻ chỉ 0,30 USD cho mỗi triệu token đầu vào và 2,50 USD cho mỗi triệu token đầu ra.

Ứng dụng AI này cực kỳ phù hợp cho các luồng công việc khối lượng lớn như tìm kiếm agentic, phân loại dữ liệu, tóm tắt tài liệu hàng loạt hay các tác vụ chạy hàng nghìn lần mỗi ngày. Lập trình viên có thể linh hoạt điều chỉnh mức độ tư duy của mô hình. Bao gồm việc thiết lập ở mức tối thiểu để thực thi nhanh, rẻ cho khối lượng công việc khổng lồ, hoặc nâng cao hơn cho các sub-agent cần suy luận nhiều bước.
Gemini 3.5 Flash Cyber là phiên bản chuyên biệt được tinh chỉnh riêng cho lĩnh vực an ninh mạng. Mô hình này hoạt động bên trong hệ thống CodeMender của Google, nơi nhiều agent AI phối hợp cùng nhau để phân tích mã nguồn, phát hiện và vá các lỗ hổng bảo mật rồi xuất ra báo cáo tổng hợp.

Mặc dù có kích thước gọn nhẹ hơn các mô hình tiên phong lớn, Gemini 3.5 Flash Cyber cho thấy khả năng cạnh tranh đáng kinh ngạc trên CyberGym - bộ tiêu chuẩn đánh giá an ninh mạng uy tín. Nhằm đảm bảo an toàn, quyền truy cập mô hình này hiện bị giới hạn cho các cơ quan chính phủ và đối tác tin cậy thông qua chương trình thí điểm CodeMender, chưa có giá bán hay ngày phát hành rộng rãi.
Dưới đây là bảng tổng hợp kết quả thử nghiệm thực tế (benchmark) và chi phí sử dụng của Gemini 3.6 Flash so với các mô hình đối thủ trên thị trường:
| Benchmark | Gemini 3.6 Flash | Gemini 3.5 Flash | Gemini 3.1 Pro | GPT-5.6 Luna | Grok 4.5 | Claude Sonnet 5 |
| Giá input ($/1M) | 1,50 | 1,50 | 2,00 | 1,00 | 2,00 | 3,00 |
| Giá output ($/1M) | 7,50 | 9,00 | 12,00 | 6,00 | 6,00 | 15,00 |
| SWE-Bench Pro | 58,7% | 55,1% | 54,2% | 62,7% | 64,7% | 63,2% |
| DeepSWE v1.1 | 49% | 37% | 12% | 67% | 54% | 54% |
| Terminal-Bench 2.1 | 78,0% | 76,2% | 73,8% | 84,7% | 83,3% | 80,4% |
| MLE-Bench | 63,9% | 49,7% | 42,6% | 47,6% | 43,2% | 66,9% |
| OSWorld-Verified | 83,0% | 78,4% | 76,2% | 72,6% | - | 81,2% |
| GDPVal-AA v2 (Elo) | 1421 | 1349 | 965 | 1584 | 1535 | 1607 |
| CharXiv Reasoning (không công cụ) | 85,2% | 84,2% | 83,3% | 82,7% | 81,6% | 77,0% |
| GDM-MRCR v2, 128k | 91,8% | 77,3% | 84,9% | 74,8% | 81,4% | 71,6% |
Phân tích kết quả:
Hiện tại, hai mô hình Gemini 3.6 Flash và Gemini 3.5 Flash-Lite đã sẵn sàng thương mại hóa trên thị trường:
Bảng giá niêm yết:
Việc Google ra mắt Gemini 3.6 Flash, 3.5 Flash-Lite và 3.5 Flash Cyber là đại diện cho chiến lược tinh chỉnh toàn bộ tầng Flash để phục vụ cho kỷ nguyên tác nhân AI vận hành quy mô lớn. Thay vì cố gắng chiến thắng trên mọi bảng xếp hạng, Google tập trung giải quyết đúng bài toán thực tế của người dùng từ tốc độ phản hồi nhanh, khả năng xử lý ngữ cảnh dài vượt trội và chi phí tối ưu trên từng token. Đây chắc chắn sẽ là bệ phóng vững chắc giúp các nhà phát triển bứt phá trong việc ứng dụng trí tuệ nhân tạo vào thực tiễn.
>>> Xem thêm: