Google DeepMind resmi memperkenalkan kemampuan computer use pada model Gemini 3.5 Flash. Fitur ini memungkinkan model kecerdasan buatan mengoperasikan antarmuka komputer secara langsung melalui interaksi visual dengan elemen-elemen grafis pada layar.

Berbeda dari integrasi API atau plugin khusus, pendekatan computer use bekerja dengan cara model menerima tangkapan layar (screenshot) dari tampilan aplikasi, lalu menghasilkan perintah aksi seperti klik, ketik, atau gulir untuk menjalankan langkah-langkah pada alur kerja. Metode ini meniru pola interaksi pengguna manusia saat menggunakan perangkat lunak desktop maupun aplikasi berbasis web.

Kemampuan ini tersedia melalui API Gemini dalam mode pratinjau bagi para pengembang yang ingin membangun alur kerja otomatisasi. Google DeepMind juga merilis dokumentasi teknis serta panduan implementasi guna membantu integrasi fitur tersebut ke dalam berbagai skenario penggunaan.