Meta resmi memperkenalkan SAM Audio, model multimodal pertama yang dirancang khusus untuk memisahkan suara (audio separation) dari campuran audio yang kompleks. Peluncuran ini memperluas keluarga model Segment Anything (SAM) ke ranah pemrosesan audio, setelah sebelumnya dikenal di segmen computer vision.
SAM Audio bekerja dengan menerima perintah dalam tiga moda: teks, isyarat visual, maupun penanda segmen waktu tertentu pada audio. Pengguna dapat mengetikkan deskripsi suara yang ingin diisolasi—misalnya “suara gitar” atau “ucapan pembicara”—serta menandai bagian tertentu pada spektogram atau timeline audio. Model kemudian menghasilkan trek terpisah berisi suara target tanpa komponen lain dari campuran aslinya.
Pendekatan multimodal ini membedakan SAM Audio dari metode pemisahan audio konvensional yang umumnya hanya mengandalkan satu jenis perintah. Meta memposisikan SAM Audio sebagai alat bagi kreator konten, editor audio, dan peneliti yang membutuhkan isolasi suara cepat dari rekaman lapangan, podcast, atau arsip multimedia. Detail ketersediaan, termasuk akses API dan bobot model untuk riset, diumumkan melalui kanal resmi Meta AI.