3 Aplikasi AI Terbaru Hadir dengan Kemampuan Multimodal, Saat Teks, Gambar, Audio, dan Video Menyatu dalam Satu Platform

Ilustrasi aplikasi ai
Sumber :
  • Pexels/Solen Feyissa

VoxPop – Perkembangan kecerdasan buatan (Artificial Intelligence/AI) memasuki babak baru. Jika sebelumnya chatbot hanya mampu memahami dan menghasilkan teks, kini aplikasi AI generasi terbaru telah berkembang menjadi multimodal AI, yaitu sistem yang mampu memproses berbagai jenis data seperti teks, gambar, audio, hingga video dalam satu platform.

img_title AI Mulai Masuk Pasar Mobil Bekas, Apa Untungnya Buat Konsumen?

Kemampuan tersebut membuka peluang baru bagi pengguna, mulai dari membuat presentasi, menganalisis dokumen, memahami isi video, mengedit gambar, hingga berinteraksi menggunakan suara secara lebih alami. Sejumlah perusahaan teknologi besar pun berlomba menghadirkan AI multimodal sebagai pusat produktivitas digital masa depan.

Berikut VoxPop telah merangkum Minggu, 2 Agustus 2026, ada tiga aplikasi AI yang menjadi sorotan karena menghadirkan kemampuan multimodal paling lengkap.

img_title Xpeng Pamer Teknologi AI Lewat X9 dan G6 Pro AWD

1. ChatGPT

OpenAI terus mengembangkan ChatGPT menjadi asisten AI serbaguna yang mampu memahami berbagai format informasi dalam satu percakapan.

img_title 10 Keunggulan Aplikasi AI dalam Dunia Kerja, Dari Menyusun Strategi hingga Membantu Pengambilan Keputusan Lebih Cepat

Melalui model GPT terbaru, pengguna tidak hanya dapat mengetik pertanyaan, tetapi juga mengunggah gambar, menganalisis dokumen PDF, berinteraksi menggunakan suara, hingga bekerja dengan berbagai jenis konten visual. Kemampuan multimodal tersebut membuat ChatGPT banyak dimanfaatkan untuk kebutuhan belajar, pekerjaan, riset, hingga pembuatan konten kreatif.

OpenAI juga terus memperluas integrasi AI ke berbagai layanan produktivitas. Salah satunya adalah penggunaan model GPT terbaru di Microsoft 365 Copilot, sehingga pengguna dapat memanfaatkan kemampuan AI dalam Word, Excel, PowerPoint, dan aplikasi kerja lainnya.

Keunggulan

  • Memahami teks, gambar, dokumen, dan suara.
  • Mampu membantu analisis, penulisan, hingga pemrograman.
  • Terintegrasi dengan berbagai aplikasi produktivitas.

2. Google Gemini

Google Gemini merupakan salah satu AI multimodal yang dikembangkan oleh Google DeepMind.

Sejak awal pengembangannya, Gemini dirancang untuk memahami berbagai jenis informasi secara bersamaan, termasuk teks, gambar, audio, video, hingga kode pemrograman. Pendekatan multimodal ini memungkinkan AI melakukan penalaran berdasarkan kombinasi berbagai sumber informasi, bukan hanya teks semata.

Google juga mengintegrasikan Gemini ke dalam berbagai layanan seperti Gmail, Google Docs, Google Drive, dan Google Search sehingga pengguna dapat bekerja lebih efisien dalam satu ekosistem. Penelitian resmi Google DeepMind menyebut kemampuan lintas media menjadi salah satu fondasi utama keluarga model Gemini.

Halaman Selanjutnya
Halaman Selanjutnya
Jadikan Viva News & Insight sumber pilihan di Google
Lanjut