Audio ke Teks — Gratis, Privat, di Browsermu
Jatuhkan file di sini — tempel, seret, atau klik untuk menelusuri
.mp3,.m4a,.aac,.wav,.ogg,.opus,.flac
Diproses di perangkatmu — tidak ada yang diunggah. Verifikasi di tab jaringan.
Alat ini mengubah audio ucapan jadi teks tanpa mengirim rekamanmu ke mana pun. Saat kamu menjatuhkan sebuah file, model pengenalan suara — sekeluarga dengan Whisper milik OpenAI — diunduh ke browsermu satu kali lalu mengerjakan semuanya di mesinmu sendiri. Tidak ada yang diunggah, tidak ada akun, dan kamu bisa menyaksikannya: buka tab network browsermu dan kamu akan melihat audionya tak pernah keluar dari halaman.
Desain di browser itulah intinya. Kebanyakan situs transkripsi gratis mengalirkan audiomu ke server, yang berarti infrastruktur orang asing menyimpan salinan apa pun yang kamu rekam — sebuah wawancara, sesi terapi, panggilan rahasia. Di sini audio tetap di perangkatmu dari awal sampai akhir, jadi klaim privasi bukan janji yang harus kamu percayai, melainkan cara perangkat lunaknya dibangun.
Kamu mendapat fitur transkripsi sungguhan, bukan demo yang dipangkas: deteksi bahasa otomatis di sekitar 100 bahasa, timestamp tingkat kata, dan ekspor ke teks polos, SRT, atau VTT. Ia menangani format umum — MP3, M4A, WAV, dan lainnya — serta bekerja pada trek audio di dalam file video juga.
Cara kerjanya
- 01
Jatuhkan file audiomu
Seret file MP3, M4A, WAV, atau audio lain ke halaman, atau klik untuk menelusurinya. File dibaca langsung oleh browsermu dan tak pernah diunggah ke server — kamu bisa membuktikannya di tab network.
- 02
Pilih model dan mulai
Pilih tier cepat-versus-akurat (model cepat ~40MB atau yang lebih besar dan lebih akurat). Model diunduh satu kali, tersimpan di cache untuk lain kali, dan mentranskrip di perangkatmu. Bahasa terdeteksi otomatis, atau kamu bisa menyetelnya.
- 03
Tinjau timestamp dan ekspor
Baca transkrip beserta timestamp-nya, lakukan penyuntingan apa pun, lalu unduh sebagai TXT untuk naskah bersih atau SRT/VTT untuk subtitle. Semuanya tetap lokal, jadi tidak ada yang disimpan atau dikirim saat kamu menyimpan.
Cara kerja transkripsi di browser
Saat kamu memuat halaman ini, belum ada model yang diunduh — halaman tetap ringan. Begitu kamu memilih file dan memulai, alat ini mengambil model pengenalan suara dan menjalankannya di dalam sebuah worker latar di browsermu, memakai GPU perangkatmu lewat WebGPU bila tersedia dan beralih ke jalur CPU (WASM) pada browser yang membutuhkannya, seperti Safari.
Audio didekode jadi sampel mentah, dipecah menjadi potongan yang mudah dikelola untuk rekaman panjang, lalu dilewatkan ke model untuk menghasilkan teks dengan waktu. Semua komputasi itu terjadi pada perangkat kerasmu. Percobaan pertama sebuah model mencakup unduhan satu kali; sesudah itu model tersimpan di cache, jadi transkripsi ulang mulai nyaris seketika bahkan offline.
Memilih model: kecepatan vs. akurasi
Ada trade-off nyata antara seberapa cepat transkrip kembali dan seberapa akurat ia, jadi alat ini menawarkan tier alih-alih menebak untukmu:
- Cepat (~40MB): terunduh dalam hitungan detik, berjalan baik di ponsel dan laptop sederhana, dan cukup untuk ucapan jernih serta draf cepat.
- Seimbang: unduhan lebih besar dengan penanganan aksen, suara bersahutan, dan derau latar yang jelas lebih baik — default yang bagus untuk wawancara dan rapat.
- Kualitas (~530MB, opt-in): tier paling akurat, sepadan dengan unduhan satu kali yang lebih besar saat kualitas transkrip lebih penting ketimbang kecepatan. Ini opt-in justru karena setengah gigabyte bukan sesuatu yang diunduh diam-diam.
Karena semuanya berjalan secara lokal, mesin yang lebih cepat sekadar selesai lebih awal — tidak ada antrean dan tidak ada batas per menit.
Bahasa, timestamp, dan ekspor subtitle
Model ini mendukung sekitar 100 bahasa dan mendeteksi bahasa ucapan secara otomatis, jadi kamu bisa menjatuhkan audio dalam bahasa Prancis, Hindi, Spanyol, atau Arab tanpa mengubah pengaturan. Kalau deteksi sesekali salah tebak pada klip pendek atau berderau, kamu bisa menyetel bahasanya secara manual.
Setiap transkrip disertai timestamp, dan itulah yang membuat ekspor subtitle berguna. Simpan sebagai SRT atau VTT dan kamu mendapat cue takarir dengan waktu yang pas, siap untuk editor video, YouTube, atau pemutar. Simpan sebagai TXT saat kamu cuma mau kata-katanya — transkrip wawancara, notulen rapat, atau salinan kuliah yang bisa dicari. Format subtitle dan teks polos semuanya berasal dari hasil bertimestamp yang sama, jadi kamu bisa mengekspor lebih dari satu tanpa menjalankan ulang apa pun.
Untuk apa alat ini bagus
Ia dibuat untuk pekerjaan sehari-hari yang benar-benar perlu dituntaskan orang: mengubah wawancara dan podcast jadi teks yang bisa dicari, menyusun notulen rapat dari rekaman, memberi takarir pada video, mentranskrip voice note, atau membuat arsip audio lama bisa dibaca dan dikutip.
Ia bukan alat dikte langsung — kamu mentranskrip file yang sudah kamu miliki, bukan mikrofon secara real time. Dan karena model berjalan di perangkatmu, rekaman yang teramat panjang akan lebih lama pada mesin yang lebih lambat dan memakai lebih banyak memori. Untuk kebanyakan file itu bukan masalah; untuk audio berjam-jam, laptop menanganinya lebih nyaman ketimbang ponsel.
Pertanyaan yang sering diajukan
Apakah konverter audio ke teks ini benar-benar gratis?
Apakah audio saya diunggah ke server?
Format audio apa saja yang bisa saya transkrip?
Seberapa akurat transkripsinya?
Bahasa apa saja yang didukung?
Bisakah saya mendapat timestamp atau subtitle?
Apakah bekerja offline?
Adakah batas panjang file?
Alat terkait
MP3 ke Teks
Konversi rekaman MP3 menjadi teks akurat dengan timestamp — diproses secara lokal di browsermu.
buka alat →M4A ke Teks
Transkripsikan rekaman M4A di perangkat. Menangani kontainer AAC Apple tanpa unggahan apa pun.
buka alat →WAV ke Teks
Ubah audio WAV menjadi teks bersih dengan timestamp, sepenuhnya di browsermu.
buka alat →Voice Memo ke Teks
Transkripsikan Voice Memo iPhone menjadi teks tanpa mengunggah apa pun. Sempurna untuk rapat dan catatan.
buka alat →