Skip to content

Audio ke Teks — Gratis, Privat, di Browsermu

Model

Jatuhkan file di sini — tempel, seret, atau klik untuk menelusuri

.mp3,.m4a,.aac,.wav,.ogg,.opus,.flac

Diproses di perangkatmu — tidak ada yang diunggah. Verifikasi di tab jaringan.

Alat ini mengubah audio ucapan jadi teks tanpa mengirim rekamanmu ke mana pun. Saat kamu menjatuhkan sebuah file, model pengenalan suara — sekeluarga dengan Whisper milik OpenAI — diunduh ke browsermu satu kali lalu mengerjakan semuanya di mesinmu sendiri. Tidak ada yang diunggah, tidak ada akun, dan kamu bisa menyaksikannya: buka tab network browsermu dan kamu akan melihat audionya tak pernah keluar dari halaman.

Desain di browser itulah intinya. Kebanyakan situs transkripsi gratis mengalirkan audiomu ke server, yang berarti infrastruktur orang asing menyimpan salinan apa pun yang kamu rekam — sebuah wawancara, sesi terapi, panggilan rahasia. Di sini audio tetap di perangkatmu dari awal sampai akhir, jadi klaim privasi bukan janji yang harus kamu percayai, melainkan cara perangkat lunaknya dibangun.

Kamu mendapat fitur transkripsi sungguhan, bukan demo yang dipangkas: deteksi bahasa otomatis di sekitar 100 bahasa, timestamp tingkat kata, dan ekspor ke teks polos, SRT, atau VTT. Ia menangani format umum — MP3, M4A, WAV, dan lainnya — serta bekerja pada trek audio di dalam file video juga.

Cara kerjanya

  1. 01

    Jatuhkan file audiomu

    Seret file MP3, M4A, WAV, atau audio lain ke halaman, atau klik untuk menelusurinya. File dibaca langsung oleh browsermu dan tak pernah diunggah ke server — kamu bisa membuktikannya di tab network.

  2. 02

    Pilih model dan mulai

    Pilih tier cepat-versus-akurat (model cepat ~40MB atau yang lebih besar dan lebih akurat). Model diunduh satu kali, tersimpan di cache untuk lain kali, dan mentranskrip di perangkatmu. Bahasa terdeteksi otomatis, atau kamu bisa menyetelnya.

  3. 03

    Tinjau timestamp dan ekspor

    Baca transkrip beserta timestamp-nya, lakukan penyuntingan apa pun, lalu unduh sebagai TXT untuk naskah bersih atau SRT/VTT untuk subtitle. Semuanya tetap lokal, jadi tidak ada yang disimpan atau dikirim saat kamu menyimpan.

Cara kerja transkripsi di browser

Saat kamu memuat halaman ini, belum ada model yang diunduh — halaman tetap ringan. Begitu kamu memilih file dan memulai, alat ini mengambil model pengenalan suara dan menjalankannya di dalam sebuah worker latar di browsermu, memakai GPU perangkatmu lewat WebGPU bila tersedia dan beralih ke jalur CPU (WASM) pada browser yang membutuhkannya, seperti Safari.

Audio didekode jadi sampel mentah, dipecah menjadi potongan yang mudah dikelola untuk rekaman panjang, lalu dilewatkan ke model untuk menghasilkan teks dengan waktu. Semua komputasi itu terjadi pada perangkat kerasmu. Percobaan pertama sebuah model mencakup unduhan satu kali; sesudah itu model tersimpan di cache, jadi transkripsi ulang mulai nyaris seketika bahkan offline.

Memilih model: kecepatan vs. akurasi

Ada trade-off nyata antara seberapa cepat transkrip kembali dan seberapa akurat ia, jadi alat ini menawarkan tier alih-alih menebak untukmu:

  • Cepat (~40MB): terunduh dalam hitungan detik, berjalan baik di ponsel dan laptop sederhana, dan cukup untuk ucapan jernih serta draf cepat.
  • Seimbang: unduhan lebih besar dengan penanganan aksen, suara bersahutan, dan derau latar yang jelas lebih baik — default yang bagus untuk wawancara dan rapat.
  • Kualitas (~530MB, opt-in): tier paling akurat, sepadan dengan unduhan satu kali yang lebih besar saat kualitas transkrip lebih penting ketimbang kecepatan. Ini opt-in justru karena setengah gigabyte bukan sesuatu yang diunduh diam-diam.

Karena semuanya berjalan secara lokal, mesin yang lebih cepat sekadar selesai lebih awal — tidak ada antrean dan tidak ada batas per menit.

Bahasa, timestamp, dan ekspor subtitle

Model ini mendukung sekitar 100 bahasa dan mendeteksi bahasa ucapan secara otomatis, jadi kamu bisa menjatuhkan audio dalam bahasa Prancis, Hindi, Spanyol, atau Arab tanpa mengubah pengaturan. Kalau deteksi sesekali salah tebak pada klip pendek atau berderau, kamu bisa menyetel bahasanya secara manual.

Setiap transkrip disertai timestamp, dan itulah yang membuat ekspor subtitle berguna. Simpan sebagai SRT atau VTT dan kamu mendapat cue takarir dengan waktu yang pas, siap untuk editor video, YouTube, atau pemutar. Simpan sebagai TXT saat kamu cuma mau kata-katanya — transkrip wawancara, notulen rapat, atau salinan kuliah yang bisa dicari. Format subtitle dan teks polos semuanya berasal dari hasil bertimestamp yang sama, jadi kamu bisa mengekspor lebih dari satu tanpa menjalankan ulang apa pun.

Untuk apa alat ini bagus

Ia dibuat untuk pekerjaan sehari-hari yang benar-benar perlu dituntaskan orang: mengubah wawancara dan podcast jadi teks yang bisa dicari, menyusun notulen rapat dari rekaman, memberi takarir pada video, mentranskrip voice note, atau membuat arsip audio lama bisa dibaca dan dikutip.

Ia bukan alat dikte langsung — kamu mentranskrip file yang sudah kamu miliki, bukan mikrofon secara real time. Dan karena model berjalan di perangkatmu, rekaman yang teramat panjang akan lebih lama pada mesin yang lebih lambat dan memakai lebih banyak memori. Untuk kebanyakan file itu bukan masalah; untuk audio berjam-jam, laptop menanganinya lebih nyaman ketimbang ponsel.

Pertanyaan yang sering diajukan

Apakah konverter audio ke teks ini benar-benar gratis?
Ya. Transkripsi di browser tak terbatas dan gratis, tanpa daftar dan tanpa watermark pada teksmu. Karena prosesnya berjalan di perangkatmu sendiri alih-alih server kami, tidak ada biaya per menit yang perlu kami bebankan kepadamu. Kamu bisa mentranskrip sebanyak apa pun file yang kamu mau, dan mengekspor ke TXT, SRT, atau VTT tanpa biaya.
Apakah audio saya diunggah ke server?
Tidak. Audiomu dibaca dan ditranskrip sepenuhnya di dalam browsermu, dan file-nya tak pernah keluar dari perangkatmu. Satu-satunya yang diunduh adalah model pengenalan suara itu sendiri, satu kali. Kamu bisa memverifikasi semua ini dengan membuka developer tools browsermu dan menyaksikan tab network saat mentranskrip — audionya memang tidak dikirim ke mana pun.
Format audio apa saja yang bisa saya transkrip?
Format umum termasuk MP3, M4A (AAC), WAV, dan lainnya didukung, dan alat ini juga bisa menarik trek audio dari file video. Format dan bitrate jarang berpengaruh pada pengenalan suara — voice memo terkompresi ditranskrip kira-kira sebaik file studio tanpa kompresi, karena ucapan berada di rentang frekuensi yang bertahan baik terhadap kompresi.
Seberapa akurat transkripsinya?
Akurasi bergantung pada tier model yang kamu pilih dan audionya sendiri. Ucapan jernih dengan satu pembicara ditranskrip sangat baik; aksen kental, suara bersahutan, dan derau latar lebih sulit. Model kualitas yang lebih besar dan opt-in menangani audio sulit jelas lebih baik ketimbang tier cepat. Untuk transkrip penting apa pun, rencanakan untuk membaca sekilas dan sedikit mengoreksi hasilnya.
Bahasa apa saja yang didukung?
Model ini mencakup kira-kira 100 bahasa dan mendeteksi bahasa ucapan secara otomatis, jadi kamu biasanya tak perlu menyetel apa pun. Ia mentranskrip dalam bahasa aslinya alih-alih menerjemahkan. Kalau deteksi otomatis salah baca pada klip pendek atau berderau, kamu bisa memilih bahasanya secara manual sebelum mulai untuk mengarahkannya dengan benar.
Bisakah saya mendapat timestamp atau subtitle?
Ya. Setiap transkrip menyertakan timestamp, dan kamu bisa mengekspor langsung ke file subtitle SRT atau VTT dengan cue berwaktu yang pas, atau ke TXT polos saat kamu cuma mau kata-katanya. Ketiganya berasal dari hasil bertimestamp yang sama, jadi kamu bisa menyimpan transkrip sekali sebagai teks dan lagi sebagai subtitle tanpa mentranskrip file untuk kedua kalinya.
Apakah bekerja offline?
Setelah percobaan pertama, sebagian besar ya. Model suara tersimpan di cache browsermu, jadi begitu terunduh kamu bisa mentranskrip nanti bahkan tanpa koneksi. Transkripsi paling pertama dengan sebuah model perlu online untuk mengambil model itu, tapi percobaan berikutnya memakai ulang salinan dari cache dan tidak mengunduhnya lagi.
Adakah batas panjang file?
Tidak ada batas tetap yang kami paksakan — rekaman panjang dipecah menjadi potongan dan diproses berurutan. Batas praktisnya adalah perangkatmu: audio yang sangat panjang atau beresolusi tinggi memakan lebih banyak waktu dan memori, jadi laptop menangani file berjam-jam lebih nyaman ketimbang ponsel. Untuk kebanyakan wawancara dan rapat, panjang durasi bukan persoalan.