



Chuyển giọng nói thành văn bản từng là nhiệm vụ đòi hỏi máy chủ mạnh, kết nối internet ổn định và sự tin tưởng vào dịch vụ đám mây. Ngày nay, với Whisper chạy cục bộ, bất kỳ ai có máy tính cá nhân cũng có thể biến file âm thanh, podcast hay video thành văn bản chính xác mà không cần gửi dữ liệu đi đâu cả. Bài viết này hướng dẫn chi tiết cách cài đặt, vận hành và tối ưu OpenAI Whisper ngay trên máy của bạn.
Whisper là gì và vì sao nên chạy cục bộ
Whisper là mô hình nhận dạng giọng nói mã nguồn mở do OpenAI công bố, được huấn luyện trên bộ dữ liệu âm thanh đa ngôn ngữ khổng lồ. Theo repository chính thức trên GitHub, Whisper có khả năng nhận dạng giọng nói đa ngôn ngữ, dịch speech-to-text, phát hiện ngôn ngữ và phát hiện hoạt động giọng nói. Mô hình được xây dựng theo kiến trúc Transformer sequence-to-sequence, giúp xử lý nhiều tác vụ chỉ với một mô hình duy nhất.
Khi chạy Whisper cục bộ, toàn bộ quá trình xử lý âm thanh diễn ra trên phần cứng của bạn. Điều này mang lại ba lợi ích lớn. Thứ nhất, dữ liệu âm thanh không rời khỏi máy, phù hợp với cuộc họp nội bộ, phỏng vấn nhạy cảm hoặc tài liệu y tế. Thứ hai, bạn không phụ thuộc vào kết nối mạng hay giới hạn API trả phí. Thứ ba, chi phí vận hành gần như bằng không sau khi cài đặt, chỉ tốn điện năng của máy cá nhân.

Hình trên minh họa kiến trúc tổng quát của Whisper: bộ mã hóa xử lý đặc trưng âm thanh đầu vào, bộ giải mã sinh ra chuỗi văn bản tương ứng. Kiến trúc này cho phép mô hình hiểu ngữ cảnh dài và duy trì độ chính xác cao ngay cả với âm thanh nhiều tạp âm.
Cài đặt Whisper trên máy cá nhân
Whisper chạy được trên Linux, macOS và Windows thông qua Python. Trước tiên, hãy đảm bảo máy đã cài Python 3.8 đến 3.11 và công cụ ffmpeg để xử lý âm thanh. Trên Ubuntu hoặc Debian, cài ffmpeg bằng lệnh sudo apt update && sudo apt install ffmpeg. Người dùng macOS có thể dùng Homebrew với brew install ffmpeg.
Tiếp theo, cài đặt gói Whisper từ PyPI:
pip install -U openai-whisper
Trong một số trường hợp, nếu trình cài đặt không tìm thấy wheel phù hợp cho tiktoken, bạn có thể cần cài thêm Rust. Lỗi thường gặp là No module named 'setuptools_rust', khi đó chạy pip install setuptools-rust rồi thử lại.
Chọn model phù hợp với phần cứng
Whisper cung cấp sáu kích thước mô hình: tiny, base, small, medium, large và turbo. Model càng lớn thì độ chính xác càng cao nhưng càng tốn bộ nhớ VRAM và thời gian xử lý. Model tiny chỉ cần khoảng 1 GB VRAM, phù hợp máy yếu, trong khi large đòi hỏi khoảng 10 GB VRAM. Model turbo là phiên bản tối ưu của large-v3, cho tốc độ nhanh hơn với độ chính xác gần như không đổi.

Hình trên cho thấy dạng sóng, phổ tần spectrogram và phần chữ được phiên âm của một đoạn âm thanh — đây chính là cách Whisper “nhìn” giọng nói trước khi chuyển thành văn bản. Phổ tần giúp mô hình phân biệt âm vị, ngữ điệu và khoảng ngắt nghỉ.
Chạy chuyển đổi âm thanh thành văn bản
Sau khi cài đặt, việc chuyển đổi file âm thanh rất đơn giản. Mở terminal và chạy:
whisper audio.mp3 --model turbo --language Vietnamese --output_format txt srt
Lệnh trên xử lý file audio.mp3 bằng model turbo, ép buộc ngôn ngữ đầu ra là tiếng Việt và tạo cả file văn bản thuần (.txt) lẫn phụ đề (.srt). Nếu muốn dùng API trực tiếp trong Python, bạn có thể viết:
import whisper
model = whisper.load_model("turbo")
result = model.transcribe("audio.mp3", language="Vietnamese")
print(result["text"])
Whisper hỗ trợ nhiều định dạng đầu vào như MP3, WAV, FLAC, M4A và OGG nhờ ffmpeg. Bạn cũng có thể truyền tham số --task translate để dịch giọng nói không phải tiếng Anh sang tiếng Anh, hoặc --initial_prompt để gợi ý từ vựng chuyên ngành như tên người, địa danh hoặc thuật ngữ kỹ thuật.
Ưu điểm, hạn chế và mẹo tối ưu

Hình trên minh họa một setup thu âm cơ bản với micro, máy tính và phần mềm xử lý âm thanh — chất lượng file đầu vào ảnh hưởng trực tiếp đến độ chính xác của bản phiên âm.
Ưu điểm nổi bật nhất của Whisper là độ chính xác cao ngay cả với âm thanh có tạp âm, khả năng đa ngôn ngữ và hoàn toàn miễn phí. Tuy nhiên, model lớn cần GPU mạnh; trên CPU, thời gian xử lý có thể kéo dài gấp nhiều lần. Ngoài ra, Whisper đôi khi viết sai tên riêng hoặc thuật ngữ hiếm, nên vẫn cần người dùng rà soát lại bản dịch cuối cùng.
Để tăng tốc độ xử lý, hãy dùng model turbo thay cho large nếu bạn chỉ cần phiên âm tiếng Anh hoặc tiếng Việt thông thường. Cắt file âm thanh dài thành các đoạn ngắn hơn cũng giúp giảm bộ nhớ đệm. Nếu máy có GPU NVIDIA, cài thêm CUDA để tận dụng tăng tốc phần cứng. Cuối cùng, dùng tham số --beam_size 5 để cân bằng giữa độ chính xác và tốc độ.
Kết luận
Whisper chạy cục bộ mang công cụ chuyển giọng nói thành văn bản mạnh mẽ đến tận máy tính cá nhân, với ưu thế về quyền riêng tư, chi phí và khả năng tùy biến. Chỉ với vài lệnh cài đặt, bạn đã có thể phiên âm podcast, tạo phụ đề video hay số hóa ghi chú cuộc họp mà không phụ thuộc vào dịch vụ đám mây. Hãy bắt đầu với model turbo hoặc small, sau đó nâng cấp lên large khi phần cứng cho phép.
