ASR
Whisper-Based Transcription
Paper 10 (P10) • CCU & ASR NYU Courant Institute • DARPA CCU Program In-the-Wild Speech Processing

Chuyển Dịch Lời Thoại Dựa Trên Whisper Từ Video Đa Ngôn Ngữ Phục Vụ Sự Hiểu Biết Đa Văn Hóa

"Whisper-Based Speech Transcription from Videos Across Multiple Languages for Cross-Cultural Understanding" — Phương pháp luận thực tiễn giúp thu thập dữ liệu video tự nhiên, tối ưu tinh chỉnh Whisper/WhisperX, diệt ảo giác lặp từ và mở ra giải pháp nhận dạng giọng nói chuẩn xác cho các hệ thống AI hạ nguồn.

Tác giả: Michael Picheny
NYU Courant Institute of Mathematical Sciences, New York University (NYU), USA
map22@nyu.edu
Tỷ Lệ Lỗi Từ (WER)
29.7% → 21.7%
Giảm gần 33% lỗi tương đối sau tinh chỉnh
Khắc Phục Ảo Giác
max_new_tokens=256
Chặn đứng bùng nổ token chèn lặp khi fine-tune
Kho Dữ Liệu Công Bố
260 Giờ Âm Thanh
4 ngôn ngữ chuẩn Creative Commons trên HuggingFace
Dung Nạp Nhiễu (NTP)
44% – 71% WER
Dialog Acts ít nhạy cảm, LLM hạ nguồn vận hành tốt

Tóm Tắt Học Thuật (Academic Abstract)

Đối chiếu song ngữ: Bản dịch tiếng Việt chuyên môn hóa & Văn bản gốc tiếng Anh

NYU & DARPA CCU 2026
Bản Dịch Học Thuật Tiếng Việt Bản dịch chuyên môn

Hiểu biết đa văn hóa (cross-cultural understanding) ngày càng trở nên quan trọng trong một thế giới kết nối cao và xuyên quốc gia ngày nay. Sự thành công của các công nghệ dựa trên Mô hình Ngôn ngữ Lớn (LLM) hiện đang thúc đẩy việc phát triển các công cụ tự động nhằm hỗ trợ sự thấu hiểu cho những người ngoại quốc đang nỗ lực hòa nhập trong các môi trường đa văn hóa. Việc xây dựng các công cụ tự động như vậy thường được thực hiện bằng cách tận dụng dữ liệu văn bản, âm thanh và video trong đời thực (in-the-wild).

Bài báo này trình bày các kỹ thuật nhằm cải thiện việc tạo văn bản chép lời (transcript) dựa trên nhận dạng giọng nói từ video trên nhiều ngôn ngữ, nhằm huấn luyện tốt hơn cho các công cụ tự động này. Trọng tâm nghiên cứu là các quy trình và công cụ nhận dạng giọng nói có thể dễ dàng sử dụng bởi những người xây dựng công cụ đa văn hóa mà không đòi hỏi chuyên môn sâu về xử lý tiếng nói.

Sử dụng các video công khai từ YouTube và các công cụ dựa trên Whisper, tỷ lệ lỗi phiên âm trung bình trên 7 ngôn ngữ (Tây Ban Nha, Nhật Bản, Hàn Quốc, Quan Thoại/Trung Quốc, Thổ Nhĩ Kỳ, Nga và Do Thái) ban đầu đạt mức 30%. Với một lượng dữ liệu tinh chỉnh (fine-tuning) vừa phải, tỷ lệ lỗi trung bình có thể giảm xuống còn 20%, giúp đầu ra này trở nên hữu dụng hơn nhiều cho các quá trình xử lý hạ nguồn (downstream processing). Dữ liệu tiếng nói và siêu dữ liệu (metadata) liên quan đến các video này cũng được công bố cho cộng đồng nhằm tiếp tục cải tiến các thử nghiệm này.

English Original Abstract Primary Source

"Cross-cultural understanding has become increasingly important in today's highly connected and transnational world. The success of LLM-based technologies is currently driving the development of automated tools to aid in this understanding for foreigners striving to assimilate in cross-cultural environments. Building such automated tools is typically done by leveraging in-the-wild text, audio, and video data."

"This paper presents techniques to improve speech-recognition-based transcript generation from video across multiple languages in order to better train these automated tools. The focus is on speech recognition processes and tools that can easily be used by cross-cultural tool builders without requiring deep speech expertise."

"Using publicly available videos from YouTube and Whisper-based tools, average transcription error rates across 7 languages initially stand at 30%. With a modest amount of fine-tuning data, average error rates can be reduced to 20%, making this output much more usable for downstream processing. Speech and metadata associated with these videos is also being released to the community to further advance these experiments."

Chỉ số từ khóa: Speech Recognition Whisper WhisperX Video Transcription Cross-Cultural Understanding In-the-wild ASR

1. Động Lực Nghiên Cứu & Thực Trạng Nhận Dạng Tiếng Nói

Tại sao bảng xếp hạng ASR thông thường (WER < 10%) là một ảo tưởng khi bước ra thế giới thực

1

Ảo Tưởng Bảng Xếp Hạng

Các bảng xếp hạng ASR mã nguồn mở công bố tỷ lệ WER dưới 10%, nhưng chúng được thử nghiệm trên lời nói đọc theo kịch bản, diễn giả chuyên nghiệp và phòng thu lý tưởng. Khi bước vào dữ liệu đời thực (YouTube, đàm thoại đường phố), WER tăng vọt lên 30% – 40%.

2

Chỉ Dấu Văn Hóa Mật Độ Thấp

Các chỉ dấu văn hóa (cultural markers - nghi thức chào hỏi, từ ngữ kiêng kỵ, chuẩn mực xã hội) xuất hiện với tần suất rất thưa thớt trong hội thoại. Do đó, cần phân tích hàng nghìn giờ âm thanh mới đủ lượng dữ liệu huấn luyện, biến chi phí và thời gian xử lý thành rào cản chí mạng.

3

Rào Cản Chuyên Môn Tiếng Nói

Các nhà nghiên cứu văn hóa xã hội và nhà phát triển ứng dụng LLM không phải là chuyên gia xử lý âm thanh tiếng nói (speech scientists). Họ cần một quy trình tự động hóa hoàn chỉnh, đơn giản, chi phí thấp để biến video tự nhiên thành văn bản chuẩn xác.

Bảng Đối Chiếu: Dữ Liệu Phòng Thí Nghiệm (Lab Data) vs Dữ Liệu Thực Tế (In-The-Wild)

Đặc Tính So Sánh Môi Trường Chuẩn Hóa (Lab / Benchmarks) Môi Trường Tự Nhiên (In-The-Wild / Video YouTube)
Bản chất giọng nói Đọc theo kịch bản định sẵn, phát âm tròn vành rõ chữ Hội thoại ngẫu hứng, nói chồng lời, nuốt âm, thổ ngữ địa phương
Môi trường âm học Phòng thu cách âm, micro cận miệng, tỷ lệ tín hiệu trên nhiễu (SNR) cao Tạp âm đường phố, nhạc nền video, tiếng vang phòng, tiếng ồn thiết bị
Tỷ lệ lỗi từ (WER) < 10% (Tưởng chừng bài toán đã giải xong) 30% – 40% (Đầy lỗi chèn, xóa và thay thế từ)
Số lượng người nói 1 người đọc đơn lẻ, không cần phân tách Nhiều người nói luân phiên, bắt buộc có Speaker Diarization

2. Lựa Chọn Hệ Thống: OpenAI Whisper vs Oxford WhisperX

Phân tích cơ chế hoạt động, sự nâng cấp vượt trội của WhisperX và lý do lựa chọn mô hình large-v2

W OpenAI Whisper (large-v2) Vanilla Baseline

Huấn luyện giám sát yếu trên 680.000 giờ âm thanh (563.000h tiếng Anh và 117.000h cho 96 ngôn ngữ). Mô hình Encoder-Decoder Transformer xử lý các đoạn spectrogram 30 giây.

  • Mạnh mẽ out-of-the-box: 13/96 ngôn ngữ có trên 2.000 giờ huấn luyện.
  • Nhược điểm tốc độ: Xử lý tuần tự bằng Beam Search chậm, tốn nhiều VRAM GPU.
  • Thiếu Speaker Diarization: Chỉ sinh chuỗi văn bản phẳng, không biết ai đang nói lượt nào.
  • Mốc thời gian mờ: Timestamp ở cấp độ đoạn (chunk-level) chứ không chính xác từng từ.
X Oxford WhisperX (Tối Ưu Hóa) Recommended

Phát triển bởi nhóm nghiên cứu Đại học Oxford (Bain et al., Interspeech 2023), tích hợp 3 cải tiến mang tính đột phá cho nhận dạng tiếng nói thực tế:

  • Tăng tốc độ 10x: Kết hợp phát hiện tiếng nói (VAD - Voice Activity Detection) bằng mô hình Pyannote để cắt bỏ đoạn tĩnh, cho phép xử lý batch song song siêu tốc.
  • Phân tách người nói (Speaker Diarization): Tích hợp mạng phân tách đa lớp pyannote.audio, tự động dán nhãn Speaker 0, Speaker 1 chính xác.
  • Căn chỉnh ngữ âm cưỡng bức (Phonetic Forced Alignment): Sử dụng mô hình CTC để tạo timestamp chính xác tới từng mili-giây cho từng từ đơn.
Ghi chú kỹ thuật then chốt: Vì sao chọn Whisper large-v2 thay vì large-v3? Mặc dù OpenAI đã ra mắt phiên bản large-v3 với số kênh filter bank tăng từ 80 lên 128, các thảo luận từ cộng đồng kỹ sư mã nguồn mở và kiểm nghiệm thực tế của nhóm tác giả NYU chỉ ra rằng: large-v3 cực kỳ nhạy cảm và dễ rơi vào bẫy ảo giác (hallucination loops) khi xử lý các đoạn âm thanh nhiều tạp âm thực tế hoặc có khoảng lặng kéo dài. Phiên bản large-v2 đạt độ ổn định âm học vượt trội hơn hẳn trên tập dữ liệu video in-the-wild.

3. Quy Trình Thu Thập, Căn Chỉnh & Tuyển Chọn Dữ Liệu

Pipeline tự động hóa hoàn toàn từ khai phá YouTube đến lọc sạch chất lượng âm thanh qua NIST SCTK

Sơ Đồ Luồng Tính Toán Đầu-Cuối (End-to-End Data Pipeline)

graph LR A["Tệp Dump Wikimedia
(make_search_word)"] --> B["Tìm Video YouTube
CC & Có Subtitle"] B --> C["Kiểm tra Subtitle
Thủ Công (Manual Sub)"] C --> D["Tải Audio bằng yt-dlp
Convert 16 kHz Mono"] D --> E["Căn chỉnh VTT Subtitle
Ghép đoạn ≤ 20s"] E --> F["WhisperX Forced Alignment
& Cắt tại Pause ≥ 0.5s"] F --> G["Chấm điểm NIST SCTK
WER & CER"] G --> H{"WER > 50% hoặc
Thời lượng <5m / >2h?"} H -- "Có (Loại Bỏ)" --> X["Thùng Rác / Kém Chất Lượng"] H -- "Không (Giữ Lại)" --> I["Tập Huấn Luyện Chuẩn
Train / Dev / Test"]

Dung Lượng Huấn Luyện Ban Đầu Của Whisper (Bảng I)

Ngôn Ngữ (Language) Mã Nhóm Số Giờ Trong Whisper
Tiếng Quan Thoại (Mandarin) DARPA CCU 23.446 h
Tiếng Tây Ban Nha (Spanish) DARPA CCU 11.000 h
Tiếng Nga (Russian) DARPA CCU 9.761 h
Tiếng Hàn (Korean) DARPA CCU 7.793 h
Tiếng Nhật (Japanese) DARPA CCU 7.064 h
Tiếng Thổ Nhĩ Kỳ (Turkish) DARPA CCU 4.333 h
Tiếng Do Thái (Hebrew) Thử thách (< 1kh) 688 h

Chi Tiết Kỹ Thuật Tinh Lọc Âm Thanh

1. Định Dạng Chuẩn Hóa: Toàn bộ âm thanh sau khi tải bằng yt-dlp được chuyển đổi đồng nhất về định dạng 16 kHz Mono WAV/FLAC nhằm tương thích tối ưu với bộ lọc Mel-spectrogram của Whisper.
2. Hóa Giải Lỗi Lệch Mốc Phụ Đề (.vtt): Phụ đề YouTube thường có timestamp thô, trôi lệch so với khẩu ngữ thực. Nhóm tác giả ghép các phân đoạn `.vtt` thành các khối nhỏ hơn hoặc bằng 20 giây, dùng mô hình alignment của WhisperX để căn chỉnh thời điểm bắt đầu/kết thúc chính xác đến từng từ, sau đó cắt lại tại các khoảng lặng từ 0.5 giây trở lên.
3. Ngưỡng Loại Bỏ Rác Nghiêm Ngặt: Sử dụng bộ công cụ tiêu chuẩn NIST SCTK, loại bỏ hoàn toàn các video có WER > 50% (phụ đề không khớp hoặc video lồng tiếng sai) và video ngắn hơn 5 phút hoặc dài hơn 2 giờ.

4. Thử Nghiệm Tinh Chỉnh & Bí Quyết Hóa Giải Ảo Giác

Phát hiện nghịch lý: Tinh chỉnh thông thường làm suy giảm độ chính xác và kỹ thuật can thiệp giới hạn token

Nghịch Lý Ảo Giác Khi Fine-Tuning Whisper (The Hallucination Trap)

Khi nhóm tác giả thực hiện fine-tuning Whisper cơ bản (mở khóa toàn bộ tham số, 2 epochs, lr = $1\times 10^{-5}$, weight decay = 0.005) trên tập dữ liệu "nhỏ" (10% thời lượng), một hiện tượng đáng báo động xảy ra: WER trung bình tăng từ 29.7% lên 35.4% (kết quả tệ hơn cả mô hình gốc)!

Nguyên nhân chính: Bùng nổ lỗi chèn từ (Insertion Errors) do mô hình tự sinh lặp đi lặp lại một cụm từ vô tận khi gặp các đoạn tạp âm hoặc khoảng lặng (Vòng lặp ảo giác - Hallucination Loop).

Bảng So Sánh Tỷ Lệ Lỗi Trung Bình Qua 5 Cấu Hình Thử Nghiệm (Hình 2 trong bài báo)

Cấu Hình Mô Hình (Model Configuration) Tập Dữ Liệu Cơ Chế Kiểm Soát Giải Mã Tỷ Lệ WER Trung Bình Đánh Giá & Nhận Xét
Whisper OOB Không huấn luyện (Zero-shot) Mặc định 29.7% Baseline mặc định của OpenAI
Whisper FT (Naive) Tập Nhỏ (Small Train ~10h/ngôn ngữ) Không giới hạn token 35.4% Tệ hơn OOB do bùng nổ ảo giác lặp từ!
Whisper FT Opt Tập Nhỏ (Small Train) max_new_tokens = 256 26.0% Khống chế ảo giác thành công, giảm 3.7% so với OOB
WhisperX FT Tập Nhỏ (Small Train) VAD + max_new_tokens = 256 24.4% WhisperX ít ảo giác hơn nhờ bộ lọc VAD cắt sạch khoảng lặng
WhisperX FT (All) Tập Đầy Đủ (All Train: 30–200h) Full Pipeline Tối Ưu 21.7% Giảm gần 33% lỗi tương đối; đạt chuẩn cho ứng dụng thực tế!

Kỹ Thuật Khống Chế max_new_tokens = 256

Nhóm tác giả đã thử nghiệm các ngưỡng giới hạn token sinh ra:

  • max_new_tokens = 64: Gây cụt lời thoại ở các câu dài (tăng lỗi deletion).
  • max_new_tokens = 256: Điểm cân bằng hoàn hảo cho các phân đoạn âm thanh tối đa 20 giây, chặn đứng hoàn toàn hiện tượng sinh token vô tận.

Kiểm Định Ý Nghĩa Thống Kê (Bootstrap Tests)

Sử dụng kiểm định bootstrap bắt cặp (paired bootstrap tests - Bisani & Ney, 2004) trên 10 cặp so sánh:

  • Tất cả các cặp so sánh giữa mô hình OOB và các biến thể tinh chỉnh đều đạt ý nghĩa thống kê cực kỳ rõ nét với $p < 0.001$.
  • Khẳng định mức cải thiện từ 29.7% xuống 21.7% là thực chất và có độ tin cậy khoa học tuyệt đối.

5. Phân Tích Độ Dung Nạp Nhiễu (Noise Toleration Point - NTP) Cho Tác Vụ Hạ Nguồn

Mức WER ~20% có đủ tốt để các mô hình LLM phân tích văn hóa hoạt động tin cậy?

Nhiều người e ngại rằng tỷ lệ lỗi từ 20% vẫn là quá cao cho việc phân tích ngữ nghĩa. Để trả lời câu hỏi này một cách chặt chẽ, nghiên cứu đã tham chiếu công trình đột phá của Shapira et al. (ACL 2025) đo lường Điểm Dung Nạp Nhiễu (Noise Toleration Point - NTP) — ngưỡng suy giảm WER tối đa mà một tác vụ NLP hạ nguồn vẫn duy trì được hiệu năng chấp nhận được.

Tác Vụ NLP Hạ Nguồn (Downstream NLP Task) Thước Đo Đánh Giá Ngưỡng Dung Nạp WER (NTP Range) Khả Năng Thích Ứng Với Kết Quả Bài Báo (WER ~20%)
Phân Loại Hành Động Đối Thoại (Dialog Act Classification - DAC) F1 Score, Accuracy 44% – 71% Vô cùng lý tưởng (Hoàn toàn miễn nhiễm với nhiễu 20%)
Hỏi Đáp Văn Bản (Question Answering - Q&A) Exact Match (EM), F1 5% – 34% Nằm trong ngưỡng (Bảo toàn dữ kiện cốt lõi)
Tóm Tắt Tự Động (Text Summarization) ROUGE-L, BERTScore 7% – 30% Nằm trong ngưỡng (Tóm tắt được đại ý chính)

Kết luận then chốt cho nghiên cứu AI:

Nhiệm vụ nhận diện chuẩn mực xã hội, hành vi giao tiếp và tương tác văn hóa thuộc nhóm Dialog Act Classification (DAC) và Topic Spotting. Các tác vụ này có tính dung nạp nhiễu cao nhất (chịu được tới 71% WER). Do đó, việc đưa WER về ngưỡng ~20% bằng WhisperX là quá đủ điều kiện để các mô hình ngôn ngữ lớn (LLM) trích xuất chính xác các đặc trưng văn hóa mà không bị sai lệch ngữ nghĩa.

6. Bộ Dữ Liệu Phát Hành Cho Cộng Đồng (ccu-hf-data)

260 giờ âm thanh chuẩn bản quyền Creative Commons trên 4 ngôn ngữ và mức nhảy vọt độ chính xác

Thực Trạng Khắc Nghiệt Về Bản Quyền Video YouTube: Mặc dù công cụ lọc của YouTube Data API đã tích hợp cờ tìm kiếm giấy phép Creative Commons, kết quả rà soát thực tế cho thấy hơn 50% video hoặc thiếu thông tin CC trong siêu dữ liệu, hoặc đã bị chủ kênh xóa sau thời gian ngắn (ví dụ: tiếng Tây Ban Nha có 33 video thì 0 video có CC hợp lệ; tiếng Nga có 204 video thì 199 video thiếu CC!). Để đảm bảo tính pháp lý tuyệt đối cho cộng đồng nghiên cứu quốc tế, nhóm tác giả chỉ phát hành tập dữ liệu trên 4 ngôn ngữ có đầy đủ giấy phép CC: Hàn Quốc, Quan Thoại, Do Thái và Thổ Nhĩ Kỳ.

Thống Kê Chi Tiết Bộ Dữ Liệu Phát Hành Trên HuggingFace (Bảng V)

Chỉ Số Dữ Liệu (Metric) Tiếng Quan Thoại (Mandarin) Tiếng Hàn Quốc (Korean) Tiếng Thổ Nhĩ Kỳ (Turkish) Tiếng Do Thái (Hebrew)
Thời lượng Tập Huấn Luyện (Train Hours) 30.42 h 43.48 h 105.07 h 61.38 h
Số phân đoạn Train (Train Segments) 25.930 41.865 102.615 59.128
Thời lượng Kiểm Thử (Test Hours) 6.42 h 3.44 h 13.61 h 7.28 h
Tỷ lệ lỗi chưa train (Error % No-Train) 21.4% (CER) 32.1% (WER) 29.4% (WER) 27.8% (WER)
Tỷ lệ lỗi sau khi train (Error % Train) 10.2% (CER) 23.4% (WER) 18.2% (WER) 22.1% (WER)
Mức giảm lỗi tương đối (Relative Gain) -52.3% -27.1% -38.1% -20.5%
HF
HuggingFace Dataset Repository: picheny/ccu-hf-data
Audio 16kHz mono, text transcript, alignment metadata & CC licenses
Truy Cập Kho Dữ Liệu
Ứng Dụng Khóa Luận Tốt Nghiệp

7. Kế Thừa & Chuyển Giao Công Nghệ Vào Hệ Thống SmartRestaurant

Xây dựng module Voice AI gọi món đa phương thức cho Trợ lý Aria trong môi trường nhà hàng ồn ào

Không gian nhà hàng thực tế là một ví dụ điển hình của môi trường âm học cực kỳ hỗn tạp: tiếng xèo xèo từ bếp mở, tiếng nhạc nền, tiếng lách cách của dao thìa và cuộc trò chuyện của các bàn bên cạnh. Khi khách hàng gọi món bằng giọng nói (Voice Ordering), việc áp dụng trực tiếp mô hình Speech-to-Text thông thường sẽ thất bại. Dưới đây là kiến trúc chuyển giao toàn diện từ các phát kiến của bài báo Michael Picheny (2026) vào đồ án SmartRestaurant:

Bảng Ánh Xạ Lý Thuyết Picheny (2026) Sang Nghiệp Vụ SmartRestaurant

Thành Phần Trong Bài Báo Picheny (2026) Giải Pháp Ứng Dụng Trong SmartRestaurant (Trợ Lý Aria) Lợi Ích Thực Tế Mang Lại Cho Khóa Luận
Lọc Tạp Âm & Cắt Khoảng Lặng VAD (Pyannote VAD) Voice Activity Detection trước khi đẩy vào WhisperX Cắt bỏ tiếng ồn bếp, tiếng bát đĩa va chạm khi khách ngừng nói, giảm 70% tải GPU
Phân Tách Người Nói (Speaker Diarization) Tách biệt Lượt Lời Khách Hàng (Customer) vs Nhân Viên (Staff) Cho phép 1 tablet tại bàn ghi nhận chính xác từng người nói trong bàn tiệc 4–6 khách
Chống Ảo Giác Bằng Giới Hạn Token (max_new_tokens=128) Ràng buộc độ dài câu lệnh gọi món thực đơn Ngăn chặn triệt để hiện tượng AI tự ý "nhồi thêm" món ăn không có thật khi gặp tạp âm kéo dài
Dung Nạp Nhiễu NTP: Dialog Act Classification (44%–71%) Module Nhận Diện Ý Định Gọi Món (Order Intent Parser) Phân loại chuẩn xác hành động: Thêm món, Đổi món, Hủy món, Hỏi giá ngay cả khi sai chính tả nhẹ

Quy Trình Xử Lý Đơn Hàng Bằng Giọng Nói (Aria Voice-to-Order Flow)

sequenceDiagram autonumber actor Khach as Khách Hàng Tại Bàn participant Web as Giao Diện Web App (Client) participant ASR as WhisperX Engine (VAD + Diarization) participant NLU as Dialog Act & Intent Parser participant RAG as Two-Tier RAG (Thực Đơn & Dị Ứng) participant Order as Giỏ Hàng & Bếp (KDS) Khach->>Web: Nói: "Cho tôi 1 bò sốt tiêu đen, không hành tây" Web->>ASR: Stream Audio 16 kHz Mono Note over ASR: VAD cắt lọc tạp âm bếp
max_new_tokens=128 diệt ảo giác ASR->>NLU: Text Transcript (WER < 15%) NLU->>RAG: Truy vấn thực thể: [Bò sốt tiêu đen] & [Không hành tây] RAG->>Order: Thêm vào giỏ hàng + Ghi chú dị ứng/thành phần Order-->>Web: Phản hồi thẻ món đã chọn kèm xác nhận âm thanh

8. Tài Liệu Tham Khảo & Trích Dẫn BibTeX

Các ấn phẩm khoa học nền tảng liên quan và mã trích dẫn tiêu chuẩn

[1] Picheny, M. (2026). Whisper-Based Speech Transcription from Videos Across Multiple Languages for Cross-Cultural Understanding. NYU Courant Institute & DARPA CCU Program.
[2] Bain, M., Huh, J., Han, T., & Zisserman, A. (2023). WhisperX: Time-Accurate Speech Transcription of Long-Form Audio. Interspeech 2023.
[3] Radford, A., Kim, J. W., Xu, T., et al. (2023). Robust Speech Recognition via Large-Scale Weak Supervision. ICML 2023.
[4] Shapira, O., Chazan, S., & Cohen, A. D. N. (2025). Measuring the Effect of Transcription Noise on Downstream Language Understanding Tasks. ACL 2025.
Trích dẫn BibTeX chuẩn Picheny 2026
@article{picheny2026whisper,
  author    = {Michael Picheny},
  title     = {Whisper-Based Speech Transcription from Videos Across Multiple Languages for Cross-Cultural Understanding},
  journal   = {NYU Courant Institute of Mathematical Sciences Technical Report},
  year      = {2026},
  publisher = {New York University},
  url       = {https://huggingface.co/datasets/picheny/ccu-hf-data}
}