CHÚC MỪNG SINH VIÊN LỚP CTTT2021 VÀ HỌC VIÊN CAO HỌC NGÀNH HỆ THỐNG THÔNG TIN CÓ BÀI BÁO ĐƯỢC CHẤP NHẬN TẠI HỘI NGHỊ KHOA HỌC QUỐC TẾ MAPR 2026
MAPR 2026 (The 9th International Conference on Multimedia Analysis and Pattern Recognition) là hội nghị quốc tế thường niên về phân tích đa phương tiện và nhận dạng mẫu (Multimedia Analysis and Pattern Recognition), do Trường Đại học Công nghệ Thông tin (UIT), ĐHQG-HCM đăng cai tổ chức, phối hợp cùng Hội Nhận dạng mẫu Việt Nam (VAPR), Trường ĐH Bách khoa Hà Nội (HUST) và Viện Công nghệ Thông tin (VAST); IEEE là nhà tài trợ kỹ thuật (Technical Sponsor). Đây là lần tổ chức thứ 9. MAPR 2026 diễn ra tại Silk Path Grand Huế Hotel, số 2 Lê Lợi, phường Thuận Hóa, TP. Huế, ngày 13 – 14/08/2026.
MAPR 2026 là diễn đàn dành cho các nhà nghiên cứu và chuyên gia đến từ các trường đại học, viện nghiên cứu và doanh nghiệp để chia sẻ những kết quả nghiên cứu mới nhất, đồng thời thúc đẩy hợp tác trong các lĩnh vực trí tuệ nhân tạo (AI), nhận dạng mẫu, phân tích đa phương tiện và các lĩnh vực ứng dụng mới nổi.
Thông tin chi tiết về hội nghị có thể tham khảo tại: https://mapr.uit.edu.vn/
Kỷ yếu các kỳ trước (IEEE Xplore): https://ieeexplore.ieee.org/xpl/conhome/1825404/all-proceedings
Tên bài báo: “A Cascade English–Vietnamese Speech-to-Speech Translation Framework for Online IT Education”
Sinh viên và học viên thực hiện:
- Phạm Thị Thuỳ Trang (MSSV: 21522697) – Lớp CTTT2021
- Nguyễn Minh Nhựt – Học viên Cao học ngành Hệ thống Thông tin, Khóa 2022
Giảng viên hướng dẫn: PGS. TS. Nguyễn Đình Thuân
Abstract: The rapid expansion of online IT education has created a pressing need to bridge the English-Vietnamese language barrier for non-native learners, as subtitle-based solutions impose cognitive load and fail to preserve the lecturer’s vocal identity. This paper presents a cascade Speech-to-Speech Translation (S2ST) pipeline for IT lectures, combining Automatic Speech Recognition (ASR), an LLM-based Machine Translation (MT) backend selected against conventional NMT baselines, and zero-shot Text-to-Speech (TTS) with voice cloning. We construct a domain- specific dataset of 240 English IT lecture videos and a 40-video human-annotated benchmark. Across five ASR models, five MT models, and two TTS models, Whisper Medium achieves the lowest Word Error Rate (3.36%), Gemini 2.0 Flash the highest translation quality (BLEU 55, chrF 72), and F5-TTS the most faithful voice cloning (Speaker Similarity 0.782, MOS 4.0). In an indicative single-lecture comparison, the cascade pipeline reaches an MOS of 4.2 versus 2.2 for the SeamlessM4T-Large end-to-end baseline. An in- depth error analysis and practical mitigation strategies further suggest that a carefully engineered cascade remains a competitive choice for low-resource educational S2ST.











