CHÚC MỪNG NHÓM HỌC VIÊN CAO HỌC KHÓA 19 NGÀNH HỆ THỐNG THÔNG TIN CÓ BÀI BÁO ĐƯỢC CHẤP NHẬN TẠI HỘI NGHỊ KHOA HỌC QUỐC TẾ MAPR 2026
MAPR 2026 (The 9th International Conference on Multimedia Analysis and Pattern Recognition) là hội nghị quốc tế thường niên về phân tích đa phương tiện và nhận dạng mẫu (Multimedia Analysis and Pattern Recognition), do Trường Đại học Công nghệ Thông tin (UIT), ĐHQG-HCM đăng cai tổ chức, phối hợp cùng Hội Nhận dạng mẫu Việt Nam (VAPR), Trường ĐH Bách khoa Hà Nội (HUST) và Viện Công nghệ Thông tin (VAST); IEEE là nhà tài trợ kỹ thuật (Technical Sponsor). Đây là lần tổ chức thứ 9. MAPR 2026 diễn ra tại Silk Path Grand Huế Hotel, số 2 Lê Lợi, phường Thuận Hóa, TP. Huế, ngày 13 – 14/08/2026.
MAPR 2026 là diễn đàn dành cho các nhà nghiên cứu và chuyên gia đến từ các trường đại học, viện nghiên cứu và doanh nghiệp để chia sẻ những kết quả nghiên cứu mới nhất, đồng thời thúc đẩy hợp tác trong các lĩnh vực trí tuệ nhân tạo (AI), nhận dạng mẫu, phân tích đa phương tiện và các lĩnh vực ứng dụng mới nổi.
Thông tin chi tiết về hội nghị có thể tham khảo tại: https://mapr.uit.edu.vn/
Kỷ yếu các kỳ trước (IEEE Xplore): https://ieeexplore.ieee.org/xpl/conhome/1825404/all-proceedings
Tên bài báo: “Evaluating AutoEDA Without Human Raters: A Diagnostic Framework and Case Study of Structured Question Generation”
Học viên thực hiện:
- Đỗ Thị Bích Ngọc – Học viên Cao học Khóa 19, ngành Hệ thống Thông tin (Tác giả chính)
- Nguyễn Phú Thịnh – Học viên Cao học Khóa 19, ngành Hệ thống Thông tin (Đồng tác giả)
Giảng viên hướng dẫn: TS. Trần Hưng Nghiệp
Abstract: Đánh giá bằng con người hiện vẫn là cách chủ đạo để thẩm định các hệ thống phân tích dữ liệu thăm dò tự động (AutoEDA), nhưng cách làm này tốn kém, mang tính chủ quan và khó tái lập. Chúng tôi đề xuất một khung chẩn đoán tự động, có thể lặp lại, nhằm phát hiện các lỗi cấu trúc và thống kê trong AutoEDA – những dạng lỗi thường bị xem nhẹ khi người đánh giá chú trọng vào sự trôi chảy của diễn đạt hơn là tính đúng đắn của cách phân tầng dữ liệu và hình thức thống kê. Khung này sử dụng 9 chỉ số bao trùm các khía cạnh: độ chính xác, tính hợp lệ về cấu trúc, chất lượng thống kê, khả năng khám phá không gian con (subspace), và mức độ tương hợp giữa câu hỏi và insight. Chúng tôi áp dụng khung chẩn đoán cho ba pipeline tiêu biểu: một hệ thống hỏi – đáp có cấu trúc theo phong cách QUIS, ONLYSTATS như một biến thể cắt gọt dựa trên thống kê (ablation), và một pipeline LLM agent tự do. Trên ba tập dữ liệu Adidas US Sales, IBM Employee Attrition và Online Sales, các biểu diễn trung gian có cấu trúc gắn với số lượng lỗi kiểu cột thấp hơn và độ bao phủ không gian con rộng hơn trong các lần chạy thử nghiệm. Pipeline theo phong cách QUIS đạt tính hợp lệ cấu trúc trung bình 94,0%, so với 40,0% của LLM agent, và trung bình phát hiện được nhiều insight không gian con hơn (84,4% so với 37,4%). Hệ này cũng đạt Điểm Không gian con (Subspace Score) cao nhất (x=1,067), trong khi LLM agent đạt Tỷ lệ Thắng Uplift (Uplift Win Rate) cao nhất (66,7%, tức không gian con vượt trội so với toàn cục ở 2 trong 3 tập dữ liệu). Pipeline theo phong cách QUIS phát hiện được các nghịch lý Simpson có ý nghĩa thống kê ở 2 trên 3 tập dữ liệu. Nhìn chung, trong các thử nghiệm của chúng tôi, việc dẫn dắt bằng câu hỏi có nhận biết lược đồ (schema aware) đi kèm với tính hợp lệ cấu trúc và độ bao phủ nhóm con cao hơn so với cách nhắc lệnh (prompting) tự do. Rộng hơn, bài báo đóng góp một khung chẩn đoán có thể tái sử dụng để so sánh các hệ thống AutoEDA một cách nhất quán và có thể tái lập.











