Giới thiệu
Bài báo này trình bày một phương pháp mới về tăng cường âm thanh trong miền thời gian-tần số, tập trung vào việc ước lượng nhiễu và khôi phục tín hiệu giọng nói. Điểm cốt lõi của phương pháp là việc sử dụng các vùng kết nối theo thời gian-tần số của sự hiện diện giọng nói. Các vùng này, được xác định thông qua một thuật toán phát hiện sự hiện diện giọng nói tiên tiến, đóng vai trò quan trọng trong việc định hướng cho cả quá trình ước lượng nhiễu và quá trình tăng cường âm thanh cuối cùng.
Phương pháp ước lượng nhiễu tận dụng thông tin từ các vùng giọng nói đã xác định, trong khi đó, quá trình tăng cường âm thanh kết hợp cả quyết định về sự hiện diện giọng nói và ước lượng nhiễu để tạo ra tín hiệu âm thanh được xử lý. Để đạt được hiệu quả âm thanh tự nhiên, các quy tắc suy giảm khác nhau được áp dụng cho các vùng có và không có sự hiện diện giọng nói. Điều này giúp giảm thiểu nhiễu nền một cách tinh tế, giữ lại đặc tính tự nhiên của âm thanh gốc.
Một ưu điểm đáng chú ý của phương pháp tăng cường âm thanh được đề xuất là độ phức tạp tính toán thấp, mở ra tiềm năng ứng dụng rộng rãi, đặc biệt là trong các thiết bị đòi hỏi tài nguyên hạn chế như máy trợ thính. Kết quả từ các bài kiểm tra nghe không chính thức cho thấy phương pháp này vượt trội hơn hẳn so với các kỹ thuật truyền thống như tối thiểu sai số trung bình bình phương biên độ phổ logarit (MMSE-LSA) và phiên bản định hướng của nó (MMSE-LSA theo hướng quyết định), thể hiện qua điểm số ý kiến trung bình cao hơn đáng kể.
Mục lục chi tiết:
- Introduction
- Structure of the Algorithm
- Spectral-Temporal Periodogram Smoothing
- Connected Speech Presence Regions
- Noise Estimation
- Speech Enhancement
- Experimental Setup
- Experimental Results
- Discussion