Giới thiệu
Đề tài nghiên cứu khoa học cấp trường "Ứng dụng thư viện lập trình mã nguồn mở xây dựng chương trình nhận dạng văn bản chữ Việt, Anh từ ảnh số" tập trung vào việc giải quyết bài toán chuyển đổi thông tin từ dạng ảnh số sang văn bản số. Trong bối cảnh số hóa tài liệu ngày càng phổ biến, việc trích xuất thông tin từ các nguồn ảnh như sách, báo trở nên cần thiết.
Mục tiêu nghiên cứu
- Áp dụng thư viện lập trình mã nguồn mở Tesseract để xây dựng chương trình nhận dạng văn bản chữ Việt và Anh từ ảnh số.
- Khôi phục văn bản tiếng Anh và tiếng Việt từ ảnh được quét bằng máy.
- Nghiên cứu các giải thuật cơ sở đã được sử dụng trong thư viện mã nguồn mở Tesseract, bao gồm giải thuật xử lý đối tượng ảnh và nhận dạng đối tượng dựa trên mạng nơ-ron.
Tổng quan về tình hình nghiên cứu
Thị trường hiện có nhiều phần mềm nhận dạng ký tự, tuy nhiên, đề tài tập trung vào thư viện mã nguồn mở Tesseract. Thư viện này, được viết bằng C/C++, có khả năng biên dịch và chạy trên nhiều hệ điều hành khác nhau. Mặc dù đã đạt được kết quả tốt cho tiếng Anh, việc nhận dạng tiếng Việt còn hạn chế, mở ra hướng nghiên cứu cho đề tài.
Phương pháp nghiên cứu
Đề tài được chia thành 3 chương:
- Chương 1: Giới thiệu các giải thuật cơ sở được áp dụng trong thư viện Tesseract.
- Chương 2: Trình bày tổng quan về chức năng của thư viện Tesseract và công cụ hỗ trợ đào tạo dữ liệu.
- Chương 3: Giới thiệu ngôn ngữ lập trình, các thư viện sử dụng để xây dựng ứng dụng nhận dạng văn bản chữ in và trình bày kết quả thử nghiệm.
Kết quả đạt được
Đề tài đã đạt được mục tiêu cơ bản là hiểu rõ các giải thuật nền tảng, xây dựng bộ từ điển nhận dạng cho tiếng Việt và tiếng Anh, thu được kết quả tương đối tốt. Tuy nhiên, do hạn chế về thời gian và khả năng khai thác tài nguyên, kết quả còn có những hạn chế nhất định.