Giới thiệu  ·  Hỏi đáp  ·  Liên hệ
📞 0911.57.06.59 ✉️ info@luanan.com.vn
Tiểu luận
Số trang
61 trang
Lĩnh vực
Ngôn ngữ - Văn học
Ngôn ngữ
Tiếng Việt

XEM TRƯỚC TÀI LIỆU XEM TRƯỚC

Loading...

Đang tải bản xem thử tài liệu...

Mô tả tài liệu

Giới thiệu

Trong kỷ nguyên thông tin, cơ sở dữ liệu đóng vai trò thiết yếu trong việc lưu trữ và xử lý dữ liệu. Từ những mô hình ban đầu, cơ sở dữ liệu đã phát triển mạnh mẽ, trở thành nền tảng cho hoạt động của các tổ chức, giúp nâng cao hiệu suất và hiệu quả làm việc. Các hệ quản trị cơ sở dữ liệu không chỉ đơn thuần lưu trữ dữ liệu mà còn cung cấp các công cụ chuyển đổi dữ liệu thành thông tin hữu ích.

Sự phát triển của cơ sở dữ liệu cũng đặt ra yêu cầu mới trong việc khai thác tri thức tiềm ẩn trong dữ liệu. Khai phá dữ liệu (Data Mining) ra đời nhằm mục đích này, ứng dụng các kỹ thuật trí tuệ nhân tạo để phát hiện các mẫu hình, quy luật ẩn sâu. Tuy nhiên, phần lớn các phương pháp Data Mining tập trung vào dữ liệu có cấu trúc, trong khi dữ liệu phi cấu trúc, đặc biệt là văn bản, lại chiếm phần lớn thông tin được lưu trữ và trao đổi hàng ngày.

Để giải quyết vấn đề này, Khai phá dữ liệu văn bản (Text Mining) đã được nghiên cứu. Text Mining tập trung vào việc trích xuất thông tin và tri thức từ dữ liệu văn bản. Các bài toán quan trọng trong lĩnh vực này bao gồm phân loại văn bản (Text Classification), tóm tắt văn bản (Text Summarization) và phân loại văn bản theo danh mục (Text Categorization). Thế giới đã có nhiều thành công trong việc nghiên cứu Text Mining cho các ngôn ngữ như tiếng Anh, tiếng Pháp. Tuy nhiên, lĩnh vực này đối với tiếng Việt còn khá mới mẻ và chưa có nhiều công cụ hiệu quả.

Nhận thấy tầm quan trọng của việc khai thác thông tin từ văn bản tiếng Việt trong bối cảnh hội nhập và phát triển kinh tế, đề tài này tập trung vào nghiên cứu các phương pháp phân loại văn bản tiếng Việt, hướng tới phát triển các công cụ hỗ trợ hiệu quả trong tương lai.

Mục lục chi tiết:

  • I. Đặt vấn đề
  • II. Cơ sở lý thuyết
    • 1. Khái niệm Text Mining
      • a. Khai phá dữ liệu (Data Mining)
      • b. Khai phá dữ liệu văn bản (Text Mining)
    • 2. Bài toán phân loại văn bản (Text categorization)
      • a. Khái niệm phân loại văn bản
      • b. Các phương pháp phân loại văn bản
        • b.1. Sử dụng từ điển phân cấp chủ đề
        • b.1.1. Giải thuật phân lớp và phân cấp chủ đề
        • b.1.2. Sự phù hợp và sự phân biệt của các trọng số
        • b.2. Phương pháp cây quyết định (Decision tree)
    • 3. Bài toán thu thập thông tin (Information retrieval - IR)
      • a. Khái niệm thu thập thông tin
      • b. Các phương pháp thu thập thông tin

Tải tài liệu đầy đủ

Dung lượng: 516.6 KB

TẢI NGAY
Hội viên Premium

Tải không giới hạn, không cần chờ đợi và hỗ trợ in ấn trực tuyến.

Nâng cấp ngay
PDF 516.6 KB

Nâng cấp Hội viên

Truy cập không giới hạn toàn bộ kho tài liệu luận văn, luận án.

Xem gói hội viên