Phân cụm dữ liệu chuỗi thời gian biểu hiện gen dựa trên khớp mô hình tổng các hàm mũ
Tác giả: Ciprian Doru Giurcăneanu, Ioan Tăbuş, Jaakko Astola
Ngành: EURASIP Journal on Applied Signal Processing
Tóm tắt nội dung tài liệu:
Bài báo này giới thiệu một phương pháp phân cụm dữ liệu chuỗi thời gian biểu hiện gen mới, tập trung vào việc khớp mô hình tổng các hàm mũ với dữ liệu được lấy mẫu không đều. Phương pháp này sử dụng nguyên lý độ dài mô tả tối thiểu (MDL) để ước tính cấu trúc mô hình, kết hợp với mô hình ước lượng khả năng cực đại được chuẩn hóa (NML) cho một tập hợp con các tham số. Hiệu quả của phương pháp ước tính cấu trúc được kiểm chứng qua dữ liệu mô phỏng, cho thấy sự vượt trội so với các tiêu chí lựa chọn trước đó. Độ chính xác của các ước lượng tham số phi tuyến được phân tích dựa trên giới hạn dưới Cramér-Rao. Nghiên cứu cũng trình bày các ví dụ phân cụm dữ liệu biểu hiện gen từ ứng dụng sinh học phát triển, minh họa khả năng nhóm gen theo các lớp chức năng.
Mục lục chi tiết:
- 1. INTRODUCTION
- 2. FITTING A SUM OF EXPONENTIALS TO NONUNIFORMLY SAMPLED DATA
- 2.1. Motivation
- 2.2. Problem formulation
- 2.3. An estimation procedure for the nonlinear regression model
- 3. GENE CLUSTERING
- 3.1. New clustering algorithm
- 3.2. Experimental results with simulated data
- 4. CLUSTERING THE GENE EXPRESSION DATA SAMPLED DURING POSTNATAL DEVELOPMENT OF MOUSE DENTATE GYRUS AND CEREBELLUM
- 4.1. Data sets from developmental biology
- 4.2. Fitting the sum-of-exponentials model
- 4.3. Clustering the selected genes
- 4.4. Enrichment of functional categories
- APPENDICES
- A. THE SEPARABILITY OF PARAMETERS FOR THE LS PROBLEM
- B. COMPUTATION OF CRAMÉR-RAO LOWER BOUND (CRLB)