Klasifikasi Otomatis Teks Berita Berbahasa Indonesia Menggunakan Algoritma Naïve Bayes Classifier
Keywords:
Text Mining, Klasifikasi Teks, Naïve Bayes Classifier, Confusion MatrixAbstract
Teks berbahasa alami yang tidak terstruktur mendominasi sebagian besar informasi digital saat ini, sehingga muncul kebutuhan mendesak untuk melakukan ekstraksi dan kategorisasi informasi secara otomatis. Penelitian ini menerapkan algoritma Naïve Bayes Classifier untuk mengklasifikasikan dokumen teks berita ke dalam tiga kategori utama, yaitu Ekonomi, Olahraga, dan Pendidikan. Proses klasifikasi diawali dengan tahapan preprocessing dokumen yang meliputi case folding, tokenizing, penghilangan stopwords, dan stemming. Dataset penelitian mencakup total 150 data latih (50 dokumen per kategori) dan dievaluasi menggunakan 30 dokumen uji yang didistribusikan secara merata. Hasil pengujian menunjukkan bahwa algoritma Naïve Bayes Classifier mampu menghasilkan tingkat akurasi yang tinggi, yaitu sebesar 93.33% dengan tingkat kesalahan (error rate) sebesar 6.67%. Evaluasi mendalam menggunakan Confusion Matrix menunjukkan nilai Precision, Recall, dan F1-Score rata-rata berada pada angka 93.33%, membuktikan bahwa metode ini sangat efektif dan efisien untuk menangani klasifikasi teks berskala besar.