NLP Engineer
Text Summarization
intermediate
0,00
13 jam 0 menit
0 Siswa Terdaftar
Deskripsi
Course ini membahas teknik peringkasan teks untuk mengekstraksi informasi penting dari dokumen teks secara otomatis. Peserta akan mempelajari pendekatan extractive dan abstractive summarization, tahapan pra-pemrosesan teks, serta evaluasi hasil ringkasan. Course ini menekankan pemahaman konsep dan penerapan model Natural Language Processing (NLP) untuk menghasilkan ringkasan yang ringkas, relevan, dan mudah dipahami.
Sasaran Siswa
- Memahami Konsep Dasar Text Summarization
Perangkat yang Dibutuhkan
Prosesor
Intel Core i3 (Rekomendasi Core i5 ke atas)
Sistem Operasi
Windows, Linux, MacOS
Biaya Investasi
Rp 400.000
Metode Ajar
- Self-paced learning
- Total Belajar : 13 jam 0 menit
Instructor
Dr. Ni Wayan Sumartini Saraswati, S.T.,M.T.
Apa yang akan Anda dapatkan
Sertifikat
Dapatkan sertifikat resmi sebagai bukti kompetensi Anda.
Modul
Akses modul pembelajaran lengkap yang mudah dipahami kapanpun.
Forum Diskusi
Diskusi interaktif bersama siswa lainnya.
Kuis
Kuis singkat untuk menguji dan memperkuat pemahaman materi.
Ujian
Ujian akhir untuk mengukur kemampuan dan kelulusan course.
Silabus
Materi yang Anda pelajari di kelas ini
Pengenalan Text Summarization
Modul ini membahas pengenalan text summarization sebagai teknik dalam Natural Language Processing (NLP) untuk menghasilkan ringkasan otomatis dari teks panjang tanpa menghilangkan makna inti. Perkembangan ledakan data digital membuat teknologi ini krusial dalam mengatasi information overload pada berbagai sumber seperti berita, jurnal ilmiah, laporan bisnis, dan dokumen hukum. Pembahasan mencakup dua pendekatan utama, yaitu extractive summarization, yang memilih kalimat penting dari teks asli, serta abstractive summarization, yang menyusun kembali informasi dalam bentuk kalimat baru layaknya ringkasan manusia.
30 Menit
Dasar Pemrosesan Teks untuk Summarization
Modul ini membahas dasar-dasar text pre-processing sebagai tahapan fundamental sebelum teks diproses oleh model summarization. Pre-processing berperan menormalkan dan membersihkan teks mentah agar dapat direpresentasikan dalam bentuk yang sesuai untuk analisis komputasi, sekaligus meminimalkan noise yang dapat memengaruhi kualitas ringkasan. Tahapan utama yang dibahas meliputi case folding, cleaning teks, tokenisasi, stopword removal, stemming, dan lemmatization, berikut pertimbangan penggunaannya pada model extractive maupun abstractive. Bab ini juga menguraikan konsep representasi teks, mulai dari Bag-of-Words dan TF-IDF hingga pendekatan modern berbasis contextual embedding, yang menjadi fondasi utama pada sistem summarization berbasis transformer. Secara keseluruhan, bab ini menegaskan bahwa keberhasilan text summarization sangat bergantung pada kualitas preprocessing dan representasi teks yang digunakan dalam tahap pemodelan.
60 Menit
Extractive Text Summarization
Modul ini membahas konsep dan mekanisme extractive text summarization sebagai pendekatan peringkasan yang memilih kalimat paling informatif dari dokumen asli tanpa membentuk kalimat baru. Pembahasan mencakup prinsip dasar penentuan sentence importance score, mulai dari pendekatan berbasis statistik (TF, TF-IDF, posisi kalimat, dan panjang kalimat), pendekatan similarity dan graph-based yang memanfaatkan kemiripan semantik antar kalimat melalui cosine similarity dan graph ranking, hingga algoritma populer seperti TextRank, LexRank, LSA, dan SumBasic sebagai fondasi utama metode extractive.
120 Menit
Abstractive Text Summarization
Modul ini membahas abstractive text summarization sebagai pendekatan peringkasan berbasis generasi teks yang bekerja dengan memahami makna dokumen, mengintegrasikan informasi penting, lalu membentuk kalimat baru yang lebih padat, natural, dan koheren. Berbeda dengan extractive summarization yang hanya memilih kalimat dari teks asli, pendekatan abstractive mampu melakukan parafrase, kompresi ide, serta penggabungan informasi lintas kalimat, sehingga menghasilkan ringkasan yang lebih mendekati cara manusia merangkum.
120 Menit
Hybrid Text Summarization
Modul ini membahas hybrid text summarization sebagai pendekatan peringkasan yang mengintegrasikan metode extractive dan abstractive dalam satu pipeline terpadu. Pendekatan ini dirancang untuk mencapai keseimbangan antara kesetiaan fakta dan kualitas bahasa: tahap extractive berfungsi sebagai content filtering untuk memilih informasi paling relevan serta mengurangi noise dan panjang dokumen, sementara tahap abstractive bertugas melakukan kompresi ide, parafrase, dan penyusunan ringkasan yang lebih natural, koheren, dan ringkas.
150 Menit
Evaluasi dan Perbandingan Model Summarization
Modul ini membahas peran evaluasi sebagai komponen krusial dalam pengembangan dan validasi sistem text summarization. Evaluasi berfungsi memastikan bahwa ringkasan yang dihasilkan model benar-benar mewakili informasi penting, tetap setia pada makna sumber (faithful), ringkas dan koheren secara linguistik, serta relevan bagi kebutuhan pengguna. Karena satu dokumen bisa memiliki banyak ringkasan yang sama-sama valid, proses evaluasi bersifat kompleks dan multidimensional—tidak hanya menilai kesamaan kata, tetapi juga informativeness, fluency, coherence, dan minimnya redundansi.
120 Menit
Submission
Modul ini membahas ringkasan keseluruhan dari modul text summarization sebagai proses end-to-end yang tidak sekadar memotong teks panjang, melainkan menyeleksi informasi penting, merepresentasikan makna secara komputasional, dan menghasilkan ringkasan yang informatif, koheren, serta mudah dipahami. Pembahasan mencakup tiga pendekatan utama—extractive, abstractive, dan hybrid—beserta peran masing-masing dalam menjaga keseimbangan antara akurasi fakta (faithfulness) dan keluwesan bahasa (fluency).
180 Menit