Text
PENGEMBANGAN MODEL VISUAL QUESTION-ANSWER UNTUK MEMAHAMI ISI TABEL BERBASIS ARSITEKTUR TRANSFORMER
Penelitian ini mengusulkan strategi peningkatan model LayoutLMv3 untuk tugas Document Visual Question Answering (DocVQA) pada dokumen tabel statistik melalui kombinasi Continual Fine-Tuning (CFT) yang mengintegrasikan normalisasi koordinat 2D dan patch embedding visual dengan lapisan logika Semantic Similarity Mapping (SSM) untuk menangani variasi pertanyaan, di mana dataset dibangun secara mandiri menggunakan Tesseract OCR dan human annotation. Hasil evaluasi menunjukkan Training Loss turun dari 3,717 menjadi 0,625, Validation Loss stabil di 1,38, skor ROUGE-1 dan ROUGE-L masing-masing sebesar 74,06% dan 74,15%, serta rata-rata akurasi human validation sebesar 55% (CFT+SSM) dibandingkan 45% (CFT saja) dan 0% pada kondisi zero-shot, dengan rincian akurasi per skenario: 90% (tabel 3 kolom sederhana), 70% (tabel header bertingkat dua level, 5 kolom), 30% (tabel 4 kolom multi-satuan), 50% (tabel lebar 6 kolom header multi-baris), 30% (tabel header bertingkat dua level, 7 kolom), 80% (tabel 3 kolom baru), 40% (tabel header bertingkat dua level, 4 kolom baru), 10% (tabel 4 kolom baru), 50% (tabel lebar 6 kolom baru), dan 100% (tabel lanjutan header bertingkat tiga level). Hasil diatas secara keseluruhan membuktikan bahwa pendekatan multimodal ini efektif meningkatkan kemampuan model dalam memahami struktur tabel meskipun kompleksitas tabel dan keterbatasan dataset masih memengaruhi generalisasi.
| T250034 | TESIS - 2026 ACH p | Perpustakaan Universitas Handayani Makassar | Tersedia |
Tidak tersedia versi lain