Text
Pengembangan Model Chatbot Gambar Untuk Pemrosesan Data Ruang Publik Di Kota Makassar Menggunakan Arsitektur Transformer
Visual Question Answering (VQA) merupakan bidang penelitian yang menggabungkan pemahaman visual dan pemrosesan bahasa alami untuk
menjawab pertanyaan berbasis gambar. Penelitian ini bertujuan mengembangkan model VQA bilingual (Bahasa Indonesia dan Inggris) berbasis Vision Transformer (ViT) dan GPT-2 yang dioptimalkan untuk domain Pantai Losari, Makassar, sebagai kontribusi terhadap pengembangan teknologi smart city di Indonesia. Model dibangun menggunakan arsitektur VisionEncoderDecoderModel yang mengintegrasikan ViT sebagai encoder visual dan GPT-2 sebagai decoder teks melalui mekanisme cross-attention. Dataset yang digunakan meliputi VQAv2 (terjemahan bilingual), Flickr8K–Indonesia, dan LosariVQAv1, dengan total 334.980 pasangan pertanyaan–jawaban. Dua strategi pelatihan dibandingkan, yaitu Full Tuning dan Free Tuning, yang dilakukan secara terpisah. Hasil penelitian menunjukkan bahwa Full Tuning memberikan performa terbaik dengan validation loss 1.1335, akurasi 0.556, dan skor CIDEr 0.655, sementara Free Tuning menunjukkan stabilitas pelatihan yang baik. Model akhir, Losari–ViT–GPT2, mampu mengenali ikon-ikon visual seperti Masjid 99 Kubah, Kapal Phinisi, dan Anjungan Toraja dengan akurasi tinggi, serta menjawab pertanyaan dalam dua bahasa secara konsisten. Temuan ini menegaskan efektivitas pendekatan Full Tuning dalam adaptasi domain bilingual dan potensinya untuk mendukung sistem smart city di Indonesia.
| T250049 | TESIS - ANA p | Perpustakaan Universitas Handayani Makassar | Tersedia |
Tidak tersedia versi lain