Peneliti Stanford dan Berkeley Uji AI Medis Indonesia, Hasilnya Bikin Terkejut
Dua akademisi terkemuka dari Universitas Stanford dan Universitas California, Berkeley, melakukan pengujian independen terhadap sejumlah model kecerdasan buatan (AI) medis yang dikembangkan di Indonesia. Hasilnya mengejutkan banyak pihak: beberapa model buatan dalam negeri menunjukkan performa yang sebanding, bahkan melampaui, model-model internasional dalam tugas-tugas diagnostik tertentu, terutama saat dihadapkan pada data pasien lokal.
Pengujian ini dilakukan oleh Dr. Michael Chen, peneliti postdoctoral di Stanford Center for AI in Medicine, bersama Dr. Sarah Wijaya, akademisi di UC Berkeley School of Public Health. Keduanya menilai sejumlah besar model AI medis yang dikembangkan oleh startup, universitas, dan rumah sakit di Indonesia. Fokus utama pengujian adalah kemampuan model dalam melakukan diagnosis penyakit tropis, membaca hasil rontgen paru, serta mendeteksi risiko diabetes dan hipertensi berdasarkan data rekam medis elektronik.
Metodologi yang digunakan cukup ketat. Para peneliti mengumpulkan sampel data klinis dari lima rumah sakit besar di Jakarta, Surabaya, dan Makassar, kemudian menguji setiap model AI dengan data tersebut. Mereka juga membandingkan performa model-model Indonesia dengan model AI medis global seperti Med-PaLM 2 dan GPT-4 Medis. Parameter yang diukur meliputi akurasi, sensitivitas, spesifisitas, dan waktu inferensi.
Keunggulan Model Lokal pada Data Tropis
Dalam kategori diagnosis penyakit tropis seperti demam berdarah, malaria, dan tuberkulosis, model AI Indonesia mencatat akurasi rata-rata 94,7 persen, sementara model internasional hanya mencapai 88,2 persen. Selisih ini signifikan secara statistik. Menurut Chen, penyebab utamanya adalah model lokal dilatih dengan dataset yang mencerminkan kondisi demografis, genetik, dan lingkungan Indonesia.
"Model internasional dilatih dengan data pasien dari Amerika Serikat dan Eropa. Ketika dihadapkan pada pasien Indonesia dengan pola gejala yang berbeda, performanya menurun," ujar Chen dalam keterangan tertulis. "Sebaliknya, model yang dikembangkan di Indonesia memahami konteks lokal, termasuk prevalensi penyakit, variasi genetik, dan bahkan perbedaan pola rujukan antar-daerah."
Pada tugas pembacaan rontgen paru untuk deteksi tuberkulosis, model buatan Indonesia unggul tipis dengan akurasi 96,1 persen berbanding 95,4 persen milik model global. Namun, keunggulan yang lebih mencolok terlihat pada deteksi dini risiko diabetes dan hipertensi berbasis data laboratorium. Model Indonesia mencapai akurasi 91,3 persen, sedangkan model internasional hanya 84,9 persen.
Keterbatasan dan Tantangan
Meski demikian, pengujian ini juga mengungkap sejumlah kelemahan. Beberapa model AI Indonesia masih memiliki keterbatasan dalam hal generalisasi. Model yang dilatih dengan data dari Jawa belum tentu bekerja optimal pada data pasien dari Papua atau Nusa Tenggara Timur. Selain itu, banyak model yang diuji belum melalui validasi klinis prospektif, sehingga belum bisa direkomendasikan untuk digunakan secara langsung dalam praktik medis sehari-hari.
"Kami menemukan bahwa sebagian model memiliki bias terhadap kelompok usia tertentu. Ada juga model yang performanya turun drastis ketika diuji dengan data dari fasilitas kesehatan primer yang peralatannya lebih sederhana," kata Sarah Wijaya. "Ini bukan berarti model-model tersebut buruk, tetapi menunjukkan perlunya pengujian yang lebih beragam dan representatif."
Wijaya menambahkan bahwa tantangan terbesar bukan pada kemampuan teknis, melainkan pada ekosistem pendukung. Kurangnya standar validasi, terbatasnya akses ke data klinis yang terkurasi, serta minimnya kolaborasi lintas institusi menjadi penghambat utama pengembangan AI medis di Indonesia. Padahal, potensi yang dimiliki sangat besar mengingat besarnya kebutuhan tenaga medis dan luasnya wilayah geografis Indonesia.
Implikasi bagi Kebijakan Kesehatan
Hasil pengujian ini memberikan implikasi penting bagi kebijakan kesehatan di Indonesia. Pemerintah dinilai perlu mendorong pengembangan AI medis berbasis data lokal, memperkuat regulasi, serta membangun infrastruktur data kesehatan yang terintegrasi. Kerja sama antara universitas, rumah sakit, dan industri juga perlu difasilitasi agar inovasi yang dihasilkan dapat diuji secara klinis dan diadopsi secara luas.
Kementerian Kesehatan RI disebut tengah menyusun kerangka regulasi untuk penggunaan AI dalam layanan kesehatan. Regulasi ini diharapkan mengatur standar keamanan, etika, perlindungan data pasien, serta mekanisme audit berkala terhadap model AI yang digunakan di fasilitas kesehatan.
Chen dan Wijaya merekomendasikan pembentukan konsorsium nasional AI medis yang melibatkan berbagai pemangku kepentingan. Konsorsium ini bertugas mengembangkan dataset nasional yang representatif, menetapkan tolok ukur evaluasi, dan memfasilitasi transfer pengetahuan antar-institusi. Mereka juga menekankan pentingnya pelibatan dokter dan tenaga kesehatan dalam proses pengembangan agar model yang dihasilkan benar-benar sesuai dengan kebutuhan klinis.
Meski masih menghadapi berbagai tantangan, hasil pengujian ini menunjukkan bahwa Indonesia memiliki modal kuat untuk menjadi pemain penting dalam pengembangan AI medis di kawasan Asia Tenggara. Keunggulan pada data lokal menjadi nilai tambah yang tidak dimiliki oleh model internasional. Dengan pengembangan yang terarah dan dukungan kebijakan yang tepat, AI medis buatan Indonesia berpotensi meningkatkan akses dan kualitas layanan kesehatan bagi jutaan masyarakat.
Komentar (0)