Mengenal Mixture of Experts (MoE), Teknologi yang Membuat AI Besar Lebih Efisien

Daftar Isi

 

Mengenal Mixture of Experts (MoE), Teknologi yang Membuat AI Besar Lebih Efisien



Model kecerdasan buatan atau AI semakin besar dari waktu ke waktu. Jumlah parameter yang dimiliki model bahasa modern dapat mencapai puluhan hingga ratusan miliar, bahkan lebih. Secara sederhana, semakin banyak parameter yang tersedia, semakin besar pula kapasitas model untuk mempelajari pola bahasa, pengetahuan, penalaran, dan berbagai jenis tugas.

Namun, ada masalah besar di balik perkembangan tersebut.

Jika semua parameter harus digunakan setiap kali AI memproses sebuah pertanyaan, kebutuhan komputasinya akan ikut membengkak. Model memang memiliki kapasitas sangat besar, tetapi biaya untuk menjalankannya juga menjadi semakin tinggi.

Di sinilah konsep Mixture of Experts atau MoE menjadi menarik.

Alih-alih mengaktifkan seluruh bagian model untuk setiap input, MoE memungkinkan AI memilih hanya sebagian jaringan yang dianggap paling relevan untuk menangani token tertentu. Dengan cara tersebut, sebuah model dapat memiliki jumlah parameter yang sangat besar tanpa harus menggunakan seluruhnya dalam setiap proses.

Konsep ini menjadi salah satu pendekatan penting dalam pengembangan large language model (LLM) modern.

Apa Itu Mixture of Experts?

Mixture of Experts dapat diterjemahkan secara sederhana sebagai “campuran para ahli”.

Bayangkan sebuah perusahaan memiliki ratusan karyawan dengan keahlian berbeda. Ada yang ahli matematika, programmer, penerjemah bahasa, penulis, analis data, dan sebagainya.

Ketika perusahaan menerima sebuah pekerjaan, tentu tidak semua karyawan harus mengerjakannya sekaligus. Jika tugasnya menerjemahkan dokumen Mandarin, perusahaan cukup memilih orang yang memiliki keahlian terkait.

MoE menggunakan konsep yang mirip.

Sebuah model AI memiliki banyak subnetwork yang disebut expert. Masing-masing expert dapat belajar menjadi lebih baik dalam pola atau jenis informasi tertentu selama proses training.

Ketika sebuah token masuk ke model, sistem tidak langsung mengirimnya ke semua expert. Ada mekanisme bernama gating network atau router yang menentukan expert mana yang paling sesuai untuk memproses token tersebut.

Dengan demikian, kapasitas keseluruhan model dapat sangat besar, tetapi komputasi pada setiap langkah tetap dibatasi.

Empat Komponen Utama MoE

Arsitektur MoE pada dasarnya memiliki beberapa bagian penting.

Pertama adalah expert, yaitu subnetwork yang melakukan pemrosesan terhadap token. Sebuah model dapat memiliki banyak expert dalam satu atau beberapa lapisan.

Kedua adalah router atau gating network. Bagian inilah yang menentukan expert mana yang akan menerima token tertentu.

Ketiga adalah sparse activation. Tidak semua expert diaktifkan sekaligus. Hanya sebagian kecil yang dipilih berdasarkan keputusan router.

Keempat adalah output combination, yaitu proses menggabungkan hasil dari expert yang dipilih menjadi keluaran untuk melanjutkan proses di jaringan berikutnya.

Empat komponen tersebut membuat MoE berbeda dari model dense tradisional yang pada dasarnya menggunakan bagian jaringan yang jauh lebih luas untuk setiap input.

Baca juga : 5 Fungsi Port USB-C di iPad yang Jarang Diketahui, Bukan Cuma Buat Charging

Bagaimana MoE Memproses Pertanyaan?

Untuk memahami mekanismenya, bayangkan pengguna memberikan pertanyaan panjang kepada sebuah chatbot.

Pertanyaan tersebut akan dipecah menjadi unit-unit yang disebut token. Token-token tersebut kemudian diproses melalui berbagai bagian model, termasuk mekanisme self-attention yang juga umum digunakan pada arsitektur transformer.

Setelah itu, pada bagian MoE, router menganalisis informasi yang diterima dari token tersebut.

Router kemudian menentukan expert yang dianggap paling sesuai.

Misalnya, secara ilustratif, sebuah model memiliki 64 expert tetapi hanya memilih beberapa expert untuk setiap token. Token yang berhubungan dengan matematika mungkin mendapatkan jalur pemrosesan yang berbeda dibandingkan token yang berkaitan dengan pemrograman atau bahasa.

Yang perlu dipahami, pembagian tersebut tidak harus sesederhana “expert matematika” atau “expert bahasa Indonesia”. Spesialisasi expert di dalam model biasanya jauh lebih kompleks dan terbentuk selama training.

Setelah expert menyelesaikan pemrosesannya, hasilnya dikombinasikan dan diteruskan ke bagian model berikutnya.

Proses routing tersebut dapat terjadi berulang kali pada berbagai lapisan MoE.

Mengapa Tidak Mengaktifkan Semua Expert Saja?

Pertanyaan ini menjadi inti dari keunggulan MoE.

Misalnya sebuah model mempunyai 100 miliar parameter. Dalam model dense, sebagian besar parameter tersebut harus terlibat dalam proses komputasi setiap kali model menerima input.

Sementara pada MoE, model dapat memiliki total parameter yang sangat besar tetapi hanya mengaktifkan sebagian parameter untuk setiap token.

Dengan kata lain, jumlah parameter total dan jumlah parameter aktif bukanlah hal yang sama.

Sebuah model dapat mempunyai kapasitas parameter yang sangat besar, tetapi biaya komputasinya tidak harus setara dengan menjalankan seluruh parameter tersebut setiap saat.

Inilah yang membuat MoE menarik untuk membangun model AI dengan kapasitas besar tanpa meningkatkan kebutuhan komputasi secara linear.

Namun, bukan berarti MoE otomatis murah atau sederhana. Ada tantangan lain yang muncul, terutama dalam distribusi data dan komunikasi antar-GPU.

Router Harus Pintar Memilih Expert

Router merupakan salah satu komponen paling penting dalam MoE.

Jika router selalu mengirim hampir semua token ke expert yang sama, maka expert tersebut akan menerima beban terlalu besar. Expert lainnya justru kurang digunakan.

Situasi tersebut dapat menciptakan masalah yang disebut load imbalance.

Bayangkan sebuah restoran mempunyai 20 kasir, tetapi semua pelanggan diarahkan ke satu kasir. Secara teori restoran memiliki banyak kasir, tetapi kapasitas keseluruhannya tidak dimanfaatkan dengan baik.

Hal serupa dapat terjadi pada MoE.

Karena itu, proses training perlu memperhatikan keseimbangan beban antar-expert. Model harus belajar bukan hanya memilih expert yang tepat, tetapi juga mendistribusikan pekerjaan secara efektif.

Teknik load balancing digunakan untuk membantu mencegah satu kelompok expert menjadi terlalu populer sementara expert lain jarang mendapatkan pekerjaan.

MoE Tidak Berarti Expert Benar-Benar Seperti Manusia

Istilah “expert” terkadang membuat orang membayangkan bahwa satu expert secara eksplisit diprogram sebagai “ahli matematika”, sementara expert lain menjadi “ahli sejarah”.

Kenyataannya tidak sesederhana itu.

Spesialisasi expert biasanya muncul dari proses training. Model menemukan sendiri pola internal yang membuat beberapa expert cenderung menangani jenis representasi atau token tertentu.

Artinya, kita tidak selalu dapat melihat satu expert kemudian mengatakan secara pasti bahwa expert tersebut khusus menguasai satu bidang tertentu.

Spesialisasi itu lebih bersifat internal dan statistik.

Tantangan Saat MoE Dijalankan di Banyak GPU

Keuntungan MoE juga membawa tantangan baru.

Model AI berukuran sangat besar biasanya dijalankan menggunakan banyak GPU sekaligus. Expert dapat ditempatkan di GPU yang berbeda.

Ketika router memilih expert, token harus dikirim ke GPU tempat expert tersebut berada.

Setelah expert selesai memproses token, hasilnya perlu dikirim kembali dan digabungkan sebelum proses berlanjut.

Aktivitas perpindahan data ini membutuhkan bandwidth komunikasi yang sangat besar.

Jadi, persoalannya bukan hanya seberapa cepat sebuah GPU menghitung. Sistem juga harus mampu memindahkan data antar-GPU dengan cepat.

Jika komunikasi terlalu lambat, waktu yang diperoleh dari sparse computation bisa berkurang karena sistem justru menunggu perpindahan data.

Inilah alasan infrastruktur AI modern tidak hanya berfokus pada kemampuan satu chip, tetapi juga koneksi antar-chip, memori, jaringan, dan sistem rack secara keseluruhan.

MoE dan Efisiensi Inference

Keuntungan MoE semakin terasa ketika model digunakan dalam skala besar.

Inference adalah tahap ketika model yang sudah dilatih digunakan untuk menghasilkan jawaban. Setiap kali pengguna mengirim pertanyaan, model harus melakukan inference.

Jika model memiliki banyak pengguna secara bersamaan, kebutuhan komputasi bisa sangat besar.

Dengan hanya mengaktifkan sebagian expert, MoE dapat mengurangi jumlah komputasi yang diperlukan dibandingkan jika seluruh jaringan aktif pada setiap token.

Hal tersebut berpotensi meningkatkan throughput, yaitu jumlah token yang dapat diproses sistem dalam periode tertentu.

Efisiensi ini menjadi sangat penting bagi perusahaan yang menjalankan layanan AI dengan jutaan atau bahkan lebih banyak permintaan.

Contoh Model yang Menggunakan MoE

Arsitektur MoE kini digunakan oleh berbagai model AI modern.

Salah satu nama yang sering dikaitkan dengan pendekatan ini adalah DeepSeek-R1. Model tersebut menggunakan arsitektur yang memungkinkan kapasitas model tetap besar sementara komputasi aktif per token lebih terbatas dibandingkan model dense dengan kapasitas total yang sama.

Pendekatan MoE juga digunakan oleh berbagai model bahasa besar lainnya.

Kehadiran MoE menunjukkan bahwa perkembangan AI tidak hanya bergantung pada membuat model semakin besar. Cara model menggunakan parameter juga sama pentingnya.

Daripada sekadar menambahkan parameter secara terus-menerus, pengembang mencari cara agar kapasitas besar tersebut dapat dimanfaatkan secara selektif.

Apakah MoE Selalu Lebih Baik?

Tidak juga.

MoE menawarkan keuntungan besar dalam hal skalabilitas dan efisiensi komputasi tertentu, tetapi arsitekturnya lebih kompleks.

Pengembang harus menghadapi persoalan routing, load balancing, komunikasi antar-GPU, kapasitas memori, hingga optimasi software dan hardware.

Selain itu, performa model tidak ditentukan oleh arsitektur MoE saja. Kualitas data training, desain model, algoritma optimasi, jumlah parameter aktif, dan berbagai faktor lainnya juga berpengaruh.

Jadi, MoE bukan tombol ajaib yang otomatis membuat setiap AI menjadi lebih pintar.

Masa Depan AI Makin Bergantung pada Efisiensi

Perkembangan model AI menunjukkan sebuah paradoks. Model harus semakin besar untuk meningkatkan kapasitas, tetapi semakin besar model juga berarti kebutuhan komputasi semakin tinggi.

MoE menawarkan salah satu cara untuk mengatasi masalah tersebut.

Dengan membangun banyak expert dan menggunakan router untuk memilih bagian yang relevan, model dapat memiliki kapasitas keseluruhan yang sangat besar tanpa harus mengaktifkan seluruh jaringan untuk setiap token.

Konsepnya sebenarnya cukup sederhana: tidak semua pekerjaan membutuhkan semua orang.

AI cukup memilih “tim” yang dianggap paling sesuai untuk setiap bagian tugas, kemudian menggabungkan hasilnya menjadi satu keluaran.

Di balik konsep sederhana tersebut terdapat sistem yang sangat kompleks, mulai dari training router, spesialisasi expert, load balancing, komunikasi antar-GPU, hingga optimasi infrastruktur data center.

Karena itulah Mixture of Experts menjadi salah satu teknologi penting dalam perlombaan membangun AI yang semakin besar, tetapi tetap dapat dijalankan secara efisien. Bukan sekadar soal membuat model memiliki lebih banyak parameter, melainkan bagaimana parameter tersebut digunakan secara cerdas.

Posting Komentar