Apa itu LLM dan bagaimana ia bekerja
Semua yang terasa ajaib dari LLM — ia bisa menulis kode, menjawab pertanyaan, menerjemahkan bahasa — berasal dari satu mekanisme yang sangat sederhana diulang triliunan kali: memprediksi token berikutnya.
Intisari
- LLM tidak 'mengerti' teks seperti manusia. Ia memprediksi token berikutnya yang paling mungkin, satu per satu, berdasarkan token sebelumnya.
- Token adalah potongan teks (bukan selalu satu kata) — kata umum jadi satu token, kata jarang dipecah jadi beberapa token.
- Training punya dua tahap: pretraining (belajar pola bahasa dari teks masif) lalu fine-tuning/RLHF (dibentuk supaya mengikuti instruksi dan aman dipakai).
- Context window adalah batas jumlah token yang bisa 'dilihat' model dalam satu kali panggilan — di luar itu, model tidak tahu apa-apa.
- Halusinasi bukan bug langka — ia konsekuensi langsung dari cara kerja prediksi token: model selalu menghasilkan jawaban yang terdengar masuk akal, bukan yang diverifikasi benar.
Mesin prediksi kata berikutnya, diulang
Inti dari setiap LLM sebenarnya sesederhana ini: diberi urutan teks, model memprediksi token apa yang paling mungkin muncul selanjutnya. Untuk menghasilkan satu kalimat, model mengulang proses ini berkali-kali — memprediksi satu token, menambahkannya ke teks, lalu memprediksi token berikutnya berdasarkan teks yang sudah lebih panjang itu.
Input: "Ibu kota Indonesia adalah"
Model memprediksi token berikutnya yang paling mungkin: " Jakarta" (probabilitas tinggi)
Input: "Ibu kota Indonesia adalah Jakarta"
Model memprediksi token berikutnya: "." (probabilitas tinggi, kalimat selesai)
Ini kenapa LLM terasa berbeda dari kalkulator. Kalkulator memberi jawaban yang benar atau salah secara pasti. LLM memberi jawaban yang paling mungkin secara statistik berdasarkan pola dari data latihannya. Untuk sebagian besar bahasa sehari-hari, dua hal itu nyaris tidak bisa dibedakan — tapi untuk fakta yang jarang muncul di data latihan, "paling mungkin secara statistik" bisa jadi salah sambil tetap terdengar sangat yakin. Itulah halusinasi, dan itu bukan bug yang bisa "diperbaiki" begitu saja — ia sifat dasar arsitekturnya. Guardrails untuk menguranginya dibahas di Fase 2 dan 6.
Token: satuan yang dilihat model, bukan kata
Model tidak membaca huruf atau kata seperti manusia. Teks dipecah dulu jadi token — potongan yang bisa berupa satu kata umum, sebagian kata, atau bahkan satu tanda baca. Kata yang sering muncul biasanya jadi satu token utuh; kata yang jarang atau istilah teknis sering dipecah jadi beberapa token.
"kucing" → 1 token (kata umum)
"tokenisasi" → 2-3 token (kata jarang, dipecah)
"Rp150.000,-" → beberapa token (angka & simbol dipecah halus)
| Kenapa token penting buat AI engineer | Konsekuensinya |
|---|---|
| Harga API dihitung per token, bukan per karakter atau per request | Prompt yang bertele-tele langsung menambah biaya (Fase 7) |
| Context window diukur dalam token, bukan kata | Dokumen panjang bisa melebihi batas tanpa terasa dari jumlah "kata"-nya |
| Bahasa non-Inggris (termasuk Indonesia) sering butuh lebih banyak token untuk makna yang sama | Biaya & kapasitas konteks efektif bisa berbeda antar bahasa |
Dua tahap training
| Tahap | Yang terjadi | Hasilnya |
|---|---|---|
| Pretraining | Model membaca porsi besar teks publik (buku, web, kode) dan belajar memprediksi token berikutnya | Model yang fasih menyambung kalimat, tapi belum tentu mau mengikuti instruksi atau menolak permintaan berbahaya |
| Fine-tuning / RLHF | Model dilatih ulang dengan contoh percakapan yang mengikuti instruksi, dinilai manusia mana jawaban yang lebih baik | Model "chat" yang terasa dipakai sekarang — mengikuti instruksi, sopan, punya guardrails bawaan |
Model yang kamu panggil lewat API (Claude, GPT, dsb.) sudah melewati kedua tahap ini. Sebagai AI engineer, kamu tidak mengulangi proses ini — pekerjaanmu dimulai dari titik ini: memakai model yang sudah jadi, membentuk perilakunya lewat prompt (Fase 1) dan konteks yang kamu berikan (Fase 4–5), bukan melatih ulang bobotnya.
Context window: apa yang "dilihat" model
Setiap panggilan ke LLM dibatasi context window — jumlah token maksimum (input + output digabung) yang bisa diproses model dalam satu kali panggilan. Model Claude terbaru punya context window ratusan ribu token, tapi batasnya tetap ada.
Model tidak "mengingat" percakapan sebelumnya secara otomatis. Setiap panggilan API berdiri sendiri — model hanya tahu apa yang ada di dalam context window panggilan itu. Kalau kamu ingin chatbot yang "ingat" percakapan lima menit lalu, aplikasimu sendiri yang harus mengirim ulang riwayat percakapan itu di setiap panggilan. Ini dibahas konkret di Fase 6.
Latihan: buka Intro to Claude dan cari bagian yang menjelaskan model apa saja yang tersedia beserta ukuran context window-nya. Hitung kira-kira berapa halaman A4 teks yang muat dalam satu context window model yang paling besar.
Rangkuman ini sengaja dipangkas ke bagian yang dipakai di roadmap. Buka sumber aslinya saat kamu butuh detail lengkap atau referensi parameter.