← Semua pembelajaran / AI Engineer Nol → Production
Fase 0 · Dasar AI & Profesi AI Engineer

Apa itu LLM dan bagaimana ia bekerja

Semua yang terasa ajaib dari LLM — ia bisa menulis kode, menjawab pertanyaan, menerjemahkan bahasa — berasal dari satu mekanisme yang sangat sederhana diulang triliunan kali: memprediksi token berikutnya.

Sumber asli docs.claude.com Resmi Rangkuman ~7 menit baca

Intisari

  • LLM tidak 'mengerti' teks seperti manusia. Ia memprediksi token berikutnya yang paling mungkin, satu per satu, berdasarkan token sebelumnya.
  • Token adalah potongan teks (bukan selalu satu kata) — kata umum jadi satu token, kata jarang dipecah jadi beberapa token.
  • Training punya dua tahap: pretraining (belajar pola bahasa dari teks masif) lalu fine-tuning/RLHF (dibentuk supaya mengikuti instruksi dan aman dipakai).
  • Context window adalah batas jumlah token yang bisa 'dilihat' model dalam satu kali panggilan — di luar itu, model tidak tahu apa-apa.
  • Halusinasi bukan bug langka — ia konsekuensi langsung dari cara kerja prediksi token: model selalu menghasilkan jawaban yang terdengar masuk akal, bukan yang diverifikasi benar.

Mesin prediksi kata berikutnya, diulang

Inti dari setiap LLM sebenarnya sesederhana ini: diberi urutan teks, model memprediksi token apa yang paling mungkin muncul selanjutnya. Untuk menghasilkan satu kalimat, model mengulang proses ini berkali-kali — memprediksi satu token, menambahkannya ke teks, lalu memprediksi token berikutnya berdasarkan teks yang sudah lebih panjang itu.

Input:  "Ibu kota Indonesia adalah"
Model memprediksi token berikutnya yang paling mungkin: " Jakarta" (probabilitas tinggi)
Input:  "Ibu kota Indonesia adalah Jakarta"
Model memprediksi token berikutnya: "." (probabilitas tinggi, kalimat selesai)

Ini kenapa LLM terasa berbeda dari kalkulator. Kalkulator memberi jawaban yang benar atau salah secara pasti. LLM memberi jawaban yang paling mungkin secara statistik berdasarkan pola dari data latihannya. Untuk sebagian besar bahasa sehari-hari, dua hal itu nyaris tidak bisa dibedakan — tapi untuk fakta yang jarang muncul di data latihan, "paling mungkin secara statistik" bisa jadi salah sambil tetap terdengar sangat yakin. Itulah halusinasi, dan itu bukan bug yang bisa "diperbaiki" begitu saja — ia sifat dasar arsitekturnya. Guardrails untuk menguranginya dibahas di Fase 2 dan 6.

Token: satuan yang dilihat model, bukan kata

Model tidak membaca huruf atau kata seperti manusia. Teks dipecah dulu jadi token — potongan yang bisa berupa satu kata umum, sebagian kata, atau bahkan satu tanda baca. Kata yang sering muncul biasanya jadi satu token utuh; kata yang jarang atau istilah teknis sering dipecah jadi beberapa token.

"kucing"          → 1 token   (kata umum)
"tokenisasi"      → 2-3 token (kata jarang, dipecah)
"Rp150.000,-"     → beberapa token (angka & simbol dipecah halus)
Kenapa token penting buat AI engineerKonsekuensinya
Harga API dihitung per token, bukan per karakter atau per requestPrompt yang bertele-tele langsung menambah biaya (Fase 7)
Context window diukur dalam token, bukan kataDokumen panjang bisa melebihi batas tanpa terasa dari jumlah "kata"-nya
Bahasa non-Inggris (termasuk Indonesia) sering butuh lebih banyak token untuk makna yang samaBiaya & kapasitas konteks efektif bisa berbeda antar bahasa

Dua tahap training

TahapYang terjadiHasilnya
PretrainingModel membaca porsi besar teks publik (buku, web, kode) dan belajar memprediksi token berikutnyaModel yang fasih menyambung kalimat, tapi belum tentu mau mengikuti instruksi atau menolak permintaan berbahaya
Fine-tuning / RLHFModel dilatih ulang dengan contoh percakapan yang mengikuti instruksi, dinilai manusia mana jawaban yang lebih baikModel "chat" yang terasa dipakai sekarang — mengikuti instruksi, sopan, punya guardrails bawaan

Model yang kamu panggil lewat API (Claude, GPT, dsb.) sudah melewati kedua tahap ini. Sebagai AI engineer, kamu tidak mengulangi proses ini — pekerjaanmu dimulai dari titik ini: memakai model yang sudah jadi, membentuk perilakunya lewat prompt (Fase 1) dan konteks yang kamu berikan (Fase 4–5), bukan melatih ulang bobotnya.

Context window: apa yang "dilihat" model

Setiap panggilan ke LLM dibatasi context window — jumlah token maksimum (input + output digabung) yang bisa diproses model dalam satu kali panggilan. Model Claude terbaru punya context window ratusan ribu token, tapi batasnya tetap ada.

Model tidak "mengingat" percakapan sebelumnya secara otomatis. Setiap panggilan API berdiri sendiri — model hanya tahu apa yang ada di dalam context window panggilan itu. Kalau kamu ingin chatbot yang "ingat" percakapan lima menit lalu, aplikasimu sendiri yang harus mengirim ulang riwayat percakapan itu di setiap panggilan. Ini dibahas konkret di Fase 6.

Latihan: buka Intro to Claude dan cari bagian yang menjelaskan model apa saja yang tersedia beserta ukuran context window-nya. Hitung kira-kira berapa halaman A4 teks yang muat dalam satu context window model yang paling besar.

Rangkuman ini sengaja dipangkas ke bagian yang dipakai di roadmap. Buka sumber aslinya saat kamu butuh detail lengkap atau referensi parameter.