Büyük Dil Modellerinin Derinlemesine İncelenmesi
ChatGPT ile ilk karşılaştığınızda nasıl hissettiniz? Muhtemelen büyülendiniz, şaşırdınız, hatta biraz korktuğunuz bile olmuş olabilir. Bu "dijital sihirbazlar" gerçekten de olağanüstü yetenekler sergiliyor, ancak perde arkasında neler oluyor?
Büyük Dil Modelleri (BDM'ler veya İngilizce kısaltmasıyla LLM'ler) nasıl bu kadar akıllı davranabiliyor ve sınırları nerede? Bu soruların yanıtlarını anlamak, sadece merak giderme meselesi değil. Bu güçlü araçları etkili kullanabilmek için içyapılarını, çalışma prensiplerini ve sınırlarını bilmek şart.

by Mert Erkal

Sunum İçeriği
Ön Eğitim Aşaması
İnternetin sıkıştırılması, veri toplama ve işleme, tokenizasyon ve sinir ağı eğitimi
Eğitim Sonrası Aşama
Asistan modellerin doğuşu, denetimli ince ayar, pekiştirici öğrenme ve insan geribildirimi
BDM'lerin "Psikolojisi"
Halüsinasyonlar, zihinsel kapasiteler, kimlik yanılsaması ve rastgele açıklar
Gelecek Vizyonları
Çoklu modalite, ajanlar, yaygınlaşma ve çalışma zamanı eğitimi
Ön Eğitim: İnternetin Sıkıştırılması
Veri Toplama ve İşleme
BDM'lerin eğitimi için gereken hammadde, internetin kendisidir. Common Crawl gibi organizasyonlar, 2024 itibarıyla 2.7 milyar web sayfasını sistematik olarak tarıyor ve bu muazzam bilgi okyanusunu topluyor.
Agresif filtreleme ve tekilleştirme süreci ile spam siteler, kötü amaçlı yazılımlar, ırkçı içerikler ve yetişkin materyaller dikkatli bir süzgeçten geçiriliyor. FineWeb veri seti 44 terabayt gibi yönetilebilir bir boyuta ulaşıyor.
Sinir Ağı Eğitimi
Tokenizasyon ile metinler makinenin anlayabileceği parçalara dönüştürülüyor. GPT-4'ün kelime haznesinde 100.277 farklı token var. FineWeb veri seti bu dönüşümden sonra 15 trilyon tokenlık devasa bir puzzle'a dönüşüyor.
Sinir ağı, milyarlarca token arasındaki gizli bağlantıları öğreniyor. GPU'ların paralel işlem gücüyle bu süreç milyarlarca kez tekrarlanıyor ve ortaya bir temel model çıkıyor.
Tokenizasyon: Makinenin Dili
Metin Parçalama
Sinir ağları, bizim konuştuğumuz dili doğrudan anlayamaz. Bu yüzden metinleri token denilen küçük parçacıklara dönüştürmek gerekiyor. Başlangıçta 0 ve 1'lerle başlayan bu süreç, Byte Pair Encoding (BPE) gibi gelişmiş algoritmalarla çok daha sofistike hale geldi.
Token Hazinesi
GPT-4'ün kelime haznesinde 100.277 farklı token bulunuyor. Bu tokenler, kelimelerin yanı sıra hece ve karakter düzeyinde parçaları da içeriyor. Böylece model, daha önce hiç görmediği kelimeleri bile işleyebiliyor.
Devasa Veri Dönüşümü
FineWeb veri seti tokenizasyon sonrası 15 trilyon tokenlık bir yapıya dönüşüyor. Bu, modelin öğrenmesi gereken devasa bir puzzle anlamına geliyor. Her token, modelin dünyayı anlamasına katkıda bulunan bir yapı taşı görevi görüyor.
Sinir Ağı Eğitimi: İstatistiksel Öğrenmenin Büyüsü
Veri İnceleme
Model, 8.000 tokena kadar değişebilen "pencereler" halinde verileri inceliyor. Bu, modelin bir seferde görebildiği ve işleyebildiği metin miktarını belirliyor.
Tahmin Etme
Her seferinde bir sonraki tokenı tahmin etmeye çalışıyor. Amaç basit ama karmaşık: "Bu tokenden sonra hangi token gelme olasılığı en yüksek?"
Hata Düzeltme
Yanılıyor, düzeliyor, tekrar deniyor. Bu süreç milyarlarca kez tekrarlanıyor ve model her seferinde biraz daha iyileşiyor.
Temel Model Oluşumu
Bu yoğun eğitimin sonunda ortaya çıkan şey, bir temel model. İnternetin kayıplı bir sıkıştırması gibi çalışan, herhangi bir belge stilini taklit edebilen dev bir token simülatörü.
Eğitim Sonrası: Asistan Modellerin Doğuşu

Temel Model
İnternet belgelerinin örüntülerini ezberleyen sistem
Denetimli İnce Ayar
İnsan-asistan konuşmalarıyla eğitim
Pekiştirici Öğrenme
Gerçek problem çözücü haline gelme
İnsan Geribildirimi
İnsan zevkini ve tercihlerini öğrenme
Temel model harika bir "internet taklit makinesi" olsa da, sorularınıza mantıklı cevaplar veren bir asistan olarak kullanışlı değil. İkinci aşama, modeli gerçek bir asistana dönüştürüyor. Bu süreçte model, bir asistan kişiliği ediniyor ve insan etiketleyicilerin davranış kalıplarını benimsiyor.
Denetimli İnce Ayar: Kişilik Kazanma
İnsan-Asistan Konuşmaları
Bu aşamada model, internet belgeleri yerine özel olarak hazırlanmış insan-asistan konuşmalarıyla eğitiliyor. Şirketlerin "yardımsever, dürüst ve zararsız" gibi değerleri doğrultusunda, insan etiketleyiciler binlerce örnek konuşma yaratıyor.
Hızlı Dönüşüm
Modern yaklaşımda mevcut BDM'ler de bu sürece dahil ediliyor. SFT süreci, ön eğitime göre çok daha kısa (sadece 3 saat gibi) ama sonucu dramatik. Model, bir asistan kişiliği ediniyor.
İstatistiksel Simülasyon
İlginç gerçek: ChatGPT ile konuştuğunuzda, aslında OpenAI'da çalışan veri etiketleyicilerinin istatistiksel bir simülasyonuyla etkileşime giriyorsunuz. Model, bu etiketleyicilerin davranış kalıplarını benimsiyor.
Pekiştirici Öğrenme: Düşünmeyi Öğrenmek
1
Problem Çözücü Dönüşüm
RL, modeli salt taklit etmekten çıkarıp gerçek problem çözücü haline getiren devrimci aşama. Tıpkı okulda alıştırma soruları çözen bir öğrenci gibi, model bir problem için birden fazla çözüm üretiyor.
2
Düşünce Zincirleri
Bu süreçte model, insan etiketleyicilerin asla öğretemeyeceği "düşünce zincirleri" geliştiriyor. DeepSeek R1 gibi modellerde gözlemlenen bu fenomen gerçekten büyüleyici: Model bir problemi farklı açılardan inceliyor.
3
Sınırsız Potansiyel
AlphaGo'nun satranç ve Go oyunlarında insanları geçmesi gibi, RL'nin BDM'lerdeki potansiyeli de sınırsız görünüyor. Doğru yaklaşımları pekiştirilirken yanlış olanlar zayıflatılıyor.
İnsan Geribildirimi ile Pekiştirici Öğrenme (RLHF)

İnsan Zevkini Öğrenmek
Öznel kalite değerlendirmesi
Ödül Modeli
İnsan tercihlerini simüle etme
Adversarial Örnekler
Sistemin zayıf noktaları
Yaratıcı yazım, mizah, özetleme gibi konularda "kalite" öznel bir kavramdır. RLHF bu noktada devreye giriyor. Sistem, ayrı bir "ödül modeli" eğiterek insan tercihlerini simüle ediyor. İnsan değerlendiriciler modelin farklı çıktılarını sıralıyor, ödül modeli bu tercihleri öğreniyor.
Ancak burada bir tuzak var: Ödül modeli de bir sinir ağı olduğu için "kandırılabilir". Model, insanlar için anlamsız ama ödül modeli için cazip gelen "adversarial örnekler" üretebiliyor. Bu nedenle RLHF sınırlı süreyle ve dikkatli kullanılıyor.
BDM'lerin "Psikolojisi" ve Sınırlılıkları
Halüsinasyonlar
Bilmedikleri konularda bile büyük bir kendinden eminlikle tamamen uydurma bilgiler üretebilme
Zihinsel Kapasiteler
Her token üretimi için sınırlı hesaplama, karmaşık problemleri çözmek için muhakemelerini birden çok tokene yayma ihtiyacı
Kimlik Yanılsaması
Kalıcı benlik algısı yok, her konuşmada sıfırdan "boot" edilme
İsviçre Peyniri Modeli
Çoğu alanda muhteşem performans sergilerken, beklenmedik ve rastgele noktalarda basit hatalar yapabilme
Halüsinasyonlar ve Çözüm Stratejileri
"Bilmiyorum" Yanıtları
Modellerin eğitim setine, gerçekten bilmedikleri durumlarda dürüstçe "bilmiyorum" demelerini sağlayan örnekler ekleniyor. Bu, halüsinasyonları azaltmanın en temel yollarından biri.
Web Araması
Model, web araması gibi harici araçlara erişerek hafızasını tazeyleyebiliyor. search_start gibi özel tokenlarla arama tetikleniyor, güncel bilgi çalışma belleğine yerleştiriliyor.
Kod Yorumlayıcıları
Karmaşık matematik veya hesaplamalar için Python gibi kod yorumlayıcıları kullanılabiliyor. Bu, modelin doğru ve kesin sonuçlar üretmesine yardımcı oluyor.
Zihinsel Kapasiteler ve Kimlik Yanılsaması
Geleceğin Vizyonları
Çoklu Modalite
Yakın gelecekte modeller sadece metni değil, sesi ve görüntüleri de doğal olarak işleyecek. Ses ve görüntü verilerini tokenlaştırarak mevcut mimariye entegre etmek mümkün olacak.
Ajanlar ve Yaygınlaşma
Modeller, uzun süreli ve karmaşık görevleri insan gözetiminde yürüten otonom "ajanlar" olarak çalışacak. BDM'ler araçlara daha derinden entegre olacak, klavye ve fare hareketlerini taklit ederek bilgisayarınızda direktif eylemler gerçekleştirebilecekler.
Çalışma Zamanı Eğitimi
Şu anda modeller eğitim sonrası sabit. Gelecekte, gerçek zamanlı öğrenme yeteneğine sahip, sürekli gelişen sistemler görebiliriz. Bu, modellerin kullanıcılarından öğrenerek kişiselleştirilmiş deneyimler sunmasını sağlayacak.
Sonuç: Yapay Zekanın Yeni Ufukları
2025
Hala Yeni
BDM alanı 2025 başları itibarıyla hala çok yeni ve deneysel. Özellikle Pekiştirici Öğrenme gibi alanlarda keşfedilmeyi bekleyen sonsuz potansiyel var.
44TB
Veri Boyutu
FineWeb gibi kaliteli bir veri seti 44 terabayt boyutunda. Bu, milyarlarca web sayfasından distile edilmiş, en kaliteli ve çeşitli belgelerin koleksiyonu.
100K+
Token Sayısı
GPT-4'ün kelime haznesinde 100.277 farklı token var. Bu, modelin anlayabileceği ve üretebileceği kelime ve kavramların çeşitliliğini gösteriyor.
BDM'ler iş akışlarımızı dramatik şekilde hızlandıran güçlü araçlar. Ancak stokastik sistemler oldukları için ürettikleri her bilgiyi kontrol etmek ve doğrulamak hayati önem taşıyor. İlham almak, ilk taslaklar oluşturmak, karmaşık problemleri parçalara ayırmak için mükemmel araçlar - ama nihai sorumluluk her zaman bizde.
Sonuç olarak, Büyük Dil Modelleri yapay zeka tarihinin en heyecan verici dönemini temsil ediyor. Yetenekleri büyülü olsa da, onları birer araç olarak görmeli, sınırlarının farkında olarak dikkatli kullanmalıyız. Çünkü bu teknoloji henüz hikayesinin başında - asıl büyü daha yeni başlıyor.