technology-ai

Büyük Dil Modeli Sistemleri: Çıkarım, Sunum, Ajanlar ve Üretim Yapay Zeka Altyapısı

Miles Thornton

Book 4#4

525

Sayfa

tr

Dil

2026

Yayınlandı

Yeni baskı

$2.00

EPUB örneğini webde oku

Kitap tanıtımı

Bir LLM'i eğitmek bir mühendislik başarısıdır. Onu binlerce kullanıcıya aynı anda, saniyeler içinde, kabul edilebilir bir maliyetle yanıt verebilen bir ürüne dönüştürmek bambaşka bir sınavdır. Okulda, derste veya online kursta öğrendikleriniz ile üretim sistemlerinin gerçeği arasındaki uçurum tam da burada başlar. İyi çalışan bir modelin, gerçek dünyada neden beklenmedik şekilde yavaş, maliyetli veya kırılgan olduğunu anlamak, çoğu zaman her şeyi bilen bir mimarın değil, kara kutuyla baş başa kalmış bir geliştiricinin işidir.

Bu kitap, o kara kutuyu açıyor. Yalnızca API çağıran biri olmaktan çıkıp, donanımdan platform katmanına kadar tüm yapay zeka yığınını tasarlayabilen bir mimar olmanızı sağlayacak yol haritasını sunuyor. Kitabın iddiası net: bir LLM isteğinin GPU üzerindeki yolculuğunu anlamadan, gecikme ve verim arasındaki ödünleşim iyi hesaplanmadan, devreye alınan hiçbir sistem uzun vadede ayakta kalamaz. Karmaşık görünen bu alan, temelde birkaç mimari prensibe indirgenebilir ve bu prensipler öğrenilebilir.

Gerçek verimlilik, tek bir donanım parçasına takılı kalmakla değil, sistemin tüm katmanlarını bir bütün olarak kavramakla başlar. • Modelin, eğitimden üretime geçerken neden yeniden düşünülmesi gereken bir yazılım parçası haline geldiğini ve 'üretim gereksinimleri' kavramının ne anlama geldiğini adım adım gösterir. • Bellek darboğazı olan KV önbelleğinin nasıl yönetileceğini ve bağlam boyutunun arttığı senaryolarda sistemin neden Out-of-Memory hatalarına sürüklendiğini, çözüm stratejileriyle birlikte açıklar. • Kuantizasyonu teorik bir kavram olmaktan çıkarıp INT8, INT4 ve modern algoritmaların (GPTQ, AWQ) doğruluk ve verimlilik üzerindeki gerçek etkilerini, üretim dağıtım formatlarıyla birlikte ele alır. • Yüksek trafik altında çalışan sistemler için dinamik batching, modern inference motorları (vLLM, SGLang) ve GPU havuzları üzerinden ölçeklendirme mimarilerini karşılaştırır. • Modelin sınırlı hafızasını aşmanın yolu olarak gömme modelleri, vektör arama algoritmaları ve hibrit RAG mimarileriyle ölçeklenebilir bilgi erişiminin nasıl kurulacağını anlatır. • Pasif metin üretiminden aktif problem çözüme geçişi, araç çağırma, ReAct deseni ve çoklu ajan orkestrasyonu sistemlerinin tasarımı üzerinden inceler. • Karşılaşılan halüsinasyon, prompt injection ve başarısız çıktılar gibi risklere karşı, değerlendirme ve güvenilirlik süreçlerinin nasıl bir güvence katmanı oluşturduğunu ve bu süreçlerin gözlemlenebilirlikle nasıl hayata geçirileceğini gösterir.

Bu kapsam, bir mühendisin saha deneyimiyle yazılmış bir rehberdir. Sistemi izlemekten olay müdahalesine, kapasite planlamasından model yönlendirmeye kadar, kurumsal ölçekte karşılaşabileceğiniz tüm süreçleri mimari bir bakış açısıyla ele alır. Kimileri için bu kitap, GPU belleği hesap yapmanın inceliklerini öğrenme rehberi; kimileri içinse, ekipler, bütçeler ve yasal uyumluluk gereksinimleriyle baş etmesi gereken bir platform mühendisi için el kitabı niteliğindedir.

Bu kitap, kariyerinde makine öğrenimi, yazılım mimarisi veya veri mühendisliği alanlarında ilerleyen ve üretim ortamında gerçekten çalışan LLM sistemleri kurmak isteyen hepiniz için tasarlanmıştır. Yalnızca teorik bilgiyi test etmekle kalmayıp, mevcut sistemlerinizin darboğazlarını tespit etmek için de sistematik bir çerçeve sunar. Kod örneklerinden çok, bu örneklerin arkasındaki 'neden'i anlamanızı sağlar ve böylece karşılaştığınız herhangi bir altyapı sorununu çözmek için doğru soruları sormanıza yardımcı olur.

Üretim yapay zeka altyapısı, büyük dil modeli sistemleri, çıkarım optimizasyonu ve ajan mimarileri hakkında size sağlam bir zihinsel model kazandırır. Bu okuma, mevcut hizmetlerinizi iyileştirmeniz veya sıfırdan yeni bir sistem inşa etmeniz gerekip gerekmediğine bakmaksızın, en kritik mimari kararları bilinçli ve veriye dayalı olarak alabilmeniz için gereken derinliği sağlar. Bu kitabı kapattığınızda, yalnızca daha iyi bir geliştirici değil, aynı zamanda daha donanımlı bir sistem düşünürü olacaksınız.

Kısa özet

Bu kitap, büyük dil modeli sistemlerinin üretimde nasıl çalıştırılacağını, ölçekleneceğini ve yönetileceğini anlatan kapsamlı bir teknik rehberdir.

Kitap, çıkarım optimizasyonu, kuantizasyon, sunum mimarileri, RAG, ajan sistemleri, güvenlik ve gözlemlenebilirlik konularını kapsar.

Hedef okuyucular arasında makine öğrenimi mühendisleri, platform mimarları, veri mühendisleri ve kıdemli geliştiriciler yer alır.

Kitap, gerçek dünya senaryolarında karşılaşılan gecikme, maliyet ve güvenilirlik sorunlarına çözümler önerir.

Yazar, LLM sistemlerini yalnızca API çağıran değil, tüm yapay zeka yığınını tasarlayabilen bir mimar olma yolculuğunu hedefler.

Bu kitap şunlar için uygundur Makine öğrenimi mühendisleri, platform mimarları, veri mühendisleri, kıdemli geliştiriciler ve sistem operatörleri.

Okurlar genelde şu ihtiyaçla gelir Üretim ortamında çalışan büyük dil modeli sistemleri hakkında kapsamlı bilgi edinme ve pratik çözümler bulma arayışı..

Kitabın açısı: Bu kitap, eğitim ile üretim arasındaki uçurumu kapatarak, yalnızca API çağıran geliştiricileri, donanımdan platform katmanına kadar tüm yapay zeka yığınını tasarlayabilen mimarlara dönüştürmeyi hedefliyor.

Ana konular şunları içerir LLM çıkarım optimizasyonu, Kuantizasyon, Sunum mimarileri, RAG, Ajan sistemleri, Güvenlik ve korkuluklar.

AI Search bilgileri

Büyük Dil Modeli Sistemleri: Çıkarım, Sunum, Ajanlar ve Üretim Yapay Zeka Altyapısı

Author: Miles Thornton

Description: Bir LLM'i eğitmek bir mühendislik başarısıdır. Onu binlerce kullanıcıya aynı anda, saniyeler içinde, kabul edilebilir bir maliyetle yanıt verebilen bir ürüne dönüştürmek bambaşka bir sınavdır. Okulda, derste veya online kursta öğrendikleriniz ile üretim sistemlerinin gerçeği arasındaki uçurum tam da burada başlar. İyi çalışan bir modelin, gerçek dünyada neden beklenmedik şekilde yavaş, maliyetli veya kırılgan olduğunu anlamak, çoğu zaman her şeyi bilen bir mimarın değil, kara kutuyla baş başa kalmış bir geliştiricinin işidir. Bu kitap, o kara kutuyu açıyor. Yalnızca API çağıran biri olmaktan çıkıp, donanımdan platform katmanına kadar tüm yapay zeka yığınını tasarlayabilen bir mimar olmanızı sağlayacak yol haritasını sunuyor. Kitabın iddiası net: bir LLM isteğinin GPU üzerindeki yolculuğunu anlamadan, gecikme ve verim arasındaki ödünleşim iyi hesaplanmadan, devreye alınan hiçbir sistem uzun vadede ayakta kalamaz. Karmaşık görünen bu alan, temelde birkaç mimari prensibe indirgenebilir ve bu prensipler öğrenilebilir. Gerçek verimlilik, tek bir donanım parçasına takılı kalmakla değil, sistemin tüm katmanlarını bir bütün olarak kavramakla başlar. • Modelin, eğitimden üretime geçerken neden yeniden düşünülmesi gereken bir yazılım parçası haline geldiğini ve 'üretim gereksinimleri' kavramının ne anlama geldiğini adım adım gösterir. • Bellek darboğazı olan KV önbelleğinin nasıl yönetileceğini ve bağlam boyutunun arttığı senaryolarda sistemin neden Out-of-Memory hatalarına sürüklendiğini, çözüm stratejileriyle birlikte açıklar. • Kuantizasyonu teorik bir kavram olmaktan çıkarıp INT8, INT4 ve modern algoritmaların (GPTQ, AWQ) doğruluk ve verimlilik üzerindeki gerçek etkilerini, üretim dağıtım formatlarıyla birlikte ele alır. • Yüksek trafik altında çalışan sistemler için dinamik batching, modern inference motorları (vLLM, SGLang) ve GPU havuzları üzerinden ölçeklendirme mimarilerini karşılaştırır. • Modelin sınırlı hafızasını aşmanın yolu olarak gömme modelleri, vektör arama algoritmaları ve hibrit RAG mimarileriyle ölçeklenebilir bilgi erişiminin nasıl kurulacağını anlatır. • Pasif metin üretiminden aktif problem çözüme geçişi, araç çağırma, ReAct deseni ve çoklu ajan orkestrasyonu sistemlerinin tasarımı üzerinden inceler. • Karşılaşılan halüsinasyon, prompt injection ve başarısız çıktılar gibi risklere karşı, değerlendirme ve güvenilirlik süreçlerinin nasıl bir güvence katmanı oluşturduğunu ve bu süreçlerin gözlemlenebilirlikle nasıl hayata geçirileceğini gösterir. Bu kapsam, bir mühendisin saha deneyimiyle yazılmış bir rehberdir. Sistemi izlemekten olay müdahalesine, kapasite planlamasından model yönlendirmeye kadar, kurumsal ölçekte karşılaşabileceğiniz tüm süreçleri mimari bir bakış açısıyla ele alır. Kimileri için bu kitap, GPU belleği hesap yapmanın inceliklerini öğrenme rehberi; kimileri içinse, ekipler, bütçeler ve yasal uyumluluk gereksinimleriyle baş etmesi gereken bir platform mühendisi için el kitabı niteliğindedir. Bu kitap, kariyerinde makine öğrenimi, yazılım mimarisi veya veri mühendisliği alanlarında ilerleyen ve üretim ortamında gerçekten çalışan LLM sistemleri kurmak isteyen hepiniz için tasarlanmıştır. Yalnızca teorik bilgiyi test etmekle kalmayıp, mevcut sistemlerinizin darboğazlarını tespit etmek için de sistematik bir çerçeve sunar. Kod örneklerinden çok, bu örneklerin arkasındaki 'neden'i anlamanızı sağlar ve böylece karşılaştığınız herhangi bir altyapı sorununu çözmek için doğru soruları sormanıza yardımcı olur. Üretim yapay zeka altyapısı, büyük dil modeli sistemleri, çıkarım optimizasyonu ve ajan mimarileri hakkında size sağlam bir zihinsel model kazandırır. Bu okuma, mevcut hizmetlerinizi iyileştirmeniz veya sıfırdan yeni bir sistem inşa etmeniz gerekip gerekmediğine bakmaksızın, en kritik mimari kararları bilinçli ve veriye dayalı olarak alabilmeniz için gereken derinliği sağlar. Bu kitabı kapattığınızda, yalnızca daha iyi bir geliştirici değil, aynı zamanda daha donanımlı bir sistem düşünürü olacaksınız.

AI summary: Bu kitap, büyük dil modeli tabanlı sistemlerin üretim ortamında tasarımı, ölçeklendirilmesi ve yönetimi üzerine kapsamlı bir rehber sunar. Çıkarım optimizasyonundan kuantizasyona, sunum mimarilerinden RAG ve ajan sistemlerine kadar uzanan bu eser, mühendislerin donanımdan platform katmanına kadar tüm yapay zeka yığınını anlamasını sağlar. Kitap, makine öğrenimi mühendisleri, platform mimarları ve sistem operatörleri gibi üretim yapay zeka altyapısıyla ilgilenen profesyonellere yöneliktir.

Uygun okuyucu
Makine öğrenimi mühendisleri, platform mimarları, veri mühendisleri, kıdemli geliştiriciler ve sistem operatörleri
Okur profili
LLM tabanlı üretim sistemleri tasarlayan veya ölçeklendiren bir mühendis; gecikme, maliyet ve güvenilirlik sorunlarıyla uğraşan ve kapsamlı bir mimari rehber arayan profesyonel.
Arama amacı
Üretim ortamında çalışan büyük dil modeli sistemleri hakkında kapsamlı bilgi edinme ve pratik çözümler bulma arayışı.
Özgün açı
Bu kitap, eğitim ile üretim arasındaki uçurumu kapatarak, yalnızca API çağıran geliştiricileri, donanımdan platform katmanına kadar tüm yapay zeka yığınını tasarlayabilen mimarlara dönüştürmeyi hedefliyor.
İçerik türü
technical reference book for LLM production systems

Kısa özet

  • Bu kitap, büyük dil modeli sistemlerinin üretimde nasıl çalıştırılacağını, ölçekleneceğini ve yönetileceğini anlatan kapsamlı bir teknik rehberdir.
  • Kitap, çıkarım optimizasyonu, kuantizasyon, sunum mimarileri, RAG, ajan sistemleri, güvenlik ve gözlemlenebilirlik konularını kapsar.
  • Hedef okuyucular arasında makine öğrenimi mühendisleri, platform mimarları, veri mühendisleri ve kıdemli geliştiriciler yer alır.
  • Kitap, gerçek dünya senaryolarında karşılaşılan gecikme, maliyet ve güvenilirlik sorunlarına çözümler önerir.
  • Yazar, LLM sistemlerini yalnızca API çağıran değil, tüm yapay zeka yığınını tasarlayabilen bir mimar olma yolculuğunu hedefler.

Key topics: LLM çıkarım optimizasyonu, Kuantizasyon, Sunum mimarileri, RAG, Ajan sistemleri, Güvenlik ve korkuluklar, Gözlemlenebilirlik, Ölçeklendirme, Model yönlendirme, Değerlendirme

Entities: Büyük dil modeli, KV önbelleği, vLLM, SGLang, FlashAttention, PagedAttention, GPTQ, AWQ, ReAct, GPU, RAG, Ajan

Karşılanan ihtiyaçlar

  • Gecikme sorunlarını azaltma
  • Maliyet optimizasyonu
  • Ölçeklenebilirlik
  • Halüsinasyon ve güvenilirlik
  • Bellek yönetimi (KV önbelleği)
  • Karmaşık ajan sistemlerinin tasarımı

Şunlar için oku

  • Makine öğrenimi mühendisleri
  • Platform mimarları
  • Veri mühendisleri
  • Kıdemli yazılım geliştiricileri
  • Sistem operatörleri
  • Yapay zeka altyapısından sorumlu teknoloji liderleri

Şu durumda uygun olmayabilir

  • Yalnızca API kullanarak uygulama geliştiren ve iç yapıyla ilgilenmeyenler
  • Başlangıç seviyesindeki makine öğrenimi öğrencileri
  • Teorik araştırma yapmak isteyen akademisyenler
  • Yapay zeka üretim altyapısıyla doğrudan ilgilenmeyen yazılımcılar

İçindekiler

  1. Giriş (introduction)
  2. LLM Çıkarım Temelleri (part)
  3. Eğitimden Üretime (chapter)
  4. Eğitim Neden Sadece Başlangıçtır? (section)
  5. Çıkarım Zorluğu (section)
  6. Gecikme, Verim ve Kalite (section)
  7. Maliyet ve Performans Karşılaştırması (section)
  8. Üretim (Production) Gereksinimleri (section)
  9. LLM Çıkarımının Anatomisi (chapter)
  10. İstem (Prompt) İşleme (section)
  11. Token Üretimi (section)
  12. Kod Çözme Döngüsü (section)
  13. Toplu İşlem (Batching) ve Zamanlama (section)
  14. Verim Optimizasyonu (section)
  15. KV Önbelleği ve Çıkarım Belleği (chapter)
  16. KV Önbelleği Neden Var? (section)
  17. Bağlam ile Bellek Büyümesi (section)
  18. Önbellek Tahsisi ve Yönetimi (section)
  19. Ön Ek ve Bağlam Yeniden Kullanımı (section)
  20. Uzun Bağlam Ödünleşimleri (Trade-Offs) (section)
  21. Kod Çözme ve Üretim Stratejileri (chapter)
  22. Açgözlü (Greedy) ve Işın (Beam) Araması (section)
  23. Sıcaklık, Top-k ve Top-p (section)
  24. Tekrar ve Üretim Kontrolleri (section)
  25. Yapılandırılmış ve Kısıtlı Üretim (section)
  26. Kalite ve Gecikme Ödünleşimleri (section)
  27. Verimli LLM Çıkarımı (part)
  28. Kuantizasyon Temelleri (chapter)
  29. Hassasiyet ve Model Belleği (section)
  30. FP32, FP16 ve BF16 (section)
  31. INT8 Kuantizasyonu (section)
  32. INT4 ve Düşük Bit Kuantizasyonu (section)
  33. Doğruluk ve Verimlilik Ödünleşimleri (section)
  34. Pratik Kuantizasyon Yöntemleri (chapter)
  35. Eğitim Sonrası Kuantizasyon (PTQ) (section)
  36. GPTQ (section)
  37. AWQ (section)
  38. Sadece Ağırlık ve Aktivasyon Kuantizasyonu (section)
  39. Kuantize Formatlar ve Dağıtım (section)
  40. Verimli Dikkat ve Uzun Bağlam (chapter)
  41. FlashAttention (section)
  42. Paged Attention (section)
  43. Kayan Pencere Dikkati (section)
  44. Uzun Bağlam Optimizasyonu (section)
  45. Bellek ve Hesaplama Ödünleşimleri (section)
  46. Üretimi Hızlandırma (chapter)
  47. Spekülatif Kod Çözme (section)
  48. Taslak ve Hedef Modeller (section)
  49. Ön Ek Önbelleğe Alma (section)
  50. Paralel ve Destekli Kod Çözme (section)
  51. Hızlandırma Teknikleri Ne Zaman İşe Yarar? (section)
  52. LLM'leri Ölçekte Sunma (part)
  53. LLM Sunum Mimarileri (chapter)
  54. Model Sunucuları ve API'ler (section)
  55. İstek Kuyrukları (section)
  56. Dinamik ve Sürekli Toplu İşlem (section)
  57. Çoklu Kiracı (Multi-Tenant) Sunumu (section)
  58. Üretim Sunum Kalıpları (section)
  59. Modern Çıkarım Motorları (chapter)
  60. Çıkarım Motorlarının Rolü (section)
  61. vLLM ve Paged Serving (section)
  62. SGLang ve Yapılandırılmış Yürütme (section)
  63. Yerel ve Hafif Sunum (section)
  64. Sunum Yığını (Stack) Seçimi (section)
  65. Çıkarım Hizmetlerini Ölçeklendirme (chapter)
  66. Yük Dengeleme (section)
  67. Yatay ve Dikey Ölçeklendirme (section)
  68. GPU Havuzları (section)
  69. Otomatik Ölçeklendirme (section)
  70. Kapasite Planlaması (section)
  71. Yönlendirme, Önbellekleme ve Model Seçimi (chapter)
  72. Model Yönlendirme (section)
  73. Anlamsal ve Yanıt Önbellekleme (section)
  74. Küçük ve Büyük Modeller (section)
  75. Yedekleme (Fallback) Stratejileri (section)
  76. Maliyet Farkındalıklı Yönlendirme (section)
  77. Geri Getirme ile Güçlendirilmiş Yapay Zeka Sistemleri (part)
  78. Modellerin Neden Geri Getirmeye İhtiyacı Var? (chapter)
  79. Bilgi Sınırlamaları (section)
  80. Güncelliğini Yitirmiş Bilgi (section)

Sık sorulan sorular

Bu kitap kimler için uygundur?

Makine öğrenimi mühendisleri, platform mimarları, veri mühendisleri ve LLM tabanlı üretim sistemleri tasarlayan kıdemli geliştiriciler için yazılmıştır.

Kitap hangi konuları kapsıyor?

Çıkarım optimizasyonu, kuantizasyon, sunum mimarileri, RAG, ajan sistemleri, güvenlik ve gözlemlenebilirlik gibi üretim yapay zeka altyapısının temel konularını ele alır.

Kitap teorik mi yoksa pratik mi?

Hem teorik hem pratiktir; gerçek dünya senaryolarında karşılaşılan sorunlara çözümler ve mimari prensipler sunar.

Yazar kimdir?

Yazar Miles Thornton'dur ve kitap, üretim yapay zeka sistemleri üzerine deneyimlerine dayanmaktadır.

Kitap hangi dilde?

Kitabın dili Türkçedir.

C

Cretisoft Direct

Dijital kitap desteği

T

Partner teslimatı

Kitap ödeme sonrası gönderilir

Sample EPUB

Read sample online

Büyük Dil Modeli Sistemleri: Çıkarım, Sunum, Ajanlar ve Üretim Yapay Zeka Altyapısı

Bunları da sevebilirsiniz

Okuma geçmişinize göre

Tümünü gör