LLM w środowisku produkcyjnym. Serwowanie, optymalizacja i hosting na dużą skalę Chi Wang, Peiheng Hu
- Autorzy:
- Chi Wang, Peiheng Hu
- Wydawnictwo:
- Helion
- Ocena:
- Stron:
- 341
- Druk:
- oprawa miękka
Opis
książki
:
LLM w środowisku produkcyjnym. Serwowanie, optymalizacja i hosting na dużą skalę
Wdrażaj i optymalizuj modele LLM szybko, tanio i na dużą skalę
Rewolucja sztucznej inteligencji sprawiła, że duże modele językowe (LLM) z ciekawostek badawczych stały się krytyczną infrastrukturą produkcyjną. Obecnie największym wyzwaniem dla firm IT nie jest już samo trenowanie modeli, ale ich wydajne, bezpieczne i opłacalne wdrażanie. W erze agentów AI i w obliczu rosnących kosztów korzystania z publicznych API organizacje coraz częściej decydują się na hosting własnych rozwiązań. Ta książka stanowi kompleksowy przewodnik po serwowaniu i optymalizacji LLM. Wypełnia lukę między teorią a praktyką, pokazując, jak przekuć potężne modele w niezawodne aplikacje działające w czasie rzeczywistym, a przy tym poradzić sobie z nową fizyką i ekonomią generatywnej sztucznej inteligencji.
Ta publikacja krok po kroku przeprowadza czytelnika przez cykl życia modelu w środowisku produkcyjnym. Autorzy demistyfikują architekturę transformerów, szczegółowo omawiając fazy wstępnego wypełniania (prefill) i dekodowania, jak również zarządzanie pamięcią podręczną KV. Książka uczy projektowania systemów dla pojedynczych i wielu modeli, a także wdrażania zaawansowanych technik optymalizacji: ciągłego przetwarzania wsadowego, kwantyzacji, dekodowania spekulatywnego czy buforowania prefiksów. Czytelnik dowie się, jak skutecznie używać nowoczesnych frameworków (w tym vLLM, TensorRT-LLM, SGLang, llama.cpp) i jak skalować infrastrukturę na wiele procesorów graficznych (GPU) i węzłów przy zachowaniu idealnego balansu między przepustowością, opóźnieniami a kosztami operacyjnymi.
Najważniejsze zagadnienia:
- Architektura LLM i mechanizmy generowania tokenów
- Zarządzanie pamięcią KV i ciągłe przetwarzanie wsadowe
- Projektowanie systemów serwowania
- Zaawansowana optymalizacja
- Skalowanie na wiele GPU
- Przegląd frameworków: vLLM, TensorRT-LLM, SGLang, llama.cpp
Gdy duże modele językowe stają się podstawą nowoczesnych platform sztucznej inteligencji, ta książka oferuje praktyczny plan serwowania i optymalizacji modeli LLM na dużą skalę co umożliwia niezawodną i opłacalną obsługę ogromnych obciążeń.
Bhavesh Doshi, wicedyrektor działu chmury AI w Salesforce
Wybrane bestsellery
Helion - inne książki
Dzięki opcji "Druk na żądanie" do sprzedaży wracają tytuły Grupy Helion, które cieszyły sie dużym zainteresowaniem, a których nakład został wyprzedany.
Dla naszych Czytelników wydrukowaliśmy dodatkową pulę egzemplarzy w technice druku cyfrowego.
Co powinieneś wiedzieć o usłudze "Druk na żądanie":
- usługa obejmuje tylko widoczną poniżej listę tytułów, którą na bieżąco aktualizujemy;
- cena książki może być wyższa od początkowej ceny detalicznej, co jest spowodowane kosztami druku cyfrowego (wyższymi niż koszty tradycyjnego druku offsetowego). Obowiązująca cena jest zawsze podawana na stronie WWW książki;
- zawartość książki wraz z dodatkami (płyta CD, DVD) odpowiada jej pierwotnemu wydaniu i jest w pełni komplementarna;
- usługa nie obejmuje książek w kolorze.
Masz pytanie o konkretny tytuł? Napisz do nas: sklep@helion.pl
Książka drukowana


Oceny i opinie klientów: LLM w środowisku produkcyjnym. Serwowanie, optymalizacja i hosting na dużą skalę Chi Wang, Peiheng Hu
(0)