ODBIERZ TWÓJ BONUS :: »

LLM w środowisku produkcyjnym. Serwowanie, optymalizacja i hosting na dużą skalę Chi Wang, Peiheng Hu

(ebook) (audiobook) (audiobook)
LLM w środowisku produkcyjnym. Serwowanie, optymalizacja i hosting na dużą skalę Chi Wang, Peiheng Hu - okladka książki

LLM w środowisku produkcyjnym. Serwowanie, optymalizacja i hosting na dużą skalę Chi Wang, Peiheng Hu - okladka książki

LLM w środowisku produkcyjnym. Serwowanie, optymalizacja i hosting na dużą skalę Chi Wang, Peiheng Hu - audiobook MP3

LLM w środowisku produkcyjnym. Serwowanie, optymalizacja i hosting na dużą skalę Chi Wang, Peiheng Hu - audiobook CD

Autorzy:
Chi Wang, Peiheng Hu
Wydawnictwo:
Helion
Ocena:
Stron:
341
Druk:
oprawa miękka

Wdrażaj i optymalizuj modele LLM szybko, tanio i na dużą skalę

Rewolucja sztucznej inteligencji sprawiła, że duże modele językowe (LLM) z ciekawostek badawczych stały się krytyczną infrastrukturą produkcyjną. Obecnie największym wyzwaniem dla firm IT nie jest już samo trenowanie modeli, ale ich wydajne, bezpieczne i opłacalne wdrażanie. W erze agentów AI i w obliczu rosnących kosztów korzystania z publicznych API organizacje coraz częściej decydują się na hosting własnych rozwiązań. Ta książka stanowi kompleksowy przewodnik po serwowaniu i optymalizacji LLM. Wypełnia lukę między teorią a praktyką, pokazując, jak przekuć potężne modele w niezawodne aplikacje działające w czasie rzeczywistym, a przy tym poradzić sobie z nową fizyką i ekonomią generatywnej sztucznej inteligencji.

Ta publikacja krok po kroku przeprowadza czytelnika przez cykl życia modelu w środowisku produkcyjnym. Autorzy demistyfikują architekturę transformerów, szczegółowo omawiając fazy wstępnego wypełniania (prefill) i dekodowania, jak również zarządzanie pamięcią podręczną KV. Książka uczy projektowania systemów dla pojedynczych i wielu modeli, a także wdrażania zaawansowanych technik optymalizacji: ciągłego przetwarzania wsadowego, kwantyzacji, dekodowania spekulatywnego czy buforowania prefiksów. Czytelnik dowie się, jak skutecznie używać nowoczesnych frameworków (w tym vLLM, TensorRT-LLM, SGLang, llama.cpp) i jak skalować infrastrukturę na wiele procesorów graficznych (GPU) i węzłów przy zachowaniu idealnego balansu między przepustowością, opóźnieniami a kosztami operacyjnymi.

Najważniejsze zagadnienia:

  • Architektura LLM i mechanizmy generowania tokenów
  • Zarządzanie pamięcią KV i ciągłe przetwarzanie wsadowe
  • Projektowanie systemów serwowania
  • Zaawansowana optymalizacja
  • Skalowanie na wiele GPU
  • Przegląd frameworków: vLLM, TensorRT-LLM, SGLang, llama.cpp

Gdy duże modele językowe stają się podstawą nowoczesnych platform sztucznej inteligencji, ta książka oferuje praktyczny plan serwowania i optymalizacji modeli LLM na dużą skalę co umożliwia niezawodną i opłacalną obsługę ogromnych obciążeń.

Bhavesh Doshi, wicedyrektor działu chmury AI w Salesforce

Wybrane bestsellery

Selling  helion.pl
nformacja o grafice AI Informacja o grafice AI Wybrane elementy graficzne tej sekcji powstały przy wsparciu AI

O autorach książki

Chi Wang dyrektor do spraw inżynierii w dziale Einstein AI w Salesforce. Ma ponad 18-letnie doświadczenie w zakresie AI i systemów rozproszonych. Kieruje rozwojem wielkoskalowych platform AI, jest autorem 12 patentów.

Peiheng Hu inżynier specjalizujący się w inferencji LLM w NVIDIA. Absolwent Harvardu i Georgia Tech. Od ponad dekady tworzy rozproszone systemy AI. Wcześniej pracował dla Salesforce i Microsoft Azure.

Helion - inne książki

Zamknij

Przenieś na półkę
Dodano produkt na półkę
Usunięto produkt z półki
Przeniesiono produkt do archiwum
Przeniesiono produkt do biblioteki
Proszę czekać...
ajax-loader

Zamknij

Wybierz metodę płatności

Zamknij Pobierz aplikację mobilną Ebookpoint