Ocena wydajności wdrożeń LLM w wybranych usługach kontenerowych opartych na chmurze

##plugins.themes.bootstrap3.article.main##

Mateusz Stęgierski

s97221@pollub.edu.pl

https://orcid.org/0009-0007-1501-4156
Piotr Szpak

s95585@pollub.edu.pl

https://orcid.org/0009-0007-0517-7250
Sławomir Przyłucki

s.przylucki@pollub.pl

https://orcid.org/0000-0001-9565-3802

Abstrakt

Rosnąca popularność bezserwerowych usług kontenerowych stworzyła wyzwania związane z wyborem optymalnych platform chmurowych dla wdrożeń produkcyjnych LLM, jednak porównawcze oceny wydajności pozostają ograniczone. Niniejsze badanie ocenia AWS Fargate i Azure Container Apps pod kątem wdrożeń LLM, badając, czy różnice architektoniczne powodują znaczne różnice w wydajności przy różnych wzorcach obciążenia. Przeprowadziliśmy systematyczne eksperymenty przy użyciu skonteneryzowanej Llamy 3.2:1b w wielu scenariuszach: pomiary bazowe, testy wnioskowania z różnymi długościami podpowiedzi, wydajność API strumieniowego i jednoczesne testy obciążenia z progresywnym skalowaniem. Każdy scenariusz został wykonany zarówno na standardowej, jak i automatycznie skalowanej infrastrukturze z 10 przebiegami na konfigurację, aby zapewnić wiarygodność statystyczną. Kluczowe wnioski ujawniają wyraźne cechy platformy: AWS Fargate wykazuje lepsze bazowe czasy odpowiedzi API i wydajność time-to-first-token, podczas gdy Azure Container Apps konsekwentnie przewyższa AWS w przetwarzaniu wnioskowania dla krótkich i średnich monitów z lepszą spójnością we wszystkich przebiegach testowych. Wydajność przesyłania strumieniowego pokazuje kompromisy specyficzne dla platformy, przy czym AWS osiąga niższe opóźnienie początkowe, ale Azure zapewnia lepszą spójność generowania tokenów. Przy jednoczesnym obciążeniu obie platformy utrzymują pełną wydajność przy niższych poziomach współbieżności, ale AWS wykazuje wykładnicze pogorszenie czasu odpowiedzi przy wyższych obciążeniach, podczas gdy Azure wykazuje bardziej liniowe, przewidywalne zachowanie skalowania. Analiza statystyczna potwierdza znaczące różnice w wydajności we wszystkich metrykach, potwierdzając, że architektura platformy ma zasadniczy wpływ na wydajność wdrażania LLM. Wyniki te wskazują, że wybór platformy powinien być dostosowany do konkretnych wymagań dotyczących obciążenia: AWS Fargate dla aplikacji o krytycznym opóźnieniu i stałym obciążeniu oraz Azure Container Apps dla obciążeń intensywnie wykorzystujących wnioskowanie, wymagających solidnego skalowania i spójności. Badanie to oferuje kluczowe dane porównawcze dla firm wdrażających usługi AI klasy produkcyjnej na bezserwerowych platformach kontenerowych.

Słowa kluczowe:

kontenery bezserwerowe, porównanie wydajności, modele językowe, automatyczne skalowanie, testowanie obciążenia

Bibliografia

##plugins.themes.bootstrap3.article.details##

Ocena wydajności wdrożeń LLM w wybranych usługach kontenerowych opartych na chmurze. (2025). Informatyka, Automatyka, Pomiary w Gospodarce i Ochronie Środowiska, 15(4), 142-150. https://doi.org/10.35784/iapgos.8206