Ocena wydajności wdrożeń LLM w wybranych usługach kontenerowych opartych na chmurze
##plugins.themes.bootstrap3.article.sidebar##
Numer Tom 15 Nr 4 (2025)
-
Sterowanie lewitacją magnetyczną za pomocą regulatora PID z adaptacją opartą na liniowej interpolacji i algorytmie genetycznym
Dominik Fila, Andrzej Neumann, Bartosz Olesik, Jakub Pawelec, Kamil Przybylak, Mateusz Ungier, Dawid Wajnert5-9
-
Opracowanie systemu prognozowania awarii maszyn pakujących
Nataliia Huliieva, Nataliia Lishchyna, Viktoriya Pasternak, Zemfira Huliieva10-13
-
Opracowanie i weryfikacja modułowej, obiektowo zorientowanej architektury kontrolera logiki rozmytej dla konfigurowalnych i wbudowanych aplikacji
Rahim Mammadzada14-24
-
Energia pękania mechanicznego i właściwości strukturalno-mechaniczne przekąsek mięsnych z dodatkiem produktów pszczelich
Artem Antoniv, Igor Palamarchuk, Leonora Adamchuk, Marija Zheplinska25-31
-
Modelowanie procesów dynamicznych w układzie nieholonomicznym w postaci równania Gibbsa-Appella na przykładzie młyna kulowego
Volodymyr Shatokhin, Yaroslav Ivanchuk, Vitaly Liman, Sergii Komar, Oleksii Kozlovskyi32-38
-
Diagnostyka Covid-19 w czasie rzeczywistym na wbudowanych platformach IoT
Elmehdi Benmalek, Wajih Rhalem, Atman Jbari, Abdelilah Jilbab, Jamal Elmhamdi39-45
-
Hybrydowe modele do diagnozy choroby Parkinsona na podstawie pisma ręcznego
Asma Ouabd, Achraf Benba, Abdelilah Jilbab, Ahmed Hammouch46-50
-
System komputerowy do diagnostyki i terapii pomijania stronnego
Krzysztof Strzecha, Agata Bukalska-Strzecha, Krzysztof Kurzdym, Dominik Sankowski51-55
-
Informatyka i pomiary w opiece zdrowotnej: głębokie uczenie się w celu przewidywania ponownych hospitalizacji pacjentów z cukrzycą
Shiva Saffari, Mahdi Bahaghighat56-64
-
Optymalizacja dokładności nieinwazyjnego monitorowania poziomu glukozy za pomocą czujnika optycznego
Nurzhigit Smailov, Aliya Zilgarayeva, Sergii Pavlov, Balzhan Turusbekova, Akezhan Sabibolda65-70
-
Stochastyczna wielocelowa optymalizacja minimaksowa połączonego ekranu elektromagnetycznego w oparciu o trójwymiarowe modelowanie pola magnetycznego napowietrznych linii elektroenergetycznych
Borys Kuznetsov, Tatyana Nikitina, Alexander Kutsenko, Ihor Bovdui, Kostiantyn Czunikhin, Olena Voloshko, Roman Voliansky, Viktoriia Ivannikova71-75
-
Zaawansowane strategie zarządzania energią dla mikrosieci AC/DC
Zouhir Boumous, Samira Boumous, Tawfik Thelaidjia76-82
-
Eksperymentalne badanie układu przekształtnika wielostopniowego
Kyrmyzy Taissariyeva, Kuanysh Muslimov, Yerlan Tashtay, Gulim Jobalayeva, Lyazzat Ilipbayeva, Ingkar Issakozhayeva, Akezhan Sabibolda83-86
-
Prognozowanie parametrów strukturalnych w nanostrukturach plazmonicznych symulowanych metodą FDTD z wykorzystaniem uczenia głębokiego
Shahed Jahidul Haque, Arman Mohammad Nakib87-94
-
Opracowanie algorytmu obliczania procesów wymiany jonowej z użyciem ekosystemu Python
Iryna Chub, Oleksii Proskurnia, Kateryna Demchenko, Oleksandr Miroshnyk, Taras Shchur, Serhii Halko95-99
-
Inteligentny model sterowania niezawodnością i bezpieczeństwem w systemach transportu miejskiego
Anastasiia Kashkanova, Alexander Rotshtein, Andrii Kashkanov, Denis Katelnikov100-107
-
Analiza interakcji elementów modułowego systemu przechowywania paczek z wykorzystaniem diagramów UML
Lyudmila Samchuk, Yuliia Povstiana, Anastasia Hryshchuk108-116
-
Ocena zmodyfikowanych heurystyk wstawiania par w celu wystarczającego rozwiązania problemu transportu na żądanie w logistyce opieki zdrowotnej
Rodolfo Eleazar Pérez Loaiza, Aaron Guerrero-Campanur, Edmundo Bonilla Huerta117-123
-
Analiza nowoczesnych narzędzi, metod audytu i monitorowania bezpieczeństwa baz danych
Kateryna Mykhailyshyn, Oleh Harasymchuk, Oleh Deineka, Yurii Dreis, Volodymyr Shulha, Yuriy Pepa124-129
-
Poprawa jakości obrazów podwodnych poprzez połączenie metody Deep‑Retinex i sieci GAN
Anuradha Chinta, Bharath Kumar Surla, Chaitanya Kodali130-136
-
Matematyczna metoda oceny stanu cyberbezpieczeństwa usług chmurowych
Yevheniia Ivanchenko, Volodymyr Shulha, Ihor Ivanchenko, Yevhenii Pedchenko, Mari Petrovska137-141
-
Ocena wydajności wdrożeń LLM w wybranych usługach kontenerowych opartych na chmurze
Mateusz Stęgierski, Piotr Szpak, Sławomir Przyłucki142-150
-
Implementacja cech w języku C# przy użyciu Roslyn Source Generators
Mykhailo Pozur, Viktoria Voitko, Svitlana Bevz, Serhii Burbelo, Olena Kosaruk151-157
-
Wpływ dostosowywalnego harmonogramowania orkiestratora na wydajność uczenia maszynowego w urządzeniach brzegowych
Konrad Cłapa, Krzysztof Grudzień, Artur Sierszeń158-163
-
Rekonfigurowana architektura CoARX do implementacji funkcji haszującej ARX w mikrokontrolerach systemów IoT o ograniczonych zasobach
Serhii Zabolotnii, Inna Rozlomii, Andrii Yarmilko, Serhii Naumenko164-169
-
Integralna ocena jakości wody źródlanej z wykorzystaniem zestawu narzędzi logiki rozmytej
Vyacheslav Repeta, Oleksandra Krykhovets, Yurii Kukura170-176
-
Wybrane zagadnienia dotyczące światłowodowych czujników zgięcia
Les Hotra, Jacek Klimek, Ihor Helzhynskyy, Oksana Boyko, Svitlana Kovtun177-181
Archiwum
-
Tom 16 Nr 2
2026-06-30 27
-
Tom 16 Nr 1
2026-03-30 27
-
Tom 15 Nr 4
2025-12-20 27
-
Tom 15 Nr 3
2025-09-30 24
-
Tom 15 Nr 2
2025-06-27 24
-
Tom 15 Nr 1
2025-03-31 26
-
Tom 14 Nr 4
2024-12-21 25
-
Tom 14 Nr 3
2024-09-30 24
-
Tom 14 Nr 2
2024-06-30 24
-
Tom 14 Nr 1
2024-03-31 23
-
Tom 13 Nr 4
2023-12-20 24
-
Tom 13 Nr 3
2023-09-30 25
-
Tom 13 Nr 2
2023-06-30 14
-
Tom 13 Nr 1
2023-03-31 12
-
Tom 11 Nr 4
2021-12-20 15
-
Tom 11 Nr 3
2021-09-30 10
-
Tom 11 Nr 2
2021-06-30 11
-
Tom 11 Nr 1
2021-03-31 14
##plugins.themes.bootstrap3.article.main##
Authors
Abstrakt
Rosnąca popularność bezserwerowych usług kontenerowych stworzyła wyzwania związane z wyborem optymalnych platform chmurowych dla wdrożeń produkcyjnych LLM, jednak porównawcze oceny wydajności pozostają ograniczone. Niniejsze badanie ocenia AWS Fargate i Azure Container Apps pod kątem wdrożeń LLM, badając, czy różnice architektoniczne powodują znaczne różnice w wydajności przy różnych wzorcach obciążenia. Przeprowadziliśmy systematyczne eksperymenty przy użyciu skonteneryzowanej Llamy 3.2:1b w wielu scenariuszach: pomiary bazowe, testy wnioskowania z różnymi długościami podpowiedzi, wydajność API strumieniowego i jednoczesne testy obciążenia z progresywnym skalowaniem. Każdy scenariusz został wykonany zarówno na standardowej, jak i automatycznie skalowanej infrastrukturze z 10 przebiegami na konfigurację, aby zapewnić wiarygodność statystyczną. Kluczowe wnioski ujawniają wyraźne cechy platformy: AWS Fargate wykazuje lepsze bazowe czasy odpowiedzi API i wydajność time-to-first-token, podczas gdy Azure Container Apps konsekwentnie przewyższa AWS w przetwarzaniu wnioskowania dla krótkich i średnich monitów z lepszą spójnością we wszystkich przebiegach testowych. Wydajność przesyłania strumieniowego pokazuje kompromisy specyficzne dla platformy, przy czym AWS osiąga niższe opóźnienie początkowe, ale Azure zapewnia lepszą spójność generowania tokenów. Przy jednoczesnym obciążeniu obie platformy utrzymują pełną wydajność przy niższych poziomach współbieżności, ale AWS wykazuje wykładnicze pogorszenie czasu odpowiedzi przy wyższych obciążeniach, podczas gdy Azure wykazuje bardziej liniowe, przewidywalne zachowanie skalowania. Analiza statystyczna potwierdza znaczące różnice w wydajności we wszystkich metrykach, potwierdzając, że architektura platformy ma zasadniczy wpływ na wydajność wdrażania LLM. Wyniki te wskazują, że wybór platformy powinien być dostosowany do konkretnych wymagań dotyczących obciążenia: AWS Fargate dla aplikacji o krytycznym opóźnieniu i stałym obciążeniu oraz Azure Container Apps dla obciążeń intensywnie wykorzystujących wnioskowanie, wymagających solidnego skalowania i spójności. Badanie to oferuje kluczowe dane porównawcze dla firm wdrażających usługi AI klasy produkcyjnej na bezserwerowych platformach kontenerowych.
Słowa kluczowe:
Bibliografia
[1] Abraham A., Yang J.: Analyzing the system features, usability, and performance of a containerized application on serverless cloud computing systems. Research Square 2023 [https://doi.org/10.21203/rs.3.rs-3167840/v1].
[2] Agache A. et al.: Firecracker: Lightweight virtualization for serverless applications. 17th USENIX Symposium on Networked Systems Design and Implementation (NSDI '20), 2020, 419–434.
[3] Dittakavi R. S. S.: Cold start latency in serverless computing: Current trends and mitigation techniques. EDUZONE: International Peer Reviewed/Refereed Multidisciplinary Journal 12(2), 2023, 134–138.
[4] Golec M. et al.: Cold start latency in serverless computing: A systematic review, taxonomy, and future directions (Appendix). Journal of ACM 37(4), 2024, 1–8.
[5] Jain P. et al.: Performance analysis of various server hosting techniques. Procedia Computer Science 173, 2020, 70–77 [https://doi.org/10.1016/j.procs.2020.06.010].
[6] Jonnakuti S.: LLMs in the cloud: Best practices for scaling generative AI in regulated industries. International Journal of Engineering Technology Research & Management 8(2), 2024, 105–112.
[7] Llama3.2:1b. Meta, 2024 [https://ollama.com/library/llama3.2:1b].
[8] McGrath G., Brenner P. R.: Serverless computing: Design, implementation, and performance. IEEE 37th International Conference on Distributed Computing Systems Workshops (ICDCSW), 2017, 405–410 [https://doi.org/10.1109/ICDCSW.2017.36].
[9] MSV J.: The evolution of serverless container platform on AWS Fargate. The New Stack, 2019 [https://thenewstack.io/the-evolution-of-serverless-container-platform-on-aws-fargate/].
[10] Ollama. GitHub - ollama/ollama: Get up and running with Llama 3.3, DeepSeek-R1, Phi-4, Gemma 3, Mistral Small 3.1 and other large language models. GitHub, 2025 [https://github.com/ollama/ollama].
[11] Petrovski T., Gusev M.: Container vs function as a service: Impact on cloud deployment for real-world applications. 47th MIPRO ICT and Electronics Convention (MIPRO), 2024, 869–874 [https://doi.org/10.1109/MIPRO60963.2024.10569811].
[12] Roloff E. et al.: High performance computing in the cloud: Deployment, performance and cost efficiency. IEEE 4th International Conference on Cloud Computing Technology and Science (CloudCom). Taipei, Taiwan, 2012, 371–378 [https://doi.org/10.1109/CloudCom.2012.6427549].
[13] Sadaqat M., Sánchez-Gordón M., Colomo-Palacios R.: Benchmarking serverless computing: Performance and usability. Journal of Information Technology Research 15(1), 2022, 1–17 [https://doi.org/10.4018/JITR.299374].
[14] Sagi S.: Overcoming challenges in deploying large language models for generative AI use cases: The role of containers and orchestration. International Journal of Computer Trends and Technology 72(2), 2024, 75–81 [https://doi.org/10.14445/22312803/IJCTT-V72I2P114].
[15] Seth D., Chintale P.: Performance benchmarking of serverless computing platforms. International Journal of Computer Trends and Technology 72(6), 2024, 160–167 [https://doi.org/10.14445/22312803/IJCTT-V72I6P121].
[16] Shrestha R., Nisha B.: Performance evaluation and comparison of microservices and serverless deployments in cloud. IEEE 8th International Conference on Smart Cloud (SmartCloud). Tokyo, Japan, 2023, 202–207 [https://doi.org/10.1109/SmartCloud58862.2023.00043].
[17] Srivastava S. et al.: The future of AI in production: Leveraging Kubernetes for Large Language Model deployment. International Journal for Multidisciplinary Research 7(1), 2025, 1–18.
[18] Stroh D., Mailach A., Siegmund N.: Themes of building LLM-based applications for production: A practitioner's view. arXiv preprint arXiv:2411.08574v2, 2024.
[19] Synergy Research Group: Cloud Market Jumped to $330 billion in 2024 – GenAI is Now Driving Half of the Growth. [https://www.srgresearch.com/articles/cloud-market-jumped-to-330-billion-in-2024-genai-is-now-driving-half-of-the-growth] (avaible: 7.06.2025).
[20] Waseem M. et al.: Containerization in multi-cloud environment: Roles, strategies, challenges, and solutions for effective implementation. arXiv preprint arXiv:2403.12980v2, 2024.
##plugins.themes.bootstrap3.article.details##
Abstract views: 444
Downloads: 298

