Wymiana wiedzy w niezależnych głębokich sieciach Q
##plugins.themes.bootstrap3.article.sidebar##
Numer Tom 16 Nr 1 (2026)
-
Wydajna klasyfikacja białych krwinek w oparciu o CNN: badanie porównawcze wydajności modeli
Achraf Benba, Sara Sandabad5-9
-
Zautomatyzowana diagnostyka raka skóry z wykorzystaniem głębokiego uczenia: systematyczny przegląd najnowocześniejszych architektur, technik i oceny wydajności
Subaidabeevi Shafeena, Ramayyan Sumathy Vinod Kumar, Sikamony Sumathi Kumar, David Shahi10-20
-
Zwiększanie bezpieczeństwa kierowców dzięki rozpoznawaniu emocji na podstawie sygnałów EKG z wykorzystaniem sieci BiLSTM
Raga Madhuri Chandra, Satya Sumanth Vanapalli, Giri Venkata Sai Tej Neelaiahgari21-28
-
Automatyczny system do obliczania tabeli kalibracyjnej cylindrycznych zbiorników poziomych
Denis Proskurenko, Mykhailo Bezuglyi29-34
-
Kontrola stabilności emulsji woda-diesel za pomocą pomiarów zmętnienia
Oleksandr Zabolotnyi, Andrii Khodieiev, Nicolay Koshevoy, Roman Trishch35-41
-
Poprawa trybu rozruchu silnika indukcyjnego w warunkach spadku napięcia
Oleksandr Vovk, Serhii Halko, Andrii Sabo, Oleksandr Miroshnyk, Taras Shchur42-47
-
Modelowanie trybów dynamicznych w silniku prądu stałego do pojazdów elektrycznych
Viktor Lyshuk, Anatolii Tkachuk, Sergiy Moroz, Mykola Yevsiuk, Mykola Khvyshchun, Stanislav Prystupa, Valentyn Zablotskyi48-55
-
Budowa i analiza scenariuszy awarii w sieciach elektroenergetycznych z wykorzystaniem ontologii, modelu przepływu mocy oraz grafu wiedzy
Oleksandr Khomenko, Vyacheslav Senchenko, Oleksandr Koval, Iryna Husyeva56-61
-
Kinetyka suszenia materiałów ziarnistych w instalacjach z przerywanym zasilaniem elektrycznym wykorzystujących promieniowanie mikrofalowe i podczerwone
Roman Kalinichenko, Valentyna Bandura, Borys Kotov, Yurii Pantsyr, Ihor Garasymchuk, Serhii Stepanenko62-66
-
Metoda automatycznego dostrajania regulatora temperatury obudowy smartfonu
Danylo Zinchenko, Yurii Mariiash67-71
-
Wykorzystanie FPGA do modelowania i generowania procesów chaotycznych
Oleksandr Osadchuk, Iaroslav Osadchuk, Valentyn Skoshchuk72-77
-
ymulacja i projektowanie elektroniczne pięciowymiarowej chaotycznej sztucznej sieci neuronowej
Michael Kopp, Inna Samuilik78-83
-
Inteligentny łańcuch przetwarzania DL-SCH/PDSCH w sieci 5G z adaptacyjnym mechanizmem HARQ
Juliy Boiko, Ilya Pyatin84-93
-
Analiza modeli generatywnych w teledetekcji: przegląd kompleksowy
Gottapu Santosh Kumar, Gurugubelli Jagadeesh, Swarajya Madhuri Rayavarapu94-98
-
Dekodowanie z wykorzystaniem szumu zbiorowego z metodą inwersji bitów w kodach z niską gęstością i kontrolą parzystości
Mykola Shtompel, Oleksandr Shefer99-103
-
Wymiana wiedzy w niezależnych głębokich sieciach Q
Viacheslav Bochok, Nataliia Fedorova104-108
-
Wykrywanie ludzi na obrazach z dronów z wykorzystaniem technik głębokiego uczenia
Sobhana Mummaneni, Naga Deepika Ginjupalli, Pragathi Dodda, Novaline Jacob, Sanjay Raj Emmanuel Katari109-115
-
Analiza porównawcza algorytmów DeepSORT, ByteTrack i StrongSORT w zakresie śledzenia wielu obiektów w systemach monitoringu wizyjnego opartych na bezzałogowych statkach powietrznych
Andrii Safonyk, Viktor Podvyshennyi, Oleksandr Naumchuk116-120
-
Wysoce wydajne metody przetwarzania złożonych danych wizualnych w systemach wsparcia decyzyjnego
Oleksandr Poplavskyi, Sergii Pavlov, Oksana Bezsmernta, Iryna Gerasymova, Bakhyt Yeraliyeva121-125
-
Metoda antyaliasingu dla krzywych rzędu drugiego na rastrach heksagonalnych
Oleksandr Melnyk, Tetiana Prysiazhniuk126-129
-
Metoda oceny ryzyka naruszenia bezpieczeństwa użytkownika na podstawie indywidualnego profilu bezpieczeństwa
Svitlana Lehominova, Mykhailo Zaporozhchenko, Tetiana Kapeliushna, Yuriy Shchavinsky, Tetiana Muzhanova130-137
-
Metoda kodowania pozycyjnego w diferencyjnej przestrzeni falowej
Volodymyr Barannik, Anatolii Berchanov, Valeriy Barannik, Dmytro Uzlov, Mykola Dihtiar, Mykhailo Osovytskyi, Andrii Sushko, Yurii Babenko138-146
-
Platforma internetowa z usługą Checkbox: aspekty rachunkowości podatkowej, sprawozdawczości i współpracy z organami podatkowymi
Yuliia Povstiana, Lyudmila Samchuk, Ivan Kachula147-154
-
Analiza porównawcza webowych szkieletów programistycznych języka PHP: Codeigniter, Cakephp oraz Yii
Karol Rak, Mariusz Dzieńkowski155-161
-
Prognozowanie cen plonów z wykorzystaniem Temporal Fusion Transformer dla okręgu Krishna w stanie Andhra Pradesh
Dedeepya Manikonda, Ashutosh Satapathy, Keerthi Padamata, Jaswanthi Machcha, J. Chandrakanta Badajena162-170
-
Model transmisji pakietowej danych tekstowych z wykorzystaniem SDR w środowisku GNU Radio Companion
Nurbol Kaliaskarov, Kyrmyzy Taissariyeva, Nurlykhan Raulyev, Akezhan Sabibolda171-176
-
Modelowanie systemu produkcyjnego typu pull-flow z dynamicznym sterowaniem zapasami buforowymi
Saad Elbaraka, Salah-eddine Mokhlis, Adil Barra, Hicham Fouraiji, Mohamed Rhouzali, Najat Messaoudi177-182
Archiwum
-
Tom 16 Nr 2
2026-06-30 27
-
Tom 16 Nr 1
2026-03-30 27
-
Tom 15 Nr 4
2025-12-20 27
-
Tom 15 Nr 3
2025-09-30 24
-
Tom 15 Nr 2
2025-06-27 24
-
Tom 15 Nr 1
2025-03-31 26
-
Tom 14 Nr 4
2024-12-21 25
-
Tom 14 Nr 3
2024-09-30 24
-
Tom 14 Nr 2
2024-06-30 24
-
Tom 14 Nr 1
2024-03-31 23
-
Tom 13 Nr 4
2023-12-20 24
-
Tom 13 Nr 3
2023-09-30 25
-
Tom 13 Nr 2
2023-06-30 14
-
Tom 13 Nr 1
2023-03-31 12
-
Tom 12 Nr 4
2022-12-30 16
-
Tom 12 Nr 3
2022-09-30 15
-
Tom 12 Nr 2
2022-06-30 16
-
Tom 12 Nr 1
2022-03-31 9
##plugins.themes.bootstrap3.article.main##
Authors
Abstrakt
W niniejszym artykule przeanalizowano mechanizmy dzielenia się wiedzą w słabo sprzężonych wieloagentowych systemach uczenia się przez wzmocnienie opartych na niezależnych głębokich sieciach Q (IDQN). Chociaż równoległe działanie agentów może przyspieszyć gromadzenie danych, ich procesy uczenia się zazwyczaj pozostają odizolowane, co skutkuje nieoptymalnym wykorzystaniem zbiorowego doświadczenia. Aby zaradzić temu ograniczeniu, w badaniu zaproponowano dwie uzupełniające się metody: (1) mechanizm wyboru nauczyciela, który identyfikuje najbardziej wydajnego agenta na podstawie wyników epizodycznych, oraz (2) mechanizm kontroli dynamicznej, który dostosowuje intensywność transferu wiedzy w zależności od różnicy w wynikach między nauczycielem a uczniem. Eksperymenty przeprowadzono w środowiskach OpenAI Gym CartPole-v1 i LunarLander-v3 z wykorzystaniem trzech niezależnych agentów, aby zweryfikować skuteczność w zadaniach o różnych strukturach nagród, dynamice i poziomach trudności. Wszyscy agenci byli szkoleni metodą Batch TD(0) na końcu każdego epizodu, z wykorzystaniem powtórki. Transfer wiedzy został zaimplementowany poprzez destylację polityki na podstawie pseudo-oznaczonych przejść pobranych z bufora doświadczeń nauczyciela. Liczba epok destylacji była ustalana dynamicznie przy użyciu nieliniowej funkcji skalującej, ograniczonej z góry zdefiniowanymi wartościami minimalnymi i maksymalnymi. Wyniki pokazują, że proponowane mechanizmy konsekwentnie przyspieszają uczenie się i poprawiają stabilność w porównaniu z podstawowymi konfiguracjami DQN bez dzielenia się wiedzą. Systemy wykorzystujące selekcję nauczyciela osiągają lepsze wyniki niż losowy wybór nauczyciela i dzielenie się wiedzą typu „wszyscy ze wszystkimi”. Dynamiczna regulacja intensywności okazuje się skuteczniejsza niż destylacja o stałej intensywności. Analiza znormalizowanego AUC dodatkowo potwierdza statystycznie istotną poprawę zarówno maksymalnych, jak i średnich zwrotów epizodycznych, wskazując na szybszą konwergencję najlepszego agenta, a także bardziej jednolity postęp wśród wszystkich agentów. Wyniki pokazują, że dzielenie się wiedzą z świadomym wyborem nauczyciela i adaptacyjną siłą transferu zapewnia solidne i skalowalne podejście do poprawy wydajności niezależnych agentów w środowiskach stacjonarnych. Mechanizmy te są kompatybilne z popularnymi rozszerzeniami DQN i mogą służyć jako podstawa dla przyszłych badań nad adaptacyjnymi strategiami wymiany wiedzy między wieloma agentami.
Słowa kluczowe:
Bibliografia
[1] Bellemare, M. G., Srinivasan, S., Ostrovski, G., Schaul, T., Saxton, D., & Munos, R. (2016). Unifying Count-Based Exploration and Intrinsic Motivation (arXiv:1606.01868). arXiv. https://doi.org/10.48550/arXiv.1606.01868
[2] Brockman, G., Cheung, V., Pettersson, L., Schneider, J., Schulman, J., Tang, J., & Zaremba, W. (2016). OpenAI Gym (Version 1). arXiv. https://doi.org/10.48550/ARXIV.1606.01540
[3] Dahal, M., & Vaezi, M. (2025). Selective Experience Sharing in Reinforcement Learning Enhances Interference Management (Version 1). arXiv. https://doi.org/10.48550/ARXIV.2501.15735
[4] Gao, Z., Xu, K., Ding, B., Wang, H., Li, Y., & Jia, H. (2021). KnowSR: Knowledge Sharing among Homogeneous Agents in Multi-agent Reinforcement Learning (Version 1). arXiv. https://doi.org/10.48550/ARXIV.2105.11611
[5] Henderson, P., Islam, R., Bachman, P., Pineau, J., Precup, D., & Meger, D. (2017). Deep Reinforcement Learning that Matters (Version 3). arXiv. https://doi.org/10.48550/ARXIV.1709.06560
[6] Mnih, V., Kavukcuoglu, K., Silver, D., Rusu, A. A., Veness, J., Bellemare, M. G., Graves, A., Riedmiller, M., Fidjeland, A. K., Ostrovski, G., Petersen, S., Beattie, C., Sadik, A., Antonoglou, I., King, H., Kumaran, D., Wierstra, D., Legg, S., & Hassabis, D. (2015). Human-level control through deep reinforcement learning. Nature, 518(7540), 529–533. https://doi.org/10.1038/nature14236
[7] Qiao, D., Li, W., Yang, S., Zha, H., & Wang, B. (2025). Offline Multi-agent Reinforcement Learning via Score Decomposition (Version 2). arXiv. https://doi.org/10.48550/ARXIV.2505.05968
[8] Schaul, T., Quan, J., Antonoglou, I., & Silver, D. (2015). Prioritized Experience Replay (Version 4). arXiv. https://doi.org/10.48550/ARXIV.1511.05952
[9] Shi, D., Tong, J., Liu, Y., & Fan, W. (2022). Knowledge Reuse of Multi-Agent Reinforcement Learning in Cooperative Tasks. Entropy, 24(4), 470. https://doi.org/10.3390/e24040470
[10] Silver, D., Huang, A., Maddison, C. J., Guez, A., Sifre, L., Van Den Driessche, G., Schrittwieser, J., Antonoglou, I., Panneershelvam, V., Lanctot, M., Dieleman, S., Grewe, D., Nham, J., Kalchbrenner, N., Sutskever, I., Lillicrap, T., Leach, M., Kavukcuoglu, K., Graepel, T., & Hassabis, D. (2016). Mastering the game of Go with deep neural networks and tree search. Nature, 529(7587), 484–489. https://doi.org/10.1038/nature16961
[11] Singh, A., et al. (2020). Reinforcement learning for autonomous traffic signal control. Proceedings of the International Conference on Autonomous Agents and Multiagent Systems (AAMAS).
[12] Sutton, R. S., & Barto, A. G. (2018). Reinforcement learning: An introduction (Second edition). The MIT Press.
[13] Tokic, M. (2010). Adaptive ε-Greedy Exploration in Reinforcement Learning Based on Value Differences. In R. Dillmann, J. Beyerer, U. D. Hanebeck, & T. Schultz (Eds), KI 2010: Advances in Artificial Intelligence (Vol. 6359, pp. 203–210). Springer Berlin Heidelberg. https://doi.org/10.1007/978-3-642-16111-7_23
[14] Van Hasselt, H., Guez, A., & Silver, D. (2016). Deep Reinforcement Learning with Double Q-Learning. Proceedings of the AAAI Conference on Artificial Intelligence, 30(1). https://doi.org/10.1609/aaai.v30i1.10295
[15] Vinyals, O., Babuschkin, I., Czarnecki, W. M., Mathieu, M., Dudzik, A., Chung, J., Choi, D. H., Powell, R., Ewalds, T., Georgiev, P., Oh, J., Horgan, D., Kroiss, M., Danihelka, I., Huang, A., Sifre, L., Cai, T., Agapiou, J. P., Jaderberg, M., … Silver, D. (2019). Grandmaster level in StarCraft II using multi-agent reinforcement learning. Nature, 575(7782), 350–354. https://doi.org/10.1038/s41586-019-1724-z
[16] Wadhwania, S., Kim, D.-K., Omidshafiei, S., & How, J. P. (2019). Policy Distillation and Value Matching in Multiagent Reinforcement Learning (Version 1). arXiv. https://doi.org/10.48550/ARXIV.1903.06592
[17] Wang, Z., Schaul, T., Hessel, M., Hasselt, H., Lanctot, M. & Freitas, N.. (2016). Dueling Network Architectures for Deep Reinforcement Learning. Proceedings of The 33rd International Conference on Machine Learning, 48. https://proceedings.mlr.press/v48/wangf16.html
##plugins.themes.bootstrap3.article.details##
Abstract views: 227
Downloads: 132

