A multi-modal transformer-based model for generative visual dialog system. (2025). Applied Computer Science, 21(1), 1-17. https://doi.org/10.35784/acs_6856