Тип публикации: статья из журнала
Год издания: 2026
Идентификатор DOI: 10.17587/prin.17.376-390
Ключевые слова: intelligent transportation systems, autonomous driving, intelligent agent, neural networks, multimodal data, panoptic segmentation, depth map, simulation learning, интеллектуальные транспортные системы, автономное вождение, интеллектуальный агент, нейронные сети, мультимодальные данные, паноптическая сегментация, карта глубины, имитационное обучение
Аннотация: Редставлена архитектура интеллектуального агента для управления автономным транспортным средством на основе мультимодальных данных. Данный подход основан на сочетании визуальных признаков (карты глубины и паноптической сегментации), навигационных и контекстных параметров, а также временных рядов управляющих сигналов и индикаторов кПоказать полностьюритических событий. Мультимодальное слияние данных обеспечивает детальное восприятие окружающей среды и ее семантики, позволяет учитывать текущую цель и дорожную ситуацию, моделировать динамику движения и принимать последовательные управляющие решения. Модель реализована в симуляторе CARLA с использованием имитационного обучения. Архитектура включает отдельные модули кодирования для разных типов входных данных, механизм их объединения и три выходных блока предсказания, каждый из которых независимо предсказывает одну из управляющих переменных: рулевое управление, газ и тормоз. Полученные результаты подтверждают эффективность предложенного комплексного подхода и создают основу для дальнейшего развития систем такого рода. The paper presents the architecture of an intelligent agent for end-to-end autonomous vehicle control based on the M3Drive neural network and multimodal data fusion in the CARLA simulation environment. The proposed approach combines visual features (depth maps and panoptic segmentation for reconstructing 3D geometry and scene semantics), navigation commands and spatial coordinates of route control points, as well as time series of agent states (history of control actions and critical event indicators). The model architecture includes specialized encoders for each data type: EfficientNet-liteO for visual modalities followed by cross-attention fusion, bidirectional LSTM with an attention mechanism for processing temporal context, and a gating module for tabular features. The combined representations are fed into a multilayer perceptron with residual blocks and multi-task output "heads" that predict continuous control actions: steering angle, acceleration, and braking. Training was conducted in two stages with a weighted loss function. In the second stage, the model was fine-tuned using scenarios involving turns and reactions to traffic lights, which reduced steering errors by more than half. Experimental results at the independent test site confirmed the effectiveness of the system: a route completion rate (RC) of 89 % and an integral driving score (DS) of 67.6 were achieved at a high performance of 58 FPS. The results confirm the applicability of the proposed architecture for creating lightweight real-time autonomous driving systems and lay the foundation for transfer to the Mitsubishi i-MiEV physical platform.
Журнал: Программная инженерия
Выпуск журнала: Т.17, №7
Номера страниц: 376-390
ISSN журнала: 22203397
Место издания: Москва
Издатель: ООО "Издательство "Новые технологии"