arXiv:2510.13630v2 Announce Type: replace 
Abstract: Anomaly recognition plays a vital role in surveillance, transportation, healthcare, and public safety. However, most existing approaches rely solely on visual data, making them unreliable under challenging conditions such as occlusion, low illumination, and adverse weather. Moreover, the absence of large-scale synchronized audio-visual datasets has hindered progress in multimodal anomaly recognition. To address these limitations, this study presents AVAR-Net, a lightweight and efficient audio-visual anomaly recognition framework designed for real-world environments. AVAR-Net consists of four main modules: an audio feature extractor, a video feature extractor, fusion strategy, and a sequential pattern learning network that models cross-modal relationships for anomaly recognition. Specifically, the Wav2Vec2 model extracts robust temporal features from raw audio, while MobileViT captures both local and global visual representations from video frames. An early fusion mechanism combines these modalities, and a Multi-Stage Temporal Convolutional Network (MTCN) model that learns long-range temporal dependencies within the fused representation, enabling robust spatiotemporal reasoning. A novel Visual-Audio Anomaly Recognition (VAAR) dataset, is also introduced, serving as a medium-scale benchmark containing 3,000 real-world videos with synchronized audio across ten diverse anomaly classes. Experimental evaluations demonstrate that AVAR-Net achieves 89.29% accuracy on VAAR and 88.56% Average Precision on the XD-Violence dataset, improving Average Precision by 2.8% over existing state-of-the-art methods. These results highlight the effectiveness, efficiency, and generalization capability of the proposed framework, as well as the utility of VAAR as a benchmark for advancing multimodal anomaly recognition research.

تقدم الدراسة AVAR-Net، وهو إطار خفيف الوزن للتعرف على الشذوذات السمعية البصرية، والذي يعالج قيود الأساليب الحالية التي تعتمد على البيانات المرئية. من خلال دمج مجموعات البيانات السمعية البصرية المتزامنة، يحسن AVAR-Net اكتشاف الشذوذات في الظروف الصعبة، مما يجعله مهمًا للتطبيقات في المراقبة والرعاية الصحية والسلامة العامة.

El estudio presenta AVAR-Net, un marco ligero para el reconocimiento de anomalías audio-visuales que aborda las limitaciones de los métodos existentes que dependen de datos visuales. Al incorporar conjuntos de datos audio-visuales sincronizados, AVAR-Net mejora la detección de anomalías en condiciones desafiantes, lo que es significativo para aplicaciones en vigilancia, atención médica y seguridad pública.

L'étude présente AVAR-Net, un cadre léger de reconnaissance d'anomalies audio-visuelles qui répond aux limites des méthodes existantes reposant sur des données visuelles. En intégrant des ensembles de données audio-visuelles synchronisées, AVAR-Net améliore la détection d'anomalies dans des conditions difficiles, ce qui est significatif pour des applications dans la surveillance, la santé et la sécurité publique.

The study introduces AVAR-Net, a lightweight audio-visual anomaly recognition framework that addresses the limitations of existing methods reliant on visual data. By incorporating synchronized audio-visual datasets, AVAR-Net enhances anomaly detection in challenging conditions, making it significant for applications in surveillance, healthcare, and public safety.

AVAR-Net: A Lightweight Audio-Visual Anomaly Recognition Framework with a Benchmark Dataset

Was this article worth reading? Share it

Ready to build your own newsroom?