Log Aggregation Explained
Extracted from Security Information and Event Monitoring(2).pdf - source PDF page(s) 45-47.

L'agrégation de journaux est le processus qui consiste à collecter des journaux provenant de plusieurs systèmes informatiques, à les analyser, à extraire des données structurées et à les rassembler dans un format facilement consultable et explorable par les outils de données modernes.
Il existe quatre méthodes courantes pour agréger les journaux, et de nombreux systèmes d'agrégation de journaux combinent plusieurs méthodes. Il s'agit notamment de :
Syslog
- Un protocole de journalisation standard. Les administrateurs réseau peuvent configurer un serveur Syslog qui reçoit les journaux de plusieurs systèmes et les stocke dans un format efficace et condensé facilement interrogeable. Les agrégateurs de journaux peuvent directement lire et traiter les données Syslog.
Streaming d'événements
- Des protocoles tels que SNMP, Netflow et IPFIX permettent aux périphériques réseau de fournir des informations standard sur leurs opérations, qui peuvent être interceptées par l'agrégateur de journaux, analysées et ajoutées au stockage central des journaux.
Collecteurs de journaux
- Les agents logiciels qui s'exécutent sur les périphériques réseau capturent les informations du journal, les analysent et les envoient à un composant agrégateur centralisé pour le stockage et l'analyse.
Accès direct
- Les agrégateurs de journaux peuvent accéder directement aux périphériques réseau ou aux systèmes informatiques à l'aide d'une API ou d'un protocole réseau pour recevoir directement les journaux. Cette approche nécessite une intégration personnalisée pour chaque source de données.
Types de données
Lorsque l'on considère les données extraites vers une plateforme SIEM, il existe deux catégories : les données structurées et les données non structurées.
- Données structurées : il s'agit généralement de journaux pour Apache, IIS, les événements Windows, les journaux Cisco et certains autres fabricants. Ils comportent des champs clairement définis (tels que « src_ip ») et sont similaires aux autres journaux structurés, ce qui les rend relativement faciles à analyser et à normaliser.
- Données non structurées : ce type de journalisation provient généralement d'une application personnalisée dans laquelle chaque message peut être imprimé différemment selon les opérations et où l'événement lui-même peut s'étendre sur plusieurs lignes sans que le point de départ, la fin de l'événement ou les deux soient définis. Il s'agit probablement de la majorité des données envoyées au SIEM.
Pour que tous les journaux suivent un format similaire afin de faciliter les recherches dans un grand nombre de journaux différents, nous pouvons, dans la mesure du possible, utiliser des techniques de normalisation, que nous aborderons dans la section suivante de ce domaine.