Intelligence artificielle embarquée : guide complet

Une caméra qui envoie chaque image vers un serveur est-elle vraiment intelligente, ou transfère-t-elle simplement le problème ailleurs, avec davantage de bande passante, de stockage et de données à protéger ?
Dans une vidéoprotection moderne, la question décisive n'est pas seulement de savoir si un algorithme détecte un humain ou un véhicule. Il faut aussi déterminer où le traitement s'effectue, quelles informations circulent, qui valide l'alerte, combien de temps les images sont conservées et comment l'organisation corrige les erreurs du système.
L’intelligence artificielle embarquée répond à une partie de ces enjeux en exécutant l'analyse au plus près de la scène, directement dans la caméra ou dans un équipement situé en périphérie du réseau. En France, cette approche s'inscrit dans une stratégie industrielle et réglementaire qui associe souveraineté numérique, protection des données et encadrement des usages de sécurité (stratégie publique française sur l'IA).
Table des matières
- Pourquoi l'IA embarquée change la vidéoprotection au quotidien
- Comprendre ce qu'est réellement l'IA embarquée
- Le fonctionnement de l'IA dans une caméra de vidéoprotection
- Cas d'usage concrets en détection et analyse comportementale
- Contraintes réelles à anticiper avant un déploiement
- Bonnes pratiques pour réussir l'intégration sur site
- Vers une vidéoprotection plus sobre et plus conforme
Pourquoi l'IA embarquée change la vidéoprotection au quotidien

À 22 heures, le responsable sécurité d'un site logistique reçoit une alerte, puis une autre. Une branche bouge devant l'objectif, un reflet traverse la clôture, un animal passe près du portail. L'opérateur ouvre les images, vérifie la scène, classe l'événement, puis recommence. Les alertes pertinentes finissent par se confondre avec le bruit.
Chaque fausse alerte mobilise du temps, retarde la levée de doute et peut réduire la confiance dans le dispositif. L'objectif devient donc concret : recevoir moins d'événements, mais mieux qualifiés. La performance d'un système se mesure aussi à la capacité des opérateurs à rester attentifs lorsque l'alerte mérite réellement une vérification.
Le changement se produit au niveau de la décision
Une caméra classique capture et transmet principalement un flux vidéo. L'analyse est ensuite effectuée par un enregistreur, un serveur ou une plateforme distante. Avec l'IA embarquée, la caméra examine la scène localement, reconnaît une catégorie d'objet ou un événement configuré, puis transmet une alerte structurée et, selon les règles choisies, une séquence associée.
Le fonctionnement ressemble à celui d'un agent placé devant l'entrée d'un bâtiment. Il ne signale pas chaque mouvement dans la rue. Il transmet plutôt une présence dans une zone interdite, un franchissement de ligne ou un objet laissé au sol. La supervision conserve son rôle, mais elle reçoit une information déjà triée.
Règle opérationnelle : l'IA doit réduire la charge de décision, pas transformer chaque mouvement en nouvelle tâche de vérification.
Les gammes de caméras et d'équipements disponibles, comme celles présentées par Vizeo, permettent ensuite d'adapter cette logique au site, à ses zones sensibles et à ses règles d'exploitation. Le choix ne porte donc pas seulement sur le modèle d'IA, mais aussi sur son intégration au système existant.
Une réponse à plusieurs enjeux de terrain
Le traitement au plus près de la source peut limiter les transferts d'images et soutenir la confidentialité, conformément aux objectifs publics du traitement au plus près de la source. Cette approche intéresse les collectivités, établissements scolaires, hôpitaux, entrepôts et copropriétés qui doivent maîtriser leurs flux vidéo et documenter leurs choix au regard de la CNIL et de l'AI Act.
L'IA ne supprime ni les erreurs ni la responsabilité humaine. Elle déplace le centre de gravité du projet vers la qualification locale des événements, le réglage des scénarios, la réduction des faux positifs et la vérification de la légitimité de chaque usage. La souveraineté des données et la conformité deviennent ainsi des critères de déploiement au même titre que la précision algorithmique.
Comprendre ce qu'est réellement l'IA embarquée
Où l'intelligence artificielle prend-elle sa décision dans une caméra ? Le capteur fournit les images, une puce exécute un modèle et le logiciel applique une règle. La caméra peut ainsi signaler une présence humaine dans une zone interdite, sans transmettre chaque image à un service distant pour l'interpréter.
Trois architectures se distinguent :
- IA embarquée, le calcul s'effectue dans la caméra ou dans un équipement très proche.
- IA centralisée, les flux sont envoyés vers un NVR ou un serveur local qui exécute les modèles.
- IA dans le cloud, les images ou les métadonnées rejoignent une infrastructure distante pour analyse.
Le terme edge AI décrit une décision prise au plus près de la scène. Il ne garantit pas que la caméra fonctionne sans réseau. L'enregistrement, la consultation, la supervision et l'administration peuvent encore dépendre d'autres équipements. Le point décisif est l'emplacement du modèle qui analyse les images. Cette organisation peut limiter la circulation des flux et faciliter la maîtrise des données, mais elle ne dispense pas de vérifier les exigences de la CNIL et de l'AI Act.

Des modèles différents pour des questions différentes
Un modèle de détection d'objets recherche des catégories dans une image, comme une personne ou un véhicule. Dans un scénario de clôture, un détecteur de classe YOLO peut être réglé pour rechercher uniquement les personnes dans une zone polygonale et déclencher une préalerte lorsque son score de confiance dépasse le seuil défini par l'exploitant. Ce réglage doit ensuite être confronté aux images réelles du site, afin de réduire les faux positifs causés par les branches, les ombres ou les animaux.
Les familles YOLO ou SSD correspondent à des compromis différents entre vitesse, précision et ressources disponibles. La classification attribue une catégorie à une image ou à une région. La segmentation délimite les pixels d'un objet ou d'une zone. Le suivi, ou tracking, relie les détections successives pour estimer un déplacement. Ces informations peuvent alimenter une règle de franchissement, de chute ou de présence prolongée.
Le matériel fixe les limites
La caméra peut intégrer un SoC, une NPU ou un GPU embarqué. Leur puissance, leur consommation et leur dissipation thermique limitent la taille des modèles. Ceux-ci sont donc souvent compressés et adaptés à l'équipement.
Le choix doit aussi porter sur l'optique, la scène nocturne, la distance, l'angle de vue et la maintenance du firmware. Les caméras et équipements adaptés aux contraintes du site permettent de comparer ces paramètres. Une caméra comme la CA50HD est décrite comme une caméra tube Full Color, IR, PoE, avec une focale varifocale motorisée de 4,5 à 8 mm. Ces caractéristiques doivent correspondre au cadrage et au scénario analysé.
Une étude de simulation de vidéoprotection aide enfin à comparer les architectures à partir du site, des alertes attendues et des contraintes de conformité, plutôt qu'à partir d'une promesse générale.
Le fonctionnement de l'IA dans une caméra de vidéoprotection
Comment une caméra transforme-t-elle une scène filmée en alerte exploitable ? Elle ne comprend pas l'image comme un opérateur. Elle enchaîne plutôt des opérations spécialisées, comparables à une chaîne de tri : chaque étape prépare une information pour la suivante. La qualité de l'image, le cadrage et la règle choisie influencent donc le résultat autant que le réseau neuronal.

De l'image brute à l'inférence
Le capteur capture la scène. Le prétraitement réduit ensuite le bruit, ajuste l'exposition et prépare les zones utiles. Dans un parking, par exemple, une balayeuse de phares peut provoquer une variation lumineuse soudaine. Un prétraitement adapté atténue cette perturbation avant l'analyse, ce qui réduit le risque de faux déclenchements.
La normalisation rend l'image compatible avec les attentes du modèle. L'inférence correspond alors à l'exécution du réseau neuronal par la puce. Celui-ci produit des détections, des catégories et des scores de confiance. Une règle transforme enfin ces résultats en décision opérationnelle, selon la zone, la durée ou le niveau de confiance retenu.
La chaîne complète suit sept étapes :
- Capture, le capteur observe la scène.
- Prétraitement, le système corrige certaines perturbations visuelles.
- Normalisation, l'image est préparée pour le modèle.
- Inférence, la puce exécute le réseau neuronal.
- Score, le système estime la confiance de chaque détection.
- Catégorisation, l'objet ou l'événement reçoit une étiquette.
- Règle, la caméra déclenche ou non une alerte.
Pour modéliser cette chaîne sur un site réel, une simulation de vidéoprotection adaptée au scénario permet de confronter le cadrage, les alertes attendues et les contraintes de conformité.
L'alerte n'est pas la vidéo entière
La caméra peut produire un événement structuré, transmis par JSON, MQTT ou ONVIF selon l'architecture. Le logiciel de supervision reçoit alors une catégorie, une zone, une heure et un niveau de confiance, puis les associe à une séquence vidéo.
L'analyse locale limite les échanges inutiles avec un serveur distant. Le flux complet peut rester enregistré selon la politique définie, tandis qu'un événement peut déclencher un enregistrement ciblé et faciliter une recherche ultérieure. Cette séparation entre vidéo et métadonnées aide aussi à appliquer une politique de conservation cohérente avec les exigences de la CNIL et de l'AI Act.
Optimiser pour un équipement contraint
La quantification réduit la précision numérique de certains calculs. Le pruning retire des connexions moins utiles dans le modèle. Ces méthodes allègent la charge de calcul, mais une validation sur les scènes réelles reste nécessaire, notamment pour éviter de déplacer le problème vers davantage de faux positifs.
Le choix final repose sur un équilibre entre précision, consommation, stabilité et maintenance. Un modèle plus lourd peut mieux distinguer certaines situations, tandis qu'un modèle plus sobre s'adapte à une caméra moins énergivore. La pertinence du scénario et la maîtrise locale des données comptent davantage qu'une complexité difficile à exploiter.
Cas d'usage concrets en détection et analyse comportementale
À la tombée de la nuit, un site logistique isolé doit distinguer une intrusion du passage d'un animal. Une simple détection de mouvement confond ces situations. Un modèle de détection d'objets peut classer une personne, un véhicule ou une catégorie animale, puis déclencher une règle seulement lorsqu'une présence humaine franchit une zone périmétrique.
Le tracking ajoute la durée à l'analyse. La caméra suit une trajectoire au fil des images et vérifie si l'objet traverse une ligne, entre dans une zone ou y reste. Le responsable de la sécurité reçoit alors un événement lié à un scénario défini, plutôt qu'une alerte provoquée par une variation isolée de pixels. La réduction des faux positifs améliore le tri des alertes et évite de mobiliser inutilement un opérateur.

Adapter le scénario au lieu
Dans une école, l'objectif consiste à définir des événements précis plutôt qu'à analyser indistinctement chaque déplacement. Une chute dans une zone identifiée, un attroupement près d'une issue de secours ou une présence prolongée hors des horaires habituels sont des scénarios possibles. Ils combinent détection, suivi et règles spatiales ou temporelles.
La règle métier doit rester proportionnée à la finalité poursuivie. La vidéoprotection intelligente ne transforme pas automatiquement une caméra en outil d'identification des personnes. Les textes français associés à la vidéo intelligente excluent notamment l'identification biométrique et la reconnaissance faciale pour les systèmes concernés (documentation du ministère de l'Intérieur sur la vidéo intelligente).
Dans un parking d'entreprise, le comptage peut décrire les flux et signaler une occupation anormale. Le système peut compter des passages ou détecter un véhicule stationné dans une zone interdite, sans chercher l'identité du conducteur. Cette approche facilite une utilisation plus sobre des données et s'inscrit dans l'examen des finalités, des accès et de la conservation attendu au regard de la CNIL et de l'AI Act.
Des événements ciblés dans les espaces publics
Dans une gare ou un aéroport, un objet abandonné demande une logique différente de celle d'une intrusion. Le système détecte l'objet, observe sa persistance et associe sa présence à une zone. Un opérateur vérifie ensuite la situation avant toute décision opérationnelle.
Une caméra comme la CA20HD est décrite dans le catalogue comme une caméra tube avec IR, PoE et focale varifocale de 2,8 à 12 mm. Ces caractéristiques peuvent être prises en compte dans une étude de site, sans suffire à garantir la fiabilité d'un scénario. Le cadrage, l'éclairage, les zones définies et le réglage restent déterminants.
Pour les collectivités, les solutions de vidéoprotection pour la police municipale doivent être examinées selon les procédures locales, les responsabilités des agents et les finalités autorisées. La conformité et la maîtrise des données comptent autant que la performance annoncée.
Contraintes réelles à anticiper avant un déploiement
Une démonstration commerciale montre souvent une scène stable, bien éclairée, où chaque événement est facile à distinguer. Sur site, la pluie, les reflets, la végétation, les phares, les ombres et les changements de luminosité perturbent la perception du modèle. Une caméra peut alors multiplier les faux positifs, tout en manquant un événement réellement pertinent. Chaque alerte inutile mobilise un opérateur et réduit progressivement sa confiance dans le dispositif.
La qualité des données d'apprentissage intervient aussi. Le Sénat demande des jeux de données d'entraînement, de validation et de test pertinents, adéquats et représentatifs pour limiter les biais et les erreurs (exigences parlementaires sur les données des systèmes algorithmiques). Un modèle entraîné sur des scènes génériques peut réagir autrement dans une cour d'école, une zone industrielle ou une rue mal éclairée. Il faut donc confronter ses résultats aux conditions locales avant de généraliser son usage.
Les principales contraintes
| Contrainte | Impact opérationnel | Levier d'atténuation |
|---|---|---|
| Variations de lumière, pluie et végétation | Faux positifs, alertes ignorées, perte de confiance | Tester les scènes réelles et définir des zones d'intérêt précises |
| Puissance de calcul limitée | Arbitrage entre précision, consommation et chaleur | Choisir un modèle adapté au matériel et vérifier ses performances sur site |
| Données d'apprentissage insuffisamment représentatives | Biais, angles morts et erreurs de catégorisation | Valider les cas locaux et documenter les limites connues |
| Flux et stockage | Coûts d'infrastructure et conservation excessive | Transmettre les événements utiles, sécuriser le stockage et définir une durée proportionnée |
| Cadre RGPD et CNIL | Risque juridique, information incomplète, finalité mal définie | Réaliser l'analyse nécessaire, informer les personnes et limiter les traitements |
| AI Act et usages sensibles | Restrictions sur certaines pratiques et obligations renforcées | Qualifier le système, vérifier son usage et maintenir une veille réglementaire |
La conformité n'est pas une formalité finale
La CNIL rappelle qu'en dehors du cadre expérimental lié à la loi du 19 mai 2023 et aux Jeux olympiques et paralympiques, aucun texte général n'autorise l'analyse automatisée des images dans l'espace public. Cette expérimentation a été suivie jusqu'au 31 mars 2025, selon le rapport du Sénat sur la vidéoprotection algorithmique.
Avant toute installation, l'organisation doit donc préciser la finalité, vérifier la base légale, déterminer si une analyse d'impact relative à la protection des données est nécessaire, informer les personnes et encadrer la conservation. Les dispositifs embarqués doivent aussi intégrer des mesures concrètes, comme l'interruption immédiate lorsqu'ils filment des domiciles et le respect de durées de conservation définies.
L'AI Act ajoute un cadre européen. Depuis le 2 février 2025, certaines pratiques sensibles sont interdites, notamment la reconnaissance faciale en temps réel dans l'espace public, l'inférence des émotions au travail ou à l'école et certaines catégorisations biométriques sensibles (présentation de la stratégie nationale d'intelligence artificielle). Le projet doit être qualifié et validé avant l'achat du matériel. La performance algorithmique ne suffit pas, la réduction des faux positifs, la souveraineté des données et la conformité déterminent aussi la viabilité du déploiement.
Bonnes pratiques pour réussir l'intégration sur site
Une intégration réussie commence par un scénario observable : quel événement doit être détecté, dans quelle zone et pour quelle action humaine ? « Améliorer la sécurité » reste trop vague pour choisir un modèle. Une intrusion périmétrique, un comptage de flux ou une chute ne mobilisent ni les mêmes images, ni les mêmes règles de décision.
Une checklist de déploiement
Décrire le scénario. Formulez l'événement de manière vérifiable, par exemple : « une personne franchit cette ligne pendant cette plage horaire ». Écartez les objectifs flous comme « repérer les comportements suspects », difficiles à tester et susceptibles d'augmenter les faux positifs.
Étudier la scène. Contrôlez la hauteur, l'angle, la distance, l'éclairage et les obstacles. Une caméra mal cadrée fournit au modèle une image incomplète, comme un agent qui devrait décider à travers une fenêtre étroite.
Choisir le matériel selon la charge. Vérifiez la capacité NPU ou VPU, les fonctions disponibles, la consommation et la maintenance du firmware. L'équipement doit rester administrable pendant toute sa durée d'exploitation prévue, y compris lorsque le modèle évolue.
Masquer le superflu. Excluez ou masquez les zones sans intérêt opérationnel lorsque la configuration le permet. Le traitement porte ainsi sur ce qui répond à la finalité définie, avec moins d'images inutiles à gérer.
Régler avec les exploitants. Définissez les seuils de confiance, les lignes et les zones d'intérêt avec les opérateurs. L'installateur maîtrise la configuration technique, tandis que l'équipe de terrain connaît les horaires, les passages habituels et les exceptions. Ce réglage conjoint aide à réduire les alertes inutiles.
Observer après la mise en service. Journalisez les alertes, classez les erreurs et ajustez les paramètres à partir de scènes réelles. La réception du chantier marque le début du suivi, pas la fin du réglage.
La supervision humaine reste obligatoire dans la pratique opérationnelle : l'IA signale, l'agent vérifie et décide.
Organiser la maintenance
Prévoyez une période de suivi couvrant les variations de lumière, les conditions météorologiques et les rythmes d'occupation du site. Les opérateurs doivent savoir relier une alerte à son scénario, consulter le contexte vidéo et documenter une erreur.
La procédure précise aussi qui valide les mises à jour, comment les modèles sont testés et comment revenir à une configuration stable en cas de régression. Un audit régulier examine les finalités, les accès, les durées de conservation, les journaux et les évolutions des exigences liées à la CNIL et à l'AI Act. Ces contrôles rendent le dispositif exploitable dans la durée, au-delà de sa seule performance algorithmique.
Vers une vidéoprotection plus sobre et plus conforme
L'IA embarquée prend son sens lorsqu'elle rapproche trois exigences. Les modèles doivent fonctionner sur l'équipement, la finalité doit être claire et documentée, et l'architecture doit limiter les transferts, le stockage ainsi que le temps consacré à la levée de doute.
La détection ciblée remplace alors une surveillance indifférenciée. La caméra analyse localement un événement, transmet les éléments utiles et laisse l'agent examiner la séquence avant toute action. Comme un filtre placé à l'entrée du système, elle écarte une partie des scènes sans intérêt, tout en conservant la décision humaine.
La souveraineté concerne aussi les composants, les logiciels et les données. En France, l'État soutient le développement de l'IA embarquée et le collectif DeepGreen, piloté par le CEA, a annoncé une première plateforme open source dédiée à cette technologie, présentée comme un socle pour des réalisations stratégiques dès 2024 (initiative française autour de l'IA embarquée). Le choix d'une solution doit donc inclure sa maintenance, ses dépendances techniques et la localisation des traitements.
La recherche descriptive, fondée sur des modèles reliant vision et langage, pourrait permettre de retrouver une séquence à partir d'une description formulée naturellement. Cette fonction devra rester encadrée : faciliter l'interrogation des flux ne dispense ni de vérifier la finalité, ni de limiter l'accès aux images.
La stratégie nationale visait 10 à 15 % du marché mondial de l'IA embarquée à l'horizon 2025, selon les éléments institutionnels français (objectif public pour l'IA embarquée). Sur le terrain, la réussite se mesure plutôt à la précision utile, à la réduction des faux positifs, à la maîtrise des données et au respect de la CNIL et de l'AI Act. L'acceptabilité sociale dépend de ces garanties autant que des performances.
Vizeo accompagne les projets avec des caméras, des enregistreurs assemblés en France, des logiciels de supervision et un accompagnement technique, de l'étude à la mise en service. Pour cadrer un scénario d'IA embarquée, limiter les faux positifs et intégrer les contraintes de données, consultez Vizeo et échangez avec son équipe sur votre site.