Je suis Carlos Adrián Serna = artiste électronique;

Système de suivi oculaire

Système de suivi oculaire

De nombreuses solutions de vision par ordinateur fondées sur l’apprentissage profond n’offrent pas encore les performances et la stabilité nécessaires pour fonctionner en temps réel sur des appareils d’entrée de gamme. Je suis actuellement en voyage et je profite des trajets en train et des pauses pour améliorer mon système de suivi oculaire destiné aux performances audiovisuelles. La première version remplissait sa fonction, mais avec quelques « particularités ».

Pour mes projets actuels, j’ai besoin d’un système robuste et efficace. J’ai exploré des implémentations d’IA comme YOLO v3, v4, v8 et leurs versions « tiny », ainsi que MobileNet-SSD v1 et v2. ChatGPT est utile ici pour implémenter et transposer rapidement les modèles d’une plateforme à l’autre ; autrement, il aurait fallu des semaines pour comparer les performances, choisir un modèle et l’implémenter. J’ai entraîné chaque modèle avec les données d’une version plus précise mais plus lente de mon système initial, fondée sur le k-means d’OpenCV.

Résultats

  • MobileNet-SSD v2: j’ai atteint 20 images/s en 640×480 sur un processeur i7 à 2,5 GHz, ce qui en faisait le plus rapide.
  • MobileNet-SSD v1: suivait de près la v2.
  • YOLO v3 tiny et autres : atteignaient à peine 8 images/s.

À ce stade, les résultats tremblaient et donnaient des données différentes entre des images presque identiques. Réduire davantage les capacités pour gagner en vitesse n’était pas viable.

Changement d’approche

Je suis revenu aux méthodes de vision par ordinateur « classiques » (bientôt, nous les appellerons rétro), avec le bon vieux et fiable OpenCV. J’ai utilisé un seuillage adaptatif et des filtres médians sur une image réduite pour trouver la région d’intérêt (ROI), puis détecté les contours et appliqué un ajustement circulaire par moindres carrés sur l’image originale. J’ai ainsi atteint 40 images/s sur des images de 1620×1080.

C’est une solution pour un cas très particulier dans un contexte contrôlé, mais elle montre que les algorithmes traditionnels restent une alternative très puissante.

Je n’exclus pas d’améliorer encore l’efficacité grâce aux algorithmes d’IA. Au cours du processus, des idées ont émergé qui pourraient mieux fonctionner en exploitant des caractéristiques plus complexes des images dans des environnements contrôlés.

Fiche technique

Type
Développement technique propre
Technique
Vision par ordinateur classique avec OpenCV : seuillage adaptatif, filtre médian, contours et ajustement circulaire par moindres carrés
Modèles comparés
YOLO v3 · YOLO v4 · YOLO v8 y sus versiones tiny · MobileNet-SSD v1 · MobileNet-SSD v2
Performances
40 images/s en 1620×1080 (MobileNet-SSD v2 : 20 images/s en 640×480)
Usage
Performance audiovisuelle
Année
2024

L’un des instruments développés sur mesure.