
Ce volet poursuit une série sur la technologie derrière le FSD de Tesla, en couvrant précédemment le traducteur universel qui adapte le FSD à différents matériels, les pipelines de données qui automatisent l’annotation, et ce que le véhicule perçoit dans son environnement.
Il reste à voir comment le système perçoit visuellement le monde. Deux demandes de brevet de Tesla apportent un éclairage essentiel.
Tout système autonome du monde réel doit résoudre deux problèmes fondamentaux : déterminer avec précision la distance et la vitesse d’un objet, et traiter l’énorme flux visuel provenant de plusieurs caméras haute résolution qui capturent des scènes proches comme lointaines — sans nécessiter un superordinateur dans chaque véhicule.
Alors que de nombreux concurrents s’en chargent avec du matériel supplémentaire coûteux et une fusion de capteurs complexe, Tesla mise sur la vision et aborde ces défis différemment.
Résoudre la profondeur
Le premier brevet, intitulé “Estimating Object Properties Using Visual image Data”, explique pourquoi Tesla ne s’appuie pas sur le LiDAR, sauf pour la validation. L’idée centrale est de constituer un très vaste jeu de données d’entraînement.
Le jeu de données couvre des millions de miles parcourus par des clients ordinaires, complétés par des véhicules d’ingénierie de validation. Les voitures de validation utilisent des capteurs auxiliaires pour fournir des mesures de référence extrêmement précises de la distance et de la vitesse, ensuite utilisées pour entraîner le FSD.
Tesla utilise un pipeline automatisé pour enseigner au réseau neuronal de vision. Lorsqu’un véhicule de validation roule, il enregistre une série temporelle d’images de caméras avec les données auxiliaires. En suivant un véhicule ou un objet sur plusieurs images, le système lève les ambiguïtés — comme deux voitures très proches ou des occultations partielles — et associe les données précises des capteurs auxiliaires au bon objet dans les images.
Ce processus produit un ensemble de données massif et d'une grande précision, utilisé pour entraîner le réseau de vision FSD. Il permet au FSD de déduire la profondeur et la vitesse à partir d'images 2D avec une précision proche de celle des capteurs auxiliaires. Une fois que le Model est entraîné avec un haut degré de précision et validé, il peut être déployé sur l'ensemble de la flotte de clients, supprimant ainsi la nécessité d'un matériel de validation coûteux dans ces véhicules.
En substance, Tesla Vision remplace des capteurs physiques coûteux par un puissant réseau neuronal.
Résoudre l’efficacité
Le défi suivant consiste à gérer l’énorme volume de données provenant de plusieurs caméras haute résolution sans saturer l’ordinateur du véhicule. Un deuxième brevet, “Enhanced Object Detection for Autonomous Vehicles Based on Field of View”, décrit une méthode élégante.
Traiter une image en pleine résolution provenant d’une caméra frontale est coûteux en calcul. Une solution courante consiste à sous-échantillonner, mais cela rend plus difficile la détection de petits objets éloignés ou la lecture de détails comme les panneaux de vitesse. Une voiture évidente à 200 meters peut devenir un amas indistinct de pixels, ou un panneau indiquant 80 peut être lu comme 30 après sous-échantillonnage.
L’approche de Tesla s’inspire de l’œil humain. Le système sélectionne un champ de vision prioritaire — généralement une bande horizontale près de l’horizon — où les objets éloignés mais importants ont le plus de chances d’apparaître.
Le FSD effectue ensuite deux tâches en parallèle :
- Analyser un recadrage haute résolution de cette zone prioritaire afin de préserver la netteté des objets lointains.
- Analyser une version sous-échantillonnée et de plus faible résolution du reste de l’image afin de détecter efficacement les objets plus proches qui ne nécessitent pas de détails supplémentaires.
Les deux sorties sont fusionnées, offrant au véhicule une vision complète à la fois longue portée et efficace sur le plan du calcul. En termes de rendu, cela correspond au rendu fovéalisé — appliqué ici en sens inverse. En concentrant la puissance de calcul là où elle compte le plus, le FSD reste évolutif sans avoir à embarquer un cluster de calcul dans chaque véhicule.
Une solution unifiée et évolutive
Ensemble, ces deux brevets illustrent la manière dont Tesla exécute sa stratégie tout-vision : s’attaquer aux problèmes d’autonomie les plus difficiles en construisant une pile logicielle plus intelligente et plus efficace plutôt qu’en compensant avec davantage de matériel.
Pour aller plus loin sur les brevets Tesla et le FSD :
- Comment fonctionne le FSD — Partie 1
- Comment fonctionne le FSD — Partie 2
- Comment fonctionne le FSD — Partie 4 (cet article)
- Le traducteur universel IA de Tesla
- Comment Tesla optimise le FSD
- Comment Tesla étiquettera les données avec l’IA















Partager:
La nouvelle fonctionnalité d’automatisations de Tesla en action [VIDÉO]
Ce que Tesla devrait ajouter à Tesla Theater