Points cles a retenir
- La recherche exacte echoue des qu'un mot est mal orthographie, qu'une piece est decrite autrement ou qu'une reference est partielle : elle compare des chaines de caracteres, pas du sens.
- Un embedding transforme un texte en vecteur de centaines de nombres : deux pieces au sens proche se retrouvent proches dans cet espace, meme sans mot commun.
- La similarite cosinus mesure l'angle entre deux vecteurs pour quantifier a quel point deux descriptions parlent de la meme chose, de 0 (sans rapport) a 1 (quasi identique).
- SparePilot combine quatre approches en cascade (plein-texte, reference OEM exacte, equivalences, recherche semantique) pour ne jamais laisser une requete sans reponse pertinente.
- La base couvre 85 000+ produits, environ 446 000 references OEM, 494 000 pieces canoniques vectorisees et plus de 82 000 equivalences croisees.
Chercher une piece detachee de motoculture devrait etre simple : on tape une reference, on obtient la piece. Dans la vraie vie, l'utilisateur tape une reference incomplete, fait une faute, ou decrit la piece avec ses propres mots. La recherche exacte rend alors zero resultat alors que la piece existe. Cet article explique, sans jargon inutile, pourquoi la recherche semantique change la donne et comment SparePilot l'orchestre.
Pourquoi la recherche exacte ne suffit-elle pas ?
Une recherche exacte compare des caracteres, pas du sens : si la requete ne correspond pas lettre pour lettre a une donnee stockee, elle ne renvoie rien. Or les etudes sur le comportement de recherche, comme celles synthetisees par le Nielsen Norman Group, 2023, montrent qu'une part importante des requetes contiennent des fautes ou des formulations imprevues.
Les trois pannes classiques de la recherche exacte
- La faute de frappe : carburateur ecrit carburatuer renvoie zero resultat alors que la piece est en base.
- La description differente : un utilisateur cherche lame de coupe pendant que la fiche dit lame mulching ; aucun mot commun, aucun match.
- La reference partielle : on connait les six premiers caracteres d'une reference OEM mais pas la fin, et la recherche stricte exige la chaine complete.
Le cout invisible du zero resultat
Un zero resultat n'est jamais neutre. Pour un revendeur, c'est une vente potentielle perdue ; pour un technicien SAV, c'est une machine immobilisee plus longtemps. Le probleme n'est pas que la piece manque : elle existe presque toujours en base. Le probleme est que l'outil ne sait pas faire le lien entre ce que l'utilisateur a tape et ce qui est stocke.
Les rustines classiques et leurs limites
On tente souvent de colmater la recherche exacte avec des correcteurs orthographiques, des listes de synonymes ou des recherches par sous-chaine. Ces rustines aident a la marge mais restent fragiles : un dictionnaire de synonymes doit etre maintenu a la main, ne couvre jamais tout le vocabulaire metier de la motoculture, et ignore les tournures inattendues. La recherche par sous-chaine, elle, ramene du bruit des qu'une requete est courte. Aucune de ces approches ne comprend reellement ce que veut l'utilisateur ; elles continuent de raisonner en caracteres, pas en intentions.
Qu'est-ce qu'un embedding, explique simplement ?
Un embedding est une representation numerique du sens d'un texte : un modele lit une phrase et produit un vecteur, c'est-a-dire une longue liste de nombres (souvent 384 a 1024 dimensions) qui code son sens. Cette technique, popularisee par les travaux fondateurs sur word2vec de Mikolov et al., 2013, est aujourd'hui au coeur de la recherche moderne.
Du mot au vecteur : l'intuition
Imaginez une carte ou chaque piece est un point. Les pieces au sens proche sont placees cote a cote, celles sans rapport sont eloignees. Lame de tondeuse et lame de coupe atterrissent au meme endroit meme sans partager de mot exact, parce que le modele a appris qu'elles parlent de la meme chose. C'est cette carte, en plusieurs centaines de dimensions, qu'un embedding construit.
Comment le modele apprend le sens
Les modeles d'embedding modernes, comme la famille Sentence-BERT decrite par Reimers et Gurevych, 2019, sont entraines sur d'immenses corpus pour rapprocher les phrases de sens proche et eloigner les autres. Resultat : un terme jamais vu littéralement dans une fiche peut quand meme la faire remonter, du moment que le sens correspond. C'est exactement ce qui manque a la recherche exacte.
Pourquoi vectoriser 494 000 pieces
Sur SparePilot, chaque piece canonique recoit son embedding, soit 494 000 vecteurs stockes. Une fois cette carte construite, retrouver les voisins d'une requete devient une operation geometrique rapide. La librairie de reference dans cet ecosysteme, sentence-transformers, 2024, permet justement de generer ces vecteurs en lot, conformement a la regle d'enrichissement par batch du projet.
Comment mesure-t-on que deux pieces se ressemblent ?
On mesure la proximite de deux vecteurs avec la similarite cosinus : elle calcule l'angle entre eux et renvoie un score de 0 (aucun rapport) a 1 (sens quasi identique). Cette metrique est la norme pour la recherche vectorielle, comme le rappelle la documentation de l'extension PostgreSQL pgvector, 2024.
La similarite cosinus en une image
Deux fleches qui pointent dans la meme direction ont un angle faible, donc une similarite proche de 1, peu importe leur longueur. Deux fleches perpendiculaires ont une similarite de 0. La recherche semantique consiste a transformer la requete en fleche, puis a trouver les fleches deja stockees qui pointent le plus dans la meme direction.
| Type de recherche | Force principale | Limite |
|---|---|---|
| Plein-texte | Rapide, precis sur les mots exacts et l'orthographe correcte | Aveugle aux synonymes, aux fautes et aux descriptions differentes |
| Reference OEM exacte | Match immediat et certain quand la reference complete est connue | Inutile si la reference est partielle, mal saisie ou inconnue |
| Equivalences | Relie une reference a ses equivalents cross-marque | Depend d'une reference de depart deja identifiee |
| Semantique (vecteurs) | Trouve par le sens, tolere fautes et formulations libres | Plus couteuse en calcul, peut renvoyer des voisins approximatifs |
Le seuil de pertinence
Tous les voisins ne se valent pas. On fixe un seuil de similarite en dessous duquel un resultat est juge trop eloigne pour etre montre. Trop bas, on noie l'utilisateur de bruit ; trop haut, on retombe dans le zero resultat. Le bon reglage est un equilibre, ajuste sur des requetes reelles du domaine motoculture.
Qu'est-ce que la recherche hybride en cascade ?
La recherche hybride combine plusieurs methodes au lieu d'en choisir une seule : SparePilot enchaine plein-texte, reference OEM, equivalences puis semantique, du plus precis au plus tolerant. Cette approche hybride est aujourd'hui recommandee par les acteurs de la recherche vectorielle comme Elastic, 2024, car aucune methode seule ne couvre tous les cas.
L'ordre de la cascade
- Plein-texte d'abord : si la requete correspond a des mots exacts, on repond instantanement, sans calcul vectoriel.
- Reference OEM ensuite : une reference reconnue declenche un match direct sur les 446 000 references indexees.
- Equivalences : a partir d'une reference identifiee, on remonte les 82 000+ liens cross-marque pour proposer les pieces interchangeables.
- Semantique en filet de securite : si les etapes precedentes ne donnent rien de satisfaisant, on bascule sur les vecteurs pour retrouver la piece par le sens.
Pourquoi la cascade plutot qu'une seule methode
Lancer systematiquement la recherche vectorielle serait plus lent et parfois moins precis que le plein-texte sur une requete propre. Inversement, s'arreter au plein-texte abandonnerait l'utilisateur des qu'il fait une faute. La cascade prend le meilleur de chaque etage : vitesse et exactitude quand c'est possible, tolerance et comprehension du sens quand c'est necessaire.
Un exemple concret de bout en bout
Un utilisateur tape filtre a air mousse pour debroussailleuse sans connaitre la reference. Le plein-texte capte filtre et air, la semantique rapproche mousse de filtre cyclonique et de la bonne categorie, et si une reference equivalente existe, la couche equivalences propose les variantes cross-marque. L'utilisateur obtient une liste pertinente la ou une recherche stricte aurait rendu zero resultat.
Pourquoi pgvector et PostgreSQL
Stocker 494 000 vecteurs ne sert a rien si on ne peut pas les interroger vite. SparePilot s'appuie sur l'extension pgvector de PostgreSQL, qui ajoute un type de donnees vecteur et des index specialises (comme IVFFlat) capables de retrouver les plus proches voisins sans comparer la requete a chaque piece une par une. Concretement, la base ne calcule pas 494 000 similarites a chaque recherche : elle utilise l'index pour ne regarder qu'un sous-ensemble pertinent de candidats, ce qui maintient des temps de reponse compatibles avec une recherche interactive. Garder les vecteurs dans le meme PostgreSQL que les references et les equivalences simplifie aussi l'architecture : un seul magasin de donnees, des jointures naturelles entre couches, et la cascade qui s'execute sans aller-retour vers un service externe.
Quel benefice concret pour l'utilisateur ?
Le benefice est direct : trouver la bonne piece meme sans connaitre sa reference exacte. C'est exactement ce que recherchent les acheteurs de pieces detachees, dont une majorite demarre par une description ou une recherche imprecise plutot que par un numero, comme l'observent les analyses sectorielles de Hedges and Company, 2023 sur l'aftermarket.
Ce que ca change au quotidien
- Moins de zero resultat : une faute ou une formulation libre ne bloque plus la recherche.
- Recherche en langage naturel : on decrit la piece comme on la dirait a un comptoir.
- References partielles exploitables : la cascade rattrape ce que le match strict laisse passer.
- Equivalents proposes automatiquement : on decouvre des pieces interchangeables sans les chercher.
Pour les developpeurs et les decideurs B2B
Cette mecanique n'est pas qu'une amelioration d'ergonomie : elle se branche via API. Si vous integrez la recherche dans un site revendeur ou un ERP, le moteur hybride se consomme comme un service. Notre guide d'integration de l'API SparePilot pour developpeurs detaille les endpoints, l'authentification et les bonnes pratiques de pagination.
Comprendre les briques references avant d'aller plus loin
La couche semantique s'appuie sur des fondations references solides. Pour bien saisir la difference entre une reference d'origine et ses equivalents, lisez notre article comprendre les references OEM et les cross-references. Et pour le cas pratique du remplacement entre marques, voyez trouver un equivalent cross-marque a partir d'une reference OEM.
Vous cherchez une piece dont vous ne connaissez que la description ou une reference incomplete ? Decrivez-la dans la recherche intelligente de sparepilot.com : la cascade plein-texte, OEM, equivalences et semantique se charge de retrouver la bonne piece, meme sans le numero exact.
Questions frequentes
Quelle difference entre recherche exacte et recherche semantique ?
La recherche exacte compare des chaines de caracteres : elle ne renvoie un resultat que si la requete correspond lettre pour lettre a une donnee stockee. La recherche semantique compare du sens : elle transforme la requete et les fiches en vecteurs, puis trouve les pieces dont le sens est proche, meme sans mot commun. Resultat, elle tolere les fautes de frappe, les synonymes et les descriptions formulees librement, la ou la recherche exacte rend zero resultat.
Qu'est-ce qu'un embedding en recherche de pieces ?
Un embedding est une representation numerique du sens d'un texte sous forme de vecteur, c'est-a-dire une liste de plusieurs centaines de nombres. Chaque piece de la base est convertie en vecteur, ce qui revient a la placer sur une carte ou les pieces au sens proche sont voisines. Pour retrouver une piece, on convertit la requete en vecteur et on cherche ses plus proches voisins sur cette carte, independamment des mots exacts employes.
Comment fonctionne la similarite cosinus ?
La similarite cosinus mesure l'angle entre deux vecteurs et renvoie un score de 0 a 1. Deux vecteurs qui pointent dans la meme direction ont une similarite proche de 1, donc un sens quasi identique ; deux vecteurs sans rapport tendent vers 0. En recherche de pieces, on transforme la requete en vecteur puis on classe les pieces par score decroissant, en gardant celles au-dessus d'un seuil de pertinence pour eviter le bruit.
Qu'est-ce que la recherche hybride en cascade ?
C'est une strategie qui enchaine plusieurs methodes du plus precis au plus tolerant : plein-texte d'abord, puis reference OEM exacte, puis equivalences cross-marque, et enfin recherche semantique par vecteurs en filet de securite. Chaque etage repond quand il le peut ; on ne bascule sur le suivant que si necessaire. Cette approche combine la vitesse et l'exactitude des methodes strictes avec la tolerance de la recherche semantique.
Peut-on trouver une piece sans connaitre sa reference exacte ?
Oui, c'est precisement l'interet de la recherche semantique et hybride. En decrivant la piece en langage naturel, ou en saisissant une reference partielle ou mal orthographiee, le moteur retrouve les pieces les plus proches par le sens et propose au besoin des equivalents cross-marque. La plupart des recherches de pieces detachees demarrent d'ailleurs par une description plutot que par un numero complet, ce que cette approche gere nativement.
Trouvez la piece compatible avec votre machine
Comparez les prix sur 93 000 produits et 770 000 références OEM.


