Aller au contenu
Tier C — Spécialiste
Fonctionne en :US
OpenAI

OpenAI text-embedding-3-small

Tier C — Spécialiste

Équipe éditoriale Tokonomix·Relu par Mes Kalkan·
Section 01

Tarifs

Ce que vous payez par million de tokens en utilisant ce modèle sur Tokonomix, avec une estimation pour une conversation type.

💰
Tarifs API — OpenAI text-embedding-3-small
$0.0300 par 1M de tokens d'entrée
par 1M de tokens de sortie
≈ <$0.0001 par conversation typique (800 tokens)
Prix entrée vs sortie (par 1M de tokens)
par 1M de tokens d'entrée$0.0300
par 1M de tokens de sortie
Section 02

Disponibilité

Disponibilité

Pas encore de données

Nous n'avons pas encore enregistré suffisamment d'appels API pour afficher les statistiques de disponibilité de ce modèle. Les données apparaîtront dès que le modèle reçoit du trafic en direct.

Section 03

Verdicts benchmark Tokonomix

2026-06-21

Baseline established for text-embedding-3-small

OpenAI's text-embedding-3-small establishes its baseline performance in the benchmark window. This model represents OpenAI's smaller embedding option, designed to convert text into vector representations for semantic search, clustering, and similarity tasks. As this is the first verdict, no performance trends or changes can be identified yet. Future benchmark windows will track metrics such as retrieval accuracy, latency, throughput, and consistency across different text types and languages. The model will be evaluated against common embedding benchmarks and real-world use cases to provide users with actionable insights. Users adopting this model should monitor upcoming verdicts to understand how it performs over time and whether OpenAI introduces improvements or if any degradation occurs. The baseline window serves as the reference point for all future comparisons, making it critical for establishing expected behavior patterns. Subsequent verdicts will highlight any meaningful shifts in performance characteristics, allowing teams to make informed decisions about continued use or migration strategies.

Qualité

Latence p50

Exécutions de test

0

Baseline established
Section 04

Profil complet du modèle

text-embedding-3-small : le modèle d'embedding par défaut pour la plupart des workloads de récupération

text-embedding-3-small est le modèle d'embedding plus petit et moins coûteux d'OpenAI, sorti le 25 janvier 2024 aux côtés du plus grand text-embedding-3-large. Un modèle d'embedding transforme du texte en un vecteur de nombres de longueur fixe représentant son sens, plutôt que de générer du nouveau texte — deux passages de sens proche produisent des vecteurs qui se retrouvent proches l'un de l'autre dans cet espace numérique. Cette propriété est à la base de la recherche sémantique, du clustering, de la déduplication, de la recommandation et de la génération augmentée par récupération (RAG), où un système doit classer des passages stockés par pertinence par rapport à une requête avant même qu'un modèle de langage ne les voie.

Ce pour quoi il est conçu

Par défaut, text-embedding-3-small produit un vecteur de 1 536 dimensions. Sur le propre benchmark MTEB d'OpenAI — une suite d'évaluation standard couvrant récupération, classification et clustering — il obtient 62,3, devançant l'ancien modèle text-embedding-ada-002 à 61,0, bien qu'ada-002 utilise les mêmes 1 536 dimensions. Autrement dit, cette génération a amélioré la qualité à taille de vecteur inchangée, ce qui représente une mise à niveau simple pour quiconque utilise encore la génération précédente.

La longueur maximale d'entrée est de 8 192 tokens par requête, comme pour le modèle plus grand. La sortie est uniquement de l'embedding : pas de chat, pas de génération, pas d'usage d'outils — un seul appel prend une chaîne de caractères et renvoie un tableau de flottants de taille fixe.

Le paramètre dimensions

Comme son grand frère, text-embedding-3-small prend en charge un paramètre dimensions qui raccourcit le vecteur de sortie à une longueur plus courte sans réencoder via un autre modèle. Raccourcir le vecteur réduit le stockage dans une base de données vectorielle et accélère les comparaisons de similarité au moment de la requête, ce qui est utile lorsque l'index est assez grand pour que le stockage et la latence de recherche commencent à dominer le coût — une situation courante une fois qu'un corpus atteint des millions de documents.

Là où il trouve sa place

La raison principale de choisir text-embedding-3-small est le volume : un grand nombre de documents, une réindexation fréquente, et un schéma de requêtes où les budgets de latence sont serrés. Son coût plus faible par appel et sa taille de vecteur par défaut plus petite s'accumulent à l'échelle — chaque document indexé et chaque requête encodée entraîne un coût de stockage et de calcul réel et continu, et pour de grands corpus, cela s'additionne quelle que soit la qualité de chaque embedding pris isolément.

C'est aussi un choix par défaut raisonnable pour les tâches de récupération non adversariales ou peu exigeantes en finesse : recherche documentaire générale, correspondance de FAQ, déduplication de contenu quasi identique, et pipelines RAG où l'étape de récupération doit être « suffisamment bonne » plutôt que maximalement précise, car le modèle de langage qui lit les passages récupérés peut tolérer un peu de bruit dans ce qui est retrouvé.

Là où les limites apparaissent

L'écart MTEB avec text-embedding-3-large est réel, quoique modeste, et il tend à s'élargir sur les tâches de récupération les plus difficiles — distinguer des passages étroitement liés, travailler dans des langues moins courantes, ou classer avec précision de nombreux candidats similaires. Pour un système RAG qui manque de façon mesurable des passages pertinents, ou une fonction de recherche qui renvoie des quasi-correspondances, la solution consiste souvent à passer au modèle plus grand plutôt qu'à continuer d'ajuster le plus petit.

Alternatives à comparer

text-embedding-3-large est la voie de mise à niveau naturelle lorsque la qualité de récupération, et non le coût, est le goulot d'étranglement. text-embedding-ada-002 reste disponible mais est dominé en qualité par ce modèle à taille de vecteur égale, donc il y a peu de raisons de le choisir pour un nouveau travail. En dehors d'OpenAI, plusieurs fournisseurs proposent des modèles d'embedding généralistes comparables ; tester la qualité de récupération sur un échantillon représentatif de votre propre corpus est un meilleur guide que les seuls scores de benchmark, car la performance des embeddings ne se transpose pas toujours uniformément d'un domaine à l'autre.

Dernier test automatisé
21 juin 2026 · 04:48 UTC · Benchmark
Latence P50
Latence P95
Erreurs
1 / 3 exécutions
Dernière revue par Équipe Tokonomix·14 septembre 2026