Zum Inhalt
Tier C — Spezialist
Läuft in:US
OpenAI

OpenAI text-embedding-3-small

Tier C — Spezialist

Tokonomix-Redaktionsteam·Geprüft von Mes Kalkan·
Abschnitt 01

Preise

Was Sie pro Million Tokens zahlen, wenn Sie dieses Modell über Tokonomix nutzen, plus eine Schätzung für ein typisches Gespräch.

💰
API-Tarife — OpenAI text-embedding-3-small
$0.0300 pro 1M Input-Tokens
pro 1M Output-Tokens
≈ <$0.0001 pro typischem Gespräch (800 Tokens)
Input- vs. Output-Preis (pro 1M Tokens)
pro 1M Input-Tokens$0.0300
pro 1M Output-Tokens
Abschnitt 02

Verfügbarkeit

Verfügbarkeit

Noch keine Messdaten

Es wurden noch nicht genug API-Aufrufe aufgezeichnet, um Verfügbarkeitsstatistiken für dieses Modell anzuzeigen. Daten erscheinen, sobald das Modell Live-Traffic erhält.

Abschnitt 03

Tokonomix-Benchmark-Urteile

2026-06-21

Baseline established for text-embedding-3-small

OpenAI's text-embedding-3-small establishes its baseline performance in the benchmark window. This model represents OpenAI's smaller embedding option, designed to convert text into vector representations for semantic search, clustering, and similarity tasks. As this is the first verdict, no performance trends or changes can be identified yet. Future benchmark windows will track metrics such as retrieval accuracy, latency, throughput, and consistency across different text types and languages. The model will be evaluated against common embedding benchmarks and real-world use cases to provide users with actionable insights. Users adopting this model should monitor upcoming verdicts to understand how it performs over time and whether OpenAI introduces improvements or if any degradation occurs. The baseline window serves as the reference point for all future comparisons, making it critical for establishing expected behavior patterns. Subsequent verdicts will highlight any meaningful shifts in performance characteristics, allowing teams to make informed decisions about continued use or migration strategies.

Qualität

Latenz p50

Testläufe

0

Baseline established
Abschnitt 04

Vollständiges Modellprofil

text-embedding-3-small: das Standard-Embedding-Modell für die meisten Retrieval-Workloads

text-embedding-3-small ist OpenAIs kleineres, kostengünstigeres Embedding-Modell, veröffentlicht am 25. Januar 2024 zusammen mit dem größeren text-embedding-3-large. Ein Embedding-Modell wandelt Text in einen Vektor fester Länge um, der dessen Bedeutung repräsentiert, statt neuen Text zu erzeugen — zwei bedeutungsähnliche Passagen erzeugen Vektoren, die in diesem numerischen Raum nahe beieinander landen. Diese Eigenschaft liegt semantischer Suche, Clustering, Deduplizierung, Empfehlungen und Retrieval-Augmented Generation (RAG) zugrunde, wo ein System gespeicherte Passagen nach Relevanz für eine Anfrage ordnen muss, bevor ein Sprachmodell sie überhaupt zu Gesicht bekommt.

Wofür es gebaut ist

Standardmäßig gibt text-embedding-3-small einen Vektor mit 1.536 Dimensionen aus. Auf OpenAIs eigenem MTEB-Benchmark — einer Standard-Evaluierungssuite für Retrieval, Klassifikation und Clustering — erzielt es 62,3 Punkte, vor dem älteren Modell text-embedding-ada-002 mit 61,0, obwohl ada-002 dieselben 1.536 Dimensionen verwendet. Mit anderen Worten: Diese Generation verbesserte die Qualität bei unveränderter Vektorgröße, ein unkompliziertes Upgrade für alle, die noch die vorherige Generation nutzen.

Die maximale Eingabelänge beträgt 8.192 Token pro Anfrage, wie beim größeren Modell. Die Ausgabe ist rein embeddingbasiert: kein Chat, keine Generierung, kein Werkzeugeinsatz — ein einzelner Aufruf nimmt einen String entgegen und liefert ein Array von Floats fester Größe zurück.

Der dimensions-Parameter

Wie sein größeres Geschwistermodell unterstützt text-embedding-3-small einen dimensions-Parameter, der den Ausgabevektor auf eine kürzere Länge kürzt, ohne erneut über ein anderes Modell einzubetten. Das Kürzen des Vektors reduziert den Speicherbedarf in einer Vektordatenbank und beschleunigt Ähnlichkeitsvergleiche zur Abfragezeit, was nützlich ist, wenn der Index groß genug ist, dass Speicher und Suchlatenz beginnen, die Kosten zu dominieren — eine übliche Situation, sobald ein Korpus Millionen von Dokumenten erreicht.

Wo es sich seinen Platz verdient

Der zentrale Grund für text-embedding-3-small ist Volumen: hohe Dokumentenzahlen, häufige Neuindizierung und ein Abfragemuster mit engen Latenzbudgets. Die geringeren Kosten pro Aufruf und die kleinere Standard-Vektorgröße summieren sich im großen Maßstab — jedes indizierte Dokument und jede eingebettete Abfrage verursacht reale, laufende Speicher- und Rechenkosten, und bei großen Korpora summiert sich das, unabhängig davon, wie gut die Qualität pro Embedding ist.

Es ist zudem eine vernünftige Standardwahl für Retrieval-Aufgaben, die nicht adversarial oder feinkörnig sind: allgemeine Dokumentsuche, FAQ-Matching, Deduplizierung nahezu identischer Inhalte und RAG-Pipelines, bei denen der Retrieval-Schritt „gut genug" statt maximal präzise sein muss, weil das Sprachmodell, das die abgerufenen Passagen liest, etwas Rauschen in den Ergebnissen verkraften kann.

Wo die Grenzen sichtbar werden

Die MTEB-Lücke zu text-embedding-3-large ist real, wenn auch moderat, und sie tendiert dazu, sich bei schwierigeren Retrieval-Aufgaben zu vergrößern — dem Unterscheiden eng verwandter Passagen, der Arbeit in weniger verbreiteten Sprachen oder dem präzisen Ranking vieler ähnlicher Kandidaten. Für ein RAG-System, das messbar relevante Passagen verpasst, oder eine Suchfunktion, die Beinahe-Treffer liefert, ist die Lösung oft der Wechsel zum größeren Modell statt der weiteren Feinabstimmung des kleineren.

Alternativen im Vergleich

text-embedding-3-large ist der natürliche Upgrade-Pfad, wenn die Retrieval-Qualität und nicht die Kosten der Flaschenhals sind. text-embedding-ada-002 bleibt verfügbar, wird aber bei gleicher Vektorgröße qualitativ von diesem Modell übertroffen, sodass es wenig Grund gibt, es für neue Arbeiten zu wählen. Außerhalb von OpenAI bieten mehrere Anbieter vergleichbare allgemeine Embedding-Modelle an; das Testen der Retrieval-Qualität an einer repräsentativen Stichprobe des eigenen Korpus ist ein besserer Leitfaden als Benchmark-Werte allein, da sich die Embedding-Leistung nicht immer gleichmäßig zwischen Domänen überträgt.

Letzter automatisierter Test
21. Juni 2026 · 04:48 UTC · Benchmark
P50-Latenz
P95-Latenz
Fehler
1 / 3 Läufe
Zuletzt geprüft von Tokonomix-Team·14. September 2026