Naar inhoud
Tier B — Productie
Draait in:USGemaakt in:United States

Gearchiveerd

Dit model is door de aanbieder uit productie genomen. Historische data blijft bewaard.

Niet meer beschikbaar sinds 1 december 2026.

OpenAI

gpt-image-1.5

Tier B — Productie

Tokonomix-redactie·Gecontroleerd door Mes Kalkan··

GPT-Image-1.5 is een tekstgeneratiemodel ontwikkeld door OpenAI. Ondanks dat de naam beeldmogelijkheden suggereert, is dit model geconfigureerd voor standaard tekstgeneratietaken. Het opereert binnen het ecosysteem van taalmodellen van OpenAI en verwerkt tekstinvoer om tekstuitvoer te produceren voor diverse toepassingen, waaronder conversationele AI, contentgeneratie en algemene natuurlijke taalverwerkingstaken. De specificaties van het contextvenster van het model zijn niet openbaar gemaakt, wat gevolgen kan hebben voor toepassingen die langdurige documentverwerking of uitgebreide conversatiegeschiedenis vereisen. Als standaard tekstgeneratiemodel voert het basisfuncties uit op het gebied van taalbegrip en -generatie, zonder gespecialiseerde mogelijkheden op gebieden zoals function calling, beeldverwerking of multimodaal begrip. Het model verwerkt natuurlijke taalqueries en genereert coherente antwoorden op basis van patronen die tijdens de training zijn geleerd. Binnen de modelreeks van OpenAI vertegenwoordigt GPT-Image-1.5 een gespecialiseerd aanbod dat verschilt van de prominentere GPT-4- en GPT-3.5-series van het bedrijf. Hoewel OpenAI verschillende modellen heeft uitgebracht die gericht zijn op uiteenlopende toepassingen en prestatievereisten, bestaat er beperkte publieke documentatie over de trainingsmethodologie, het aantal parameters of de beoogde positionering van dit specifieke model ten opzichte van andere aanbiedingen. Organisaties die dit model evalueren, dienen rekening te houden met het gebrek aan publiek beschikbare technische specificaties bij het beoordelen van de geschiktheid voor productie-implementaties die specifieke prestatiekenmerken of gegarandeerde mogelijkheden vereisen.

gpt-image-1.5 verwerkt zowel tekst als afbeeldingen voor multimodale analyse en begrip.

Tokonomix benchmark-samenvatting
Sectie 01

Prijsgeschiedenis

Directe provider-tarieven per miljoen tokens, plus een typische gespreks-kostschatting.

💰
API-tarieven — gpt-image-1.5
$5.00 per 1M input-tokens
$10.00 per 1M output-tokens
≈ $0.0050 per typisch gesprek (800 tokens)
Input vs output prijs (per 1M tokens)
per 1M input-tokens$5.00
per 1M output-tokens$10.00

Pricing over time

Input & output per 1M tokens · step-line = price changes

$5.00

input / 1M

— stable

$10.00

output / 1M

— stable

2026-05-242026-07-192026-09-06
Input
Output
Price change
⟳ synced weekly
Sectie 02

Sterke & zwakke punten

Gebaseerd op benchmark-resultaten en geaggregeerde community-feedback over echte use-cases.

Sterke punten

Tekst én afbeeldingen begrijpenVisuele content analyserenGrafieken en tabellen lezenMultimodale redeneringGeschikt voor document-AIEenvoudige API-toegang

Zwakke punten

Beeldverwerking duurder dan tekstGeen afbeeldinggeneratieMinder sterk bij gespecialiseerde beelden
Sectie 03

Mogelijkheden

source: litellmvisionpdf inputimage editingimage generation
Sectie 04

Veelgestelde vragen

gpt-image-1.5 ondersteunt gangbare formaten zoals JPEG, PNG en GIF. Raadpleeg de API-documentatie voor maximale resoluties en bestandsgroottes.

Een veelzijdig model voor toepassingen waarbij visuele en tekstuele informatie samenkomen.

Tokonomix benchmark-samenvatting
Sectie 05

Beschikbaarheid

Beschikbaarheid

Nog geen meetdata

Er zijn nog niet genoeg API-aanroepen geregistreerd om beschikbaarheidsstatistieken voor dit model te tonen. Data verschijnt zodra het model live verkeer ontvangt.

Sectie 06

Tokonomix benchmark-oordelen

2026-09-06

Multimodal model debuts with vision, PDF, and image generation capabilities

This model represents OpenAI's entry into comprehensive multimodal AI, combining vision understanding, PDF processing, image editing, and image generation in a single model. The addition of vision capabilities allows the model to analyze and describe images, while PDF input support enables direct document processing without extraction steps. Image editing and generation capabilities expand the model's creative toolkit, though specific performance metrics on these tasks are not yet available from benchmark testing. As a new model in the benchmark window, baseline performance data is still being established across standard evaluation metrics. Users should expect this to be a general-purpose multimodal model suitable for tasks requiring visual understanding, document analysis, and creative image work. The combination of capabilities suggests OpenAI's intent to provide a unified interface for text and vision tasks rather than requiring separate specialized models. Early adopters should monitor for performance characteristics as benchmark data accumulates, particularly around accuracy on vision tasks, quality of generated images, and reliability of PDF extraction compared to specialized alternatives.

Kwaliteit

Latency p50

Testruns

0

Vision capabilities added PDF input support enabled Image editing introduced Image generation available
Sectie 07

Volledig modelprofiel

gpt-image-1.5 — illustration 1
gpt-image-1.5: de iteratieve opfrisbeurt die stilletjes de ruwe kantjes van gpt-image-1 wegwerkte

gpt-image-1.5 is de onglamoureuze versie-upgrade waar productieteams werkelijk om geven. Het is geen nieuwe architectuur en OpenAI heeft het niet op de markt gebracht met een lanceringsevenement, maar het is de snapshot waarbij de meest aangehaalde gpt-image-1 faalmodi betrouwbaar aan de juiste kant van bruikbaar begonnen te landen. Als je beeldgeneratie in een echt product bouwt, is dit de versie waarbij de overhead voor beoordeling per aanroep daalt naar iets dat schaalt.

Wat er veranderd is sinds gpt-image-1

De belangrijkste verbetering is tekstweergave binnen afbeeldingen. De oorspronkelijke release kon korte koppen redelijk goed aan maar struikelde over meerdere regels tekst, gemengde lettertypegrootten en elke tekst die in een nauwkeurig afgebakend kader moest passen. gpt-image-1.5 dicht het grootste deel van die kloof. Marketingbanners, productmodellen met realistische UI-tekst en infographic-achtige outputs zijn nu bruikbaar voor eerste-concept-werk zonder handmatige opschoning in de meeste gevallen.

Compositorische betrouwbaarheid is de andere betekenisvolle winst. Wanneer je om drie onderwerpen in een gedefinieerde ruimtelijke relatie vraagt, kreeg gpt-image-1 de onderwerpen goed en de relatie bij benadering. gpt-image-1.5 krijgt de relatie vaker correct, met name voor podiumopstellingen en productiefotografie-achtige scènes met meerdere items.

Hand- en vingeranatomie is nog steeds onvolmaakt maar het percentage mislukkingen is merkbaar lager. Je krijgt een resultaat met zes vingers zeldzaam genoeg dat een handmatige beoordelingsronde aan het einde van een batch haalbaar is in plaats van vereist bij elke output.

Waar het goed werkt

Marketingcreatieve workflows die snel door honderd variaties moeten itereren om de weinige te vinden die aanslaan. E-commerce productfotografie waar je consistente belichting en een schone achtergrond nodig hebt over een catalogus heen. Redactionele illustratie voor blogposts en rapporten waar de briefing los genoeg is dat het model ruimte heeft om te componeren. UI-mockups voor ontwerpverkenning voordat een ontwerper het overneemt.

Voor bureaus die creatieve iteratiepijplijnen op volume draaien, treft gpt-image-1.5 de prijs-kwaliteitbalans beter dan de vorige versie. De combinatie van hogere eerste-doorgang-slaagkans en hetzelfde kosten-per-afbeelding-profiel betekent dat meer van de gegenereerde outputs verzonden worden zonder handmatig nawerk.

Het geïntegreerde generatie-, bewerkings- en inpainting-eindpunt geërfd van gpt-image-1 blijft behouden. Bewerkingen en variaties gedragen zich voorspelbaarder in deze versie, vooral wanneer de invoer-afbeelding complexe achtergronden of drukke composities heeft. Eerder zag je bewerkingen structuur lekken van het origineel naar het bewerkte gebied. Dat gebeurt nu minder vaak.

Waar het tekortschiet

Zeer fijne typografie bij kleine formaten is nog steeds ruw. Broodtekst en dichte specificatietekst zijn niet betrouwbaar leesbaar zonder een typografie-overlay-stap. Als je output leesbare alineatekst binnen de afbeelding moet bevatten, moet je nog steeds echte tekst bovenop leggen in je applicatiecode.

Fotorealistische mensen met specifieke identiteitsvereisten blijven een limiet. Het model is goed in generieke fotorealistische mensen maar is niet het juiste instrument wanneer je een specifiek persoon nodig hebt of een sterke visuele continuïteit over een reeks afbeeldingen van hetzelfde personage. Voor opeenvolgend karakterwerk heeft een controleerbare diffusiestack met referentie-afbeelding-conditionering nog steeds de voorsprong.

Industriële en technische diagrammen die exacte maatnauwkeurigheid of correcte geometrische relaties vereisen zijn geen sterkte. Het model produceert iets dat eruitziet als een technisch diagram maar is waarschijnlijk niet maatgetrouw. Voor engineering en CAD-aanverwant werk is dit de verkeerde instrumentcategorie volledig.

Kiezen of doorgaan

Voor de meeste teams is gpt-image-1.5 de versie om op te standaardiseren als je begonnen bent op gpt-image-1 en de volwassenheidwinsten wilt zonder het risicoprofiel van een grote versiesprong. Het gedrag is dichtbij genoeg dat promptbibliotheken van gpt-image-1 grotendeels overgezet worden met kleine aanpassingen.

Als je vandaag opnieuw begint, komt de keuze tussen gpt-image-1.5 en de nieuwere gpt-image-2 neer op of je de extra kwaliteitsruimte nodig hebt en de operationele volwassenheid die de nieuwere release brengt. Voor werk met hoog volume waarbij de kosten per afbeelding domineren, is gpt-image-1-mini de budgetlaag die de moeite waard is om te evalueren.

Cross-vendor is gemini-2.5-flash-image de dichtstbijzijnde directe concurrent en wint vaak op bepaalde gestileerde esthetiek terwijl het verliest op tekstweergave binnen afbeeldingen. nano-banana-pro-preview is Google's topklasse-beeldmodel en is de moeite waard om te benchmarken als je outputmix zwaar leunt op fotoreal of beeldende-kunststijlen. De keuze tussen OpenAI's beeldstack en die van Google komt meestal neer op welke conversationele LLM je al gebruikt, omdat het houden van een enkele leveranciersrelatie de inkoop en observeerbaarheid vereenvoudigt.

EU-dataresidentievereisten worden niet standaard vervuld. Voor gereguleerde workflows heb je een regionale gateway of een volledig andere leverancier nodig. Dat is niet veranderd sinds gpt-image-1 en zal waarschijnlijk niet snel veranderen.

Laatste technische beoordeling: 2026-05-22 — Tokonomix.ai

gpt-image-1.5 — illustration 2
Laatste automatische test
21 jun 2026 · 04:50 UTC · Benchmark
P50 latency
P95 latency
Fouten
1 / 6 runs
Laatst beoordeeld door Tokonomix-team·26 mei 2026