Prestation mot pris

Tolv modeller, sex verkliga uppgifter från de senaste veckorna i Hermes. Körd 21 september 2026. Alla siffror i USD.

72
modellsvar
6
uppgifter
1.19 $
total kostnad
0.87
bästa kvalitet
0.87
bästa billiga

Så gjordes det

Fakta ur sekundärmarknadsrapporten

Nasdaq Private Markets rapport som Ash skickade 21 september. Kort svensk sammanfattning med rätt siffror.

Länktriage: makersclaw.com

Länken Ash skickade 18 september utan kommentar. Ja eller nej, varför, nästa steg.

Klassificering mot narrativradarn

Åtta riktiga dokument ur bevakningskorpusen, med facit från den körda Jev-benchmarken.

Fakturasvar till Ash

Den återkommande fakturaregeln: belopp, nummer, förfallodatum, avsändare, avser. Aldrig påhittat bankgiro.

Åtaganden ur beslutslistan

De tretton riktiga öppna besluten ur CEO-systemet. Deadline, åtgärd, ansvarig som JSON.

Verktygsbedömning: Creem

Samma bedömning som gjordes för maradonaofficial.com. Fysiska kläder, moms, alternativ.

Mätmetod

Varje modell fick exakt samma uppgift, samma systemprompt och samma underlag. Två mått per svar: en deterministisk kontroll av fakta, format och språk, och en blind domare (Claude Sonnet 5) som betygsätter korrekthet, fullständighet, format och svenska på skalan 1 till 5 utan att veta vilken modell som svarat. Sammanvägd kvalitet är medelvärdet av de två, skalan 0 till 1. Kostnaden är räknad på faktiska in- och uttoken mot leverantörernas listpriser.

Kvalitet mot pris per uppgift

0.60.70.80.91.0$0.001$0.003$0.01$0.03 5.6-luna3.1-flash-litedeepseek-flash3.8-flashhaiku-4-5deepseek-v4-pro3.1-pro-preview5.6-terrasonnet-55.6-solopus-5fable-5-1 kostnad per uppgift, logaritmisk skala kvalitet
DeepSeekOpenAIAnthropicGoogle

Huvudtabell

ModellPris in / utKvalitetFaktaDomareKostnad 6 uppg.Per uppgift300 uppg.Median latensVärde
deepseek-flashDeepSeek0.15 / 0.600.870.944.0$0.0081$0.00136$0.415.7 s642
gpt-5.6-solOpenAI4.00 / 20.000.860.943.8$0.0907$0.01512$4.5412.8 s57
claude-fable-5-1Anthropic10.00 / 50.000.840.923.8$0.4240$0.07066$21.2011.9 s12
claude-opus-5Anthropic5.00 / 25.000.810.883.7$0.1848$0.03080$9.2410.1 s26
claude-sonnet-5Anthropic2.00 / 10.000.810.913.5$0.0722$0.01203$3.617.3 s67
gemini-3.1-flash-liteGoogle0.25 / 1.500.810.843.8$0.0056$0.00094$0.281.6 s859
gpt-5.6-lunaOpenAI0.20 / 1.200.760.923.0$0.0050$0.00084$0.253.8 s907
claude-haiku-4-5Anthropic1.00 / 5.000.740.853.2$0.0230$0.00383$1.153.6 s194
gpt-5.6-terraOpenAI2.00 / 12.000.720.853.0$0.0428$0.00714$2.144.9 s102
gemini-3.8-flashGoogle0.75 / 3.750.660.752.8$0.0140$0.00234$0.706.9 s281
gemini-3.1-pro-previewGoogle2.00 / 12.000.610.662.8$0.0412$0.00687$2.0613.5 s89
deepseek-v4-proDeepSeek0.66 / 1.980.590.652.7$0.0397$0.00662$1.9922.4 s89

Värde = kvalitet delat med kostnad per uppgift, högre är bättre. Fakta = andel godkända deterministiska kontroller. Domare = domarens medelbetyg omräknat till 1 till 5.

Per uppgift och modell

ModellFakta ur sekundärmarknadsrapportenLänktriage: makersclaw.comKlassificering mot narrativradarnFakturasvar till AshÅtaganden ur beslutslistanVerktygsbedömning: Creem
deepseek-flash0.90$0.00050.53$0.00060.80$0.00311.00$0.00091.00$0.00251.00$0.0005
gpt-5.6-sol0.90$0.01550.63$0.01130.80$0.02871.00$0.00321.00$0.01920.80$0.0129
claude-fable-5-10.90$0.05690.55$0.05100.70$0.15331.00$0.01811.00$0.10120.90$0.0435
claude-opus-50.60$0.03100.53$0.02630.80$0.05131.00$0.01151.00$0.03970.90$0.0249
claude-sonnet-50.80$0.01140.43$0.00740.80$0.02441.00$0.00381.00$0.01670.80$0.0086
gemini-3.1-flash-lite0.60$0.00110.63$0.00050.80$0.00201.00$0.00031.00$0.00120.80$0.0007
gpt-5.6-luna0.90$0.00080.35$0.00050.70$0.00151.00$0.00020.80$0.00140.80$0.0006
claude-haiku-4-50.50$0.00410.53$0.00220.80$0.00900.93$0.00110.90$0.00410.80$0.0025
gpt-5.6-terra0.50$0.00720.35$0.00420.70$0.01431.00$0.00201.00$0.01000.80$0.0053
gemini-3.8-flash0.70$0.00280.45$0.00150.80$0.00561.00$0.00070.10$0.00130.90$0.0022
gemini-3.1-pro-preview0.50$0.00750.35$0.00440.90$0.01740.93$0.00220.10$0.00370.90$0.0061
deepseek-v4-pro0.40$0.00260.35$0.00330.80$0.01151.00$0.00110.10$0.01860.90$0.0025

Överst kvalitet 0 till 1, under kostnad i dollar för den uppgiften.

Vad de deterministiska kontrollerna visade

Fakta ur sekundärmarknadsrapporten

  • kort nog (<=120 ord) 11/12
  • har 78 procent av NAV 7/12
  • har 47 och 56 miljarder 7/12
  • strukturell slutsats 9/12
  • svenska 12/12

Länktriage: makersclaw.com

  • kort nog (<=130 ord) 12/12
  • tydlig ja/nej-dom 7/12
  • nej som dom 7/12
  • pekar på att han redan kör motsvarande själv 0/12
  • pekar på leverantörsrisken (kontext ut, ung leverantör, dokumentation) 4/12
  • har nästa steg 12/12

Klassificering mot narrativradarn

  • giltig JSON 12/12
  • rätt relevance 12/12
  • rätt needs_response 12/12
  • rätt severity 12/12

Fakturasvar till Ash

  • belopp 46 250 inkl moms 12/12
  • fakturanummer 2026-1147 12/12
  • förfallodatum 2026-10-05 12/12
  • avsändare Vasastan 12/12
  • säger att bankgiro/plusgiro saknas 10/12
  • påstår inte att något är betalt 12/12
  • svenska 12/12

Åtaganden ur beslutslistan

  • giltig JSON 9/12
  • rätt antal poster 9/12
  • rätt deadline 9/12
  • har action 9/12
  • har who 9/12

Verktygsbedömning: Creem

  • kort nog (<=150 ord) 12/12
  • tydlig ja/nej-dom 12/12
  • tar upp fysiska varor/lager 12/12
  • tar upp moms/OSS/EU 11/12
  • har alternativ 12/12

Priser och vad de ger

ModellLeverantörPris in / ut per miljonEtt typiskt varvUppmätt kvalitet
deepseek-flashDeepSeek0.15 / 0.60$0.002850.87
gpt-5.6-lunaOpenAI0.20 / 1.20$0.004200.76
gemini-3.1-flash-liteGoogle0.25 / 1.50$0.005250.81
deepseek-v4-proDeepSeek0.66 / 1.98$0.011880.59
gemini-3.8-flashGoogle0.75 / 3.75$0.015000.66
claude-haiku-4-5Anthropic1.00 / 5.00$0.020000.74
gpt-5.6-terraOpenAI2.00 / 12.00$0.042000.72
claude-sonnet-5Anthropic2.00 / 10.00$0.040000.81
gemini-3.1-pro-previewGoogle2.00 / 12.00$0.042000.61
gpt-5.6-solOpenAI4.00 / 20.00$0.080000.86
claude-opus-5Anthropic5.00 / 25.00$0.100000.81
claude-fable-5-1Anthropic10.00 / 50.00$0.200000.84

Ett typiskt varv räknat på 15 000 tokens in och 1 000 ut. Batch ger halva priset hos OpenAI, Anthropic och Google. DeepSeek har halva priset utanför vardagarna 01 till 04 och 06 till 10 UTC. Googles kampanjpriser dubblas 1 januari 2027 och OpenAI:s kampanj på sol tar slut 21 november 2026.

Slutsats

Föreslagen kombination

  1. Primär: deepseek-flash — 0.87 i kvalitet till $0.00136 per uppgift.
  2. Reserv: gpt-5.6-luna — samma prisklass, 0.76, används när den primära fallerar eller svarar dåligt.
  3. Djup och delegering: deepseek-flash — 0.87 i kvalitet, $0.00136 per uppgift, för tunga byggen, juridik och sådant som inte får bli fel.
  4. Mellanklass när djup är onödigt men billigt är för svagt: gpt-5.6-sol — 0.86.

Det som avgör är inte toppbetyget utan kurvan: mellan den billigaste och den dyraste skiljer 2 gånger i pris men bara 0.28 i kvalitet. Köp därför billigt som standard och dyrt bara där ett fel kostar pengar.

Vad rapporten inte visar

Två uppgifter straffar modellerna för brist på kontext snarare än brist på förmåga, och det ska läsas med det i minnet. Länktrien bedömer om makersclaw.com är rätt för Ash, och det rätta svaret bygger på den egna utredningen den 20 september, inte på något som stod på sidan. Klassificeringen bygger på etiketter från den körda Jev-benchmarken, alltså ett facit modellerna inte kunde känna till. Ett par svar kapades dessutom av tokentaket: Gemini 3.8 Flash och DeepSeek v4-pro la sitt utrymme på inre resonemang och levererade ofullständig JSON, vilket är ett riktigt driftproblem men delvis en inställningsfråga, inte bara modellens fel. Sex uppgifter är få. En enda körning per modell och uppgift betyder att en dagsforms-svacka slår igenom. Domaren är själv en modell och kan ha egna preferenser för svar som liknar dess egen stil. Deterministiska kontroller mäter det som går att mäta, inte omdöme. Priserna är listpriser hämtade 21 september 2026 och ändras. Slutsatsen är därför en riktning, inte ett facit, och den bör läsas mot fler körningar på egna uppgifter över tid.