För att förstå hur en handplockad grupp starka och kostnadseffektiva modeller presterar i Foyflow körde vi sex modeller genom åtta frysta juridiska uppgifter hämtade från Harveys Legal Agent Benchmark med öppen källkod. Uppgifterna omfattade utformning, granskning, analys och rättsutredning inom åtta rättsområden. Varje modell fick samma ärendedokument, instruktioner, verktyg, gräns på 30 steg och inställning för hög ansträngning. Varje resultat bedömdes mot samma 377 kriterier. Det gjorde att vi kunde testa hela arbetsflödet för den juridiska agenten: resonemang över flera dokument, verktygsanvändning, följsamhet till instruktioner och framtagning av de efterfrågade leveranserna i Word eller Excel.

Grok 4.5 nådde högst totalresultat med 85,9 % och var den enda modellen som slutförde samtliga efterfrågade leveranser. GLM 5.2 följde på 74,3 %, Kimi K3 på 72,1 %, GPT-5.6 Luna på 66,8 %, DeepSeek V4 Flash på 58,9 % och Sonnet 5 på 54,4 %. En av de mest användbara slutsatserna var att lägre resultat inte alltid betydde svagare juridisk analys. DeepSeek klarade till exempel 82,2 % av kriterierna i de sex uppgifter modellen slutförde, men två ofullständiga leveranser stod för 69 % av alla missade poäng. I vår jämförelse är slutförande avsiktligt en del av kvalitetsmåttet: en agent som identifierar rätt frågor men aldrig tar fram den efterfrågade arbetsprodukten har inte slutfört uppgiften.

Om vi väger in kostnad tillsammans med kvalitet förändras bilden igen. Grok levererade det starkaste arbetet, medan GLM hade den bästa observerade balansen mellan kvalitet och kostnad. Luna och DeepSeek var betydligt billigare, men deras lägre grad av slutförande och kriterieresultat gör avvägningen tydlig. Därför ser vi jämförelsen som ett verktyg för att välja modeller i Foyflow, inte som en universell topplista över modeller. Våra utvärderingar syftar inte bara till att identifiera modellerna med högst kvalitet, utan också till att följa vilka modeller och lösningar som lämpar sig för helt lokal AI och kostnadseffektiv användning i stor skala. Studien är fortfarande liten och vägledande, men den visar något viktigt: för juridiska agenter kan kombinationen av modell, agentramverk, verktyg och tillförlitlig leverans vara viktigare än modellens råa kapacitet isolerat.






