2 nyheter från Claude och Anthropic under januari 2026, kommenterade av Satori med svensk vinkel.

Anthropic designade om sitt take-home-test tre gånger när Claude blev bättre, för att intervjuerna ska säga något om mänsklig förmåga.
Och vad gör svenska tech-bolag åt sina kodintervjuer? För det här är inte längre teori. AI fixar take-homes. Frågan är vad vi egentligen testar nu.

Agentutvärdering kräver kombination av kodgrader, modell-grader och mänsklig granskning, för både resultat och interaktionskvalitet.
Att utvärdera agenter är där vi fastnar med många kunder. Det här är en bra grundkarta. Spara länken för nästa proof-of-concept.