DeepSWE: il benchmark che mostra dove i modelli di coding divergono davvero
DeepSWE è il nuovo benchmark di Datacurve che valuta i modelli di coding su scenari agentici reali, non su test sintetici: ecco perché conta.
Leggi articoloCategoria
News e aggiornamenti su modelli, strumenti e tendenze del vibe coding.
DeepSWE è il nuovo benchmark di Datacurve che valuta i modelli di coding su scenari agentici reali, non su test sintetici: ecco perché conta.
Leggi articoloAndrej Karpathy spiega come usa davvero gli LLM nel lavoro quotidiano: thinking models, tool use, vibe coding e input multimodale in un video ancora attuale.
Leggi articoloMiniMax M3 si avvicina: l'Head of Engineering svela l'architettura Sparse Attention con speedup 9.7x in prefilling e 15.6x in decoding su 1M token.
Leggi articoloHermes Agent di Nous Research orchestra sub-agenti, crea skill automaticamente e coordina Claude Code come un tech lead. Ecco cosa lo distingue.
Leggi articoloGoogle lancia Gemini 3.5 Flash come motore agentico di Antigravity: 1M token di contesto, tool use avanzato e limiti triplicati per chi fa coding con agenti AI.
Leggi articoloComposer 2.5 di Cursor eguaglia modelli frontier a un costo per task irrisorio: perché il piano Individual da $20 mensili diventa oggi molto conveniente.
Leggi articoloAndrej Karpathy entra in Anthropic per lavorare su pre-training e ricerca sui modelli: ecco perché questa mossa è un segnale strategico forte.
Leggi articolo