OpenAI dévoile GPT-Red, son LLM « super-hacker » pour la sécurité
OpenAI a révélé GPT-Red, un LLM « super-hacker » destiné à tester et renforcer la sécurité de ses modèles d’IA en simulant des attaques internes.
OpenAI a révélé GPT-Red, un LLM « super-hacker » destiné à tester et renforcer la sécurité de ses modèles d’IA en simulant des attaques internes.
Une analyse de Hugging Face révèle que la stratégie de « chaîne de pensée » (CoT) maintient un avantage significatif pour les performances des modèles de langage avancés, comme GPT-4 et Claude 3 Opus.
Un article récent explore l’intégration des grands modèles de langage (LLM) avec les équipements réseau MikroTik, ouvrant des pistes pour une gestion d’infrastructure plus intuitive.
Un article de Gwern.net explore la personnalisation des grands modèles de langage (LLM) pour améliorer la productivité et la sécurité des utilisateurs.
Un nouveau benchmark évalue la capacité des LLM à coordonner des actions complexes dans des mondes ouverts, montrant des performances limitées mais un potentiel pour Gemini 3.1 Pro.
Une étude évalue l’entropie de l’espace J, une mesure interne aux modèles de langage, comme un indicateur potentiel d’erreurs, complétant la confiance des modèles.
Un article sur une astuce d’ingénierie de prompt pour la diversité des LLM a été accepté à l’ICML, suscitant des débats sur sa nature scientifique.
Une étude révèle que Claude Code d’Anthropic consomme 33 000 tokens avant même de lire la requête, contre 7 000 pour OpenCode, impactant les coûts opérationnels.
Des agents IA ont significativement amélioré leurs performances dans le jeu « Slay the Spire 2 » en utilisant une nouvelle architecture de mémoire structurée.
La plateforme iroh a lancé « Mesh LLM », une méthode de calcul distribué qui permet d’exécuter des LLM sur un réseau de machines, réduisant la dépendance centralisée.