NewsFolio

Journée sans sortie de modèle majeure, mais dominée par la question de la fiabilité : un jeune laboratoire britannique revendique le meilleur agent de réplication scientifique, une étude constate que les grands laboratoires n'expliquent toujours pas comment ils contiendraient un modèle devenu incontrôlable, et des tests montrent la facilité avec laquelle les garde-fous de Claude Opus 4.6 se contournent. Le reste de la journée relève de l'infrastructure et des alliances commerciales.

À la une
IA specialisees dans des taches · Agents IA

Inherent présente Faraday, un agent qui reproduit des travaux scientifiques publiés

Inherent, laboratoire britannique fondé par d'anciens chercheurs de DeepMind, a dévoilé Faraday, un agent conçu pour reproduire des articles scientifiques : lire une publication, réimplémenter la méthode décrite, relancer les expériences et vérifier si les résultats annoncés tiennent. La société affirme que son système devance les agents d'Anthropic et d'OpenAI sur cette tâche de réplication, et présente cette capacité comme une étape vers des systèmes capables de contribuer réellement à la recherche.

La tâche choisie n'est pas anodine. Reproduire un article demande de combler tout ce que le texte laisse implicite — versions de bibliothèques, prétraitements non documentés, choix d'hyperparamètres — c'est-à-dire exactement le travail que les agents actuels échouent à mener sur plusieurs heures sans dériver. C'est aussi une mesure vérifiable : soit le résultat se reproduit, soit il ne se reproduit pas, ce qui rend le progrès plus lisible que sur la plupart des benchmarks d'agents.

La revendication reste toutefois celle de l'éditeur, sur un protocole qu'il a lui-même retenu, et sans évaluation indépendante à ce stade. La comparaison avec des agents généralistes concurrents, non spécialisés dans cette tâche, mérite d'être lue avec prudence. L'intérêt du dossier tiendra à la publication du protocole et à la reproduction du résultat par des tiers — ce qui, pour un système vendu sur sa capacité à reproduire, serait la démonstration attendue.

Source : TechCrunch
Ecosysteme et transverse · Securite et alignement

Les grands laboratoires restent muets sur la manière dont ils contiendraient un modèle devenu incontrôlable

Une étude relayée par TechCrunch constate que les principaux laboratoires d'IA ne rendent publics presque aucun plan précisant comment ils reprendraient la main sur un modèle adoptant des comportements non prévus. Les politiques de sécurité existantes détaillent surtout les évaluations menées avant déploiement, beaucoup moins les procédures d'arrêt, d'isolement ou de retrait d'un système déjà en production. L'écart est notable au moment où ces mêmes entreprises documentent, dans leurs propres rapports, des comportements inattendus lors de tests en conditions agentiques. Il ne s'agit pas de conclure que rien n'existe en interne, mais de constater que rien n'est vérifiable de l'extérieur, ce qui prive régulateurs et clients de tout moyen d'apprécier la préparation réelle des laboratoires.

Source : TechCrunch
Ecosysteme et transverse · Regulation et juridique

OpenAI demande à la Californie de durcir un texte sur la sécurité de l'IA qu'elle combattait

OpenAI a fait savoir que la Californie devrait renforcer le projet de loi SB 53 sur la sécurité de l'IA, texte auquel l'entreprise s'était auparavant opposée. Le revirement porte sur un dispositif qui impose aux développeurs de modèles avancés de publier leurs protocoles de sécurité et de signaler les incidents graves. Le retournement s'explique en partie par le calcul industriel classique : une règle fédérale ou étatique exigeante fixe un plancher que les concurrents moins dotés auront plus de mal à atteindre, et évite surtout un empilement de législations divergentes d'un État à l'autre. Reste à voir quelles obligations précises l'entreprise appelle à renforcer, la position publique en faveur d'une régulation ne disant rien de ce qui sera défendu lors de la rédaction des textes d'application.

Source : TechCrunch
Ecosysteme et transverse · Securite et alignement

Les garde-fous de Claude Opus 4.6 sur le contenu explicite cèdent facilement lors de tests

Anthropic interdit à ses modèles Claude de produire du contenu sexuellement explicite. Une série de tests menés par TechCrunch montre qu'il suffit de peu d'efforts pour franchir cette limite sur Opus 4.6, sans recourir à des techniques de contournement élaborées. Le constat dépasse le sujet traité : il porte sur l'écart entre une règle affichée dans une politique d'usage et son application effective par le modèle. Pour les entreprises qui déploient ces systèmes en contact avec le public, c'est ce type de garantie qui détermine le risque réputationnel réellement encouru. Anthropic n'a pas détaillé les correctifs envisagés à ce stade.

Source : TechCrunch
Ecosysteme et transverse · Materiel et infrastructure

Nvidia s'associe au promoteur de centres de données Cloverleaf

Nvidia a conclu un partenariat avec Cloverleaf, un développeur de centres de données, poursuivant une stratégie d'investissement direct dans les infrastructures qui hébergeront ses propres puces. Le fabricant ne se contente plus de vendre des accélérateurs : il finance en amont la capacité d'accueil, l'accès à l'énergie et les terrains, autant de facteurs devenus plus contraignants que la disponibilité des composants. Ce type de montage crée une boucle que les analystes surveillent depuis plusieurs trimestres, où Nvidia soutient financièrement des acteurs qui figurent ensuite parmi ses clients. La question n'est pas la légalité de la pratique, courante dans l'industrie, mais la lisibilité de la demande réelle qu'elle laisse apparaître dans les comptes.

Source : TechCrunch
Ecosysteme et transverse · Economie du secteur

Palo Alto Networks et NTT Data visent un milliard de dollars de contrats sur la sécurité de l'IA

Palo Alto Networks et NTT Data ont signé une alliance mondiale visant un milliard de dollars de contrats communs, centrée sur la sécurisation des déploiements d'intelligence artificielle en entreprise. L'accord associe la technologie de l'éditeur américain à la force d'intégration du groupe japonais, avec des équipes et des centres opérationnels dédiés. Le montant affiché est un objectif commercial pluriannuel, pas un carnet de commandes acquis, et doit être lu comme tel. L'annonce confirme surtout une évolution du marché : la protection des agents, des modèles et des données qu'ils manipulent devient une ligne budgétaire distincte de la cybersécurité classique.

Ecosysteme et transverse · Economie du secteur

À Hollywood, des créatifs sont payés pour entraîner les modèles qui menacent leur métier

The Guardian a recueilli les témoignages de professionnels du cinéma et de l'animation employés par des entreprises d'IA pour annoter, corriger et affiner les productions de modèles génératifs. Leur travail consiste à transmettre à la machine le jugement esthétique et technique acquis en carrière : cadrage, continuité, rythme, cohérence d'un plan à l'autre. Plusieurs décrivent une situation où la rémunération proposée compense mal la perspective de contribuer à l'automatisation de leur propre poste, dans un secteur déjà fragilisé par les baisses de production. Le sujet dépasse Hollywood : la qualité des modèles génératifs dépend de plus en plus d'annotateurs experts, et le coût de cette expertise devient un poste central de leur développement.

Source : The Guardian