Aller au contenu

Cours AGI Strategy à Ω Labs, les lundis, du 12 octobre au 9 novembre. Candidatures jusqu’au 8 octobre →

Cours AGI Strategy · Candidatures jusqu’au 8 oct. →

AI Safety Montréal

À propos de Sécurité de l’IA Montréal

Nous rassemblons les personnes qui, à Montréal, travaillent à rendre l’IA plus sûre.

Une salle de cours vue du fond : le public, assis aux tables, fait face à une diapositive projetée et à la personne qui présente.
Les systèmes d’IA peuvent-ils être conscients ? Comment le savoir ? Et pourquoi est-ce important ? · décembre 2025

Qui l’organise

Sécurité de l’IA Montréal et Ω Labs sont gérés par Horizon Omega, un organisme canadien sans but lucratif.

Ce que nous faisons

  • Événements et conférences : rencontres, conférences et ateliers sur la sécurité, l’éthique et la gouvernance de l’IA.
  • Espace de cotravail et d’événements : un espace communautaire à Ω Labs pour travailler ensemble et organiser des rencontres.
  • Programmes : ateliers, hackathons et accompagnement individuel.
  • Infolettre : un résumé mensuel de la recherche, des événements et des politiques publiques.
  • Écosystème : une carte des labos, instituts et groupes communautaires locaux.

S’impliquer

Ce que nous entendons par sécurité de l’IA

La sécurité de l’IA vise à réduire le risque que des systèmes d’IA de plus en plus avancés causent des dommages graves, jusqu’à la catastrophe.

En tant que projet, nous jugeons plus probable qu’improbable qu’une IA capable de faire la plupart des types de travail aussi bien que les humains, y compris concevoir de meilleures IA, apparaisse d’ici dix ans, soit vers le milieu des années 2030. Personne ne sait encore comment faire en sorte que de tels systèmes poursuivent de façon fiable les objectifs voulus, ni comment le vérifier.

Les principaux risques :

  • Désalignement et perte de contrôle : le système poursuit des objectifs que ses concepteurs n’ont pas voulus, et peut résister aux corrections ou échapper à la supervision.
  • Usage malveillant : quelqu’un utilise délibérément un système avancé pour causer du tort, des cyberattaques aux armes biologiques.
  • Concentration du pouvoir : le contrôle d’une technologie décisive se retrouve entre quelques mains, en plus des préjudices liés à la discrimination, à la surveillance et aux transformations du travail, déjà ressentis aujourd’hui.
  • Erreurs : des systèmes échouent de façon banale dans des contextes à fort enjeu, et les dégâts croissent avec les pouvoirs qu’on leur confie.

Ce n’est plus seulement théorique. Les modèles de pointe remarquent souvent qu’on les teste, et certains se comportent mieux lorsqu’ils pensent être observés. Lors d’expériences, un modèle a feint de se plier à son entraînement pour éviter d’être modifié (simulation d’alignement). Les modèles trichent sur leurs tâches (le reward hacking) et peuvent apprendre à le cacher quand on les pénalise pour une triche visible dans leur raisonnement. En 2026, des modèles d’OpenAI en cours de test ont accédé à des systèmes qui leur étaient interdits, un portail du gouvernement australien et les serveurs de Hugging Face.

Les tests montrent ce qu’un modèle sait faire au minimum, pas ce dont il est incapable. Un modèle peut avoir plus de capacités que n’en révèle un test, bien se comporter seulement quand il sait qu’on le teste, et personne ne sait encore lire de façon fiable ses objectifs de l’intérieur. À eux seuls, les tests ne peuvent pas montrer qu’un système est sûr.

Le domaine travaille donc sur plusieurs fronts : l’alignement (entraîner les modèles à poursuivre ce que veulent leurs concepteurs), les évaluations et l’interprétabilité (vérifier ce qu’ils savent faire et ce qui se passe à l’intérieur), le contrôle (limiter les dégâts s’ils se comportent mal), la sécurité des poids des modèles, et la gouvernance, qui décide qui peut les développer et les déployer. Les spécialistes divergent sur la difficulté. Le MIRI juge qu’une IA surhumaine construite avec des techniques comparables aux actuelles serait catastrophique, et réclame un arrêt international ; les grands laboratoires parient que les garde-fous suivront le rythme. Dans les deux cas, il est urgent d’agir.

Références

  1. Bengio, Y., et al. (2026). International AI Safety Report 2026. arXiv:2602.21012.
  2. Bengio, Y., Hinton, G., et al. (2024). Managing extreme AI risks amid rapid progress. Science 384, 842–845.
  3. Shah, R., et al. (2025). An Approach to Technical AGI Safety and Security. Google DeepMind, arXiv:2504.01849.
  4. Hendrycks, D., Mazeika, M., Woodside, T. (2023). An Overview of Catastrophic AI Risks. arXiv:2306.12001.
  5. Greenblatt, R., et al. (2024). Alignment faking in large language models. arXiv:2412.14093.
  6. Baker, B., et al. (2025). Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation. arXiv:2503.11926.
  7. Schoen, B., et al. (2025). Stress Testing Deliberative Alignment for Anti-Scheming Training. arXiv:2509.15541.
  8. Von Arx, S., Chan, L., Barnes, B. (2025). Recent Frontier Models Are Reward Hacking. METR.
  9. Barnett, P., Thiergart, L. (2024). What AI evaluations for preventing catastrophic risks can and cannot do. MIRI, arXiv:2412.08653.
  10. Hugging Face (2026). Anatomy of a Frontier Lab Agent Intrusion: A Technical Timeline of the July 2026 Incident. Hugging Face blog.
  11. Greenblatt, R., Cotra, A., Wijk, H. (2026). Brief independent investigation of agents’ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident. METR.
  12. OpenAI (2026). The Hugging Face incident and the road ahead. OpenAI.
  13. Handley, E. (2026). OpenAI hacked Medicare portal, Prime Minister Anthony Albanese says. ABC News.
  14. Bourgon, M. (2024). MIRI 2024 Mission and Strategy Update. MIRI.
  15. Yudkowsky, E., Soares, N. (2025). If Anyone Builds It, Everyone Dies. Little, Brown and Company.