Veille IA Veille IA sans buzz : pour stratèges québécois.
La veille

Comment DeepSeek décrit son propre fonctionnement

Comment DeepSeek décrit son propre fonctionnement

5 min de lecture · Hacker News (frontpage) · ms7892 · 11 août 2026 IA générative 8/10 Moyen
Comment DeepSeek décrit son propre fonctionnement

L'article explore le fonctionnement de DeepSeek via une interview du modèle lui-même. Le modèle distingue observations, inférences et suppositions, admettant ne pas voir ses propres poids. L'auteur compare ensuite ces déclarations aux publications publiques.

« DeepSeek clearly separates what it knows from what it is inferring. » - Hacker News (frontpage)

Que faut-il retenir ?

  • DeepSeek sépare ses réponses en observations, inférences et suppositions.
  • Le modèle admet ne pas voir ses propres poids, routage ou cartes d'attention.
  • L'interview est comparée aux publications publiques pour vérifier les déclarations.
  • DeepSeek mentionne utiliser Transformer + MoE, avec seulement un sous-ensemble de paramètres activés par entrée.

Pourquoi cette nouvelle compte-t-elle ?

Cette analyse montre comment un modèle d'IA peut décrire son propre fonctionnement, tout en révélant ses limites. Cela aide les développeurs à comprendre le comportement des modèles et leurs contraintes, essentiel pour leur utilisation et amélioration.

256 experts, 671B/37B params

Public concerné : développeurs

Comment DeepSeek décrit-il son propre fonctionnement interne ?

DeepSeek sépare ses réponses en observations, inférences et suppositions. Il admet ne pas voir ses propres poids ou architecture interne, mais décrit des éléments comme l'utilisation de Transformer + MoE, vérifiés par des publications publiques.

🔧 Outils mentionnés

🔐 Connexion rapide

Entrez votre courriel pour recevoir un code à 6 chiffres.

Pas besoin de mot de passe ni d'inscription. Entrez votre courriel, recevez un code par courriel, et c'est tout !