
BEST Local AI for Tool Calls? GPT-OSS, DeepSeek, Kimi K2, MiniMax, GLM Compared
Meilleure IA locale pour les appels d'outils ? GPT-OSS, DeepSeek, Kimi K2, MiniMax, GLM comparés
Mots-clés
Résumé
180 mots
Évaluation critique
Valeur des informations & solidité de l’argumentation
La valeur de ce contenu réside dans la démonstration concrète et comparative de l’utilisation d’appels d’outils par des modèles locaux populaires, avec des exemples pratiques et reproductibles. L’argumentation est solide car chaque test est illustré par des captures d’écran et des traces de fonctionnement, permettant de comprendre les décisions prises par les modèles. L’auteur ne se contente pas de simplement affirmer des résultats, il explique les mécanismes internes (comme l’utilisation du cache, la gestion des erreurs, l’adaptation des paramètres). Toutefois, certaines conclusions sont basées sur des cas isolés et pourraient être renforcées par des répétitions ou des tests plus formalisés. La démonstration de création d’un nouvel outil est également une valeur ajoutée pratique.
Rigueur scientifique, qualité des sources, adéquation du titre
La rigueur scientifique est moyenne : les tests sont contingents (dépendent des caches, des erreurs du web) et manquent de protocole mesuré. Les sources sont essentiellement les modèles accessibles sur Hugging Face, dont les liens sont fournis dans la description, ainsi que l’application Inferencer. Le titre correspond bien au contenu, puisqu’il annonce une comparaison de plusieurs modèles pour les appels d’outils ; l’adéquation est bonne. Aucun commentaire n’était fourni, donc aucune analyse de tendances du public n’est possible.
206 mots
Adéquation titre / contenu
Le titre décrit fidèlement le contenu en mettant en avant une comparaison pratique de plusieurs modèles locaux pour les appels d'outils.
Qualité & fiabilité
7/10
Les tests reposent sur des exécutions réelles, mais sans protocole de contrôle ni répétitions, et certaines réussites dépendent de caches ou de recherches directes. Les sources sont principalement des modèles listés sur Hugging Face, mais l'évaluation reste subjective.
Moments clés
Repères établis par PSI à partir de la transcription : le créateur n'a pas défini de chapitres.
- Introduction sur les appels d'outils et l'application Inferencer sandboxée.
- Premier test de la fonction météo avec GPT-OSS 20B : obtention de la température de New York via un outil personnalisé.
- Test de recherche d'actualités Mac Studio sans moteur de recherche : GPT-OSS 120B exploite Google News directement.
- Test de MiniMax M2 : réussite avec DuckDuckGo, modification de la longueur maximale des réponses.
- Test de Kimi K2 Thinking : échec lors de l'absence de moteur de recherche, abandon rapide.
- Test de GLM-4.6 : adaptation aux limites de longueur, choix d'autres sites, mais erreurs de dates.
- Test de DeepSeek : réussite partielle avec DuckDuckGo, échec sans moteur de recherche.
- Test d'Apertus : fonctionnalité de base fonctionnelle mais moins sophistiquée.
- Création d'un nouvel outil de recherche en remplaçant DuckDuckGo par Serper via code Python.
- Conclusion et invitation à partager ses préférences sur les modèles.
Sources citées
- GPT-OSS-20B sur Hugging Face — Modèle testé pour les appels d'outils.
- GPT-OSS-120B sur Hugging Face — Modèle testé, performance jugée bonne.
- DeepSeek-V3.1-Terminus-MLX-5.5bit — Modèle DeepSeek testé avec des appels d'outils.
- GLM-4.6-MLX-6.5bit — Modèle GLM testé.
- Kimi-K2-Thinking-MLX-3.8bit — Modèle Kimi K2 testé.
- MiniMax-M2-MLX-6.5bit — Modèle MiniMax testé.
- Qwen3-1.7B — Petit modèle testé.
- Qwen3-235B-A22B-Instruct-2507 — Grand modèle Qwen testé.
- Apertus-70B-2509 — Modèle suisse Apertus testé.
- Inferencer App — Application utilisée pour les tests.
Références externes
Apport & nouveautés
Cette vidéo apporte une comparaison pratique et à jour de l’efficacité des appels d’outils pour plusieurs modèles locaux open-weight, mettant en lumière les différences de stratégie entre les modèles (utilisation de cache, changement de paramètres, adaptation à des erreurs réseau). Elle montre aussi la flexibilité de l’application Inferencer pour créer et modifier des outils, ce qui constitue une ressource utile pour les utilisateurs souhaitant intégrer des fonctions personnalisées à leurs modèles locaux.
Pour aller plus loin :
- ReAct: Synergizing Reasoning and Acting in Language Models — Concept fondateur pour raisonner et agir en utilisant des outil.
- MLX : framework d’apprentissage machine d’Apple — Utilisé pour exécuter les modèles localement.
- Documentation OpenAI Function Calling — Cadre standard pour les appels d’outils, utile pour comprendre les formats.
- Toolformer: Language Models Can Teach Themselves to Use Tools — Article de recherche sur l’apprentissage d’outils par les modèles.
144 mots
Profil radar
Le profil radar montre des scores équilibrés autour de 7, indiquant un contenu informatif et technique correct, mais avec une fiabilité globale légèrement inférieure en raison du caractère unique des tests. La quantité et la qualité d'information sont bonnes, le niveau technique est adapté à un public déjà familiarisé.