Résumé :
Récemment, le développeur Cactus Compute a publié un modèle d'IA léger appelé Needle 2.
Le modèle ne fait que 14 Mo et est profondément optimisé pour l'environnement du processeur du Raspberry Pi 5. Il peut convertir les instructions en langage naturel en appels de fonctions prédéfinis en temps réel sans avoir besoin d'une carte d'extension d'accélération de l'IA.

Selon le blog officiel de Raspberry Pi, Needle 2 n'est pas un robot de discussion traditionnel à usage général, mais un modèle dédié axé sur l'exécution de commandes côté appareil. Lorsque l'utilisateur allume la lumière LED, le système ne prend que 78 millisecondes pour terminer l'ensemble du processus, de la reconnaissance à l'exécution, obtenant une réponse presque instantanée.
En termes de performances et d'utilisation des ressources, Needle 2 fait également preuve d'une efficacité extrême. Dans la mesure réelle du Raspberry Pi 5 (version mémoire de 8 Go), la mémoire occupée par ce modèle lors de l'exécution n'est que d'environ 28 Mo. Même si le programme de démonstration Python complet est exécuté, la consommation totale de mémoire n'est que de 46,4 Mo.
Cette conception légère permet au modèle d'être complètement séparé de l'API cloud et de l'environnement réseau, et d'obtenir un contrôle intelligent purement local en périphérie.

En termes de fonctionnalités matérielles et d'appels d'interface, Needle 2 est profondément lié au matériel sous-jacent via le système d'annotation Python. Les développeurs n'ont qu'à ajouter des balises spécifiques au code de fonction existant, et le modèle peut automatiquement capturer le nom de la fonction, la description et les types de paramètres, et créer une spécification d'appel.
Par exemple, le temps de réponse d'une instruction pour interroger la température du processeur est de 149 millisecondes, et le système renverra avec précision la valeur Celsius. L'ensemble du processus est entièrement réalisé au sein du processeur local.
Cependant, il convient de noter que le modèle est très restreint en termes de jugement logique. Pour les questions non pertinentes qui ne peuvent pas correspondre à la fonction prédéfinie (telles que « Où est la capitale de la France ? »), Needle 2 renverra une valeur nulle dans les 92 millisecondes au lieu de répondre de force.
Actuellement, les poids du modèle Needle 2 ont été publiés sur la plateforme Hugging Face, et le code correspondant est également open source sur GitHub suivant le protocole Apache 2.0.
Commentaires