Proxy MCP local qui réduit le gaspillage de jetons LLM pour les développeurs
llmtrim, développé par Fkiene, est un outil d'optimisation locale qui réduit l'empreinte de jetons des demandes de modèles de langage de grande taille pour diminuer les frais d'exploitation. Il intercepte les appels API sortants et supprime les jetons non essentiels, en réduisant les espaces, les schémas redondants et les journaux verbeux avant qu'ils n'atteignent le fournisseur. L'outil prend en charge les agents basés sur MCP et propose des bibliothèques intégrables, ce qui le rend adapté aux ingénieurs logiciels et aux chercheurs en IA qui ont besoin d'une compression de jetons prévisible et de contrôles de confidentialité plus stricts.
Conçu pour des échanges de code et de terminal à fort volume
L'outil cible les flux de travail où de grands blocs de code et des sorties de terminal sont échangés avec des LLM, agissant comme un intermédiaire local qui réduit les invites, l'historique des conversations, les sorties des outils et le code source pour diminuer le gaspillage de tokens. Il fonctionne comme un serveur de Protocole de Contexte de Modèle (MCP) ou un proxy local autonome, et s'intègre dans des applications via des bibliothèques de langage, s'adaptant directement aux pipelines de codage pilotés par des agents et aux outils de développement scriptables.
Le rognage vise à préserver les réponses tout en réduisant l'utilisation des tokens
llmtrim utilise un rognage déterministe basé sur des règles pour éliminer le contenu répétitif et le gaspillage structurel sans invoquer d'appels supplémentaires au modèle, un design que le développeur rapporte ne causant aucun changement dans la qualité des réponses. Les effets mesurés incluent environ 31 % de réduction des tokens d'entrée et jusqu'à 74 % de réduction sur les tokens de sortie, avec une latence de traitement ajoutée d'environ 5 ms par demande, maintenant les frais généraux par appel minimaux.
S'intègre avec des agents et de nombreux stacks de développement
Le serveur est agnostique au protocole et explicitement compatible avec des agents MCP tels que Claude Desktop et Cursor, et il fournit des bibliothèques intégrables pour Rust, Python, Ruby, Kotlin, Swift et JavaScript/TypeScript. Ce support multilingue permet aux équipes d'adopter l'outil soit en tant que binaire proxy local, soit en intégrant directement la bibliothèque dans des services backend et des contrôleurs d'agents.
Traite les données localement mais nécessite une confiance dans l'infrastructure locale
Tous les traitements se font sur la machine de l'utilisateur : l'outil termine le TLS localement pour inspecter et compresser les demandes et n'envoie pas de données à des tiers au-delà du fournisseur LLM prévu. Il est maintenu en tant que projet open-source par Fabian Kiene sur GitHub. Le compromis est que les équipes doivent déployer et gérer le proxy local ou la bibliothèque au sein de leur infrastructure et accepter la terminaison TLS locale.
Pratique pour les équipes d'ingénierie prêtes à gérer le middleware local
L'outil est une option pragmatique pour les équipes d'ingénierie qui ont besoin d'une compression de jetons prévisible et d'un contrôle local sur le trafic LLM. Son découpage déterministe et sa faible latence par demande favorisent les workflows d'agents scriptés et de codage, tandis que la nécessité de déployer un proxy local et de maintenir des ensembles de règles le rend mieux adapté aux équipes disposant de ressources de développement plutôt qu'aux utilisateurs recherchant des solutions cloud uniquement prêtes à l'emploi.





