Habr AI→ original

Développeur a Construit un Filtre Anti-Spam Local avec le Modèle ruBert-base-antispam Sans VPN

Sur Habr, les développeurs ont décrit comment un modèle ruBert-base-antispam local attrape les spams qui échappent aux filtres Yandex, Mail et SpamAssassin. Le modèle de 177 millions de paramètres utilise environ 550 Mo de mémoire et répond en 100-200 millisecondes, filtrant les pseudo-spams comme les invitations à des conférences et les offres de crédit.

Traité par IA depuis Habr AI ; édité par Hamidun News
Développeur a Construit un Filtre Anti-Spam Local avec le Modèle ruBert-base-antispam Sans VPN
Source : Habr AI. Collage: Hamidun News.
◐ Écouter l'article

Un développeur a décrit sur Habr comment il a construit un système de filtrage du spam par email multi-niveaux sans VPN, en y ajoutant un modèle local ruBert-base-antispam de HuggingFace — un fine-tune du DeepPavlov/rubert-base-cased-conversational avec 177 millions de paramètres, qui nécessite environ 550 MB de RAM.

Comment le filtrage multi-niveaux est organisé

Les publicités sur le système de l'auteur sont bloquées via un serveur DNS personnalisé et des filtres CSS locaux, mais le spam par email a nécessité une gestion séparée. Le schéma est construit en plusieurs étapes séquentielles: d'abord les emails sont vérifiés par les filtres intégrés de Yandex et Mail — ils filtrent une partie du spam avant qu'il ne soit transféré à une autre boîte aux lettres. Ce qui les dépasse atteint le propre serveur de l'auteur, où se trouve SpamAssassin et capture plus d'ordures.

Après deux niveaux, certains emails fuient toujours et atteignent Gmail: certains aboutissent automatiquement dans le dossier "Spam", tandis que d'autres arrivent dans la boîte de réception avec une notification ennuyeuse. L'auteur voulait empêcher que le spam s'accumule dans les dossiers au fil du temps, ce qui doit être nettoyé manuellement — et les spammeurs, selon lui, ne restent pas inactifs et mettent constamment à jour leurs techniques d'évasion.

Pourquoi les filtres standard ne suffisaient pas

Un problème particulier a été causé par les emails qui ne sont pas formellement une violation: invitations à des conférences, offres de partenariat, envois de cartes de crédit. Les filtres bayésiens capturent mal ces messages car ils manquent de signes évidents du spam classique — juste de l'ennui et peu de valeur pour le destinataire. C'était cette zone grise entre "définitivement du spam" et "définitivement pas du spam" que les trois niveaux précédents de filtrage ne pouvaient pas couvrir, et un outil séparé était nécessaire, capable d'évaluer le sens d'un email, pas seulement les signes formels d'un envoi de masse.

  • Modèle — ruBert-base-antispam de HuggingFace, un fine-tune du DeepPavlov/rubert-base-cased-conversational
  • 177 millions de paramètres, 12 couches de transformateur, taille cachée 768
  • Limite d'entrée — 512 tokens
  • Consommation mémoire — environ 550 MB, la réponse prend 100-200 millisecondes
  • Classificateur binaire: la sortie n'est que 0 ou 1, pas de prompts ni de raisonnement

Quel modèle l'auteur a choisi

Un modèle BERT local a résolu les deux problèmes à la fois — à la fois l'accumulation de spam et le refus de dépendre des APIs en nuage payantes. ruBert-base-antispam est un classificateur binaire: le texte d'un email entre, 0 ou 1 sort, pas de prompts ni de raisonnement comme dans les grands modèles de langage. Cette simplicité d'architecture donne une vitesse de réponse de 100-200 millisecondes avec environ 550 MB de mémoire — le modèle peut être maintenu en fonctionnement constant sur un serveur domestique ordinaire sans se soucier de la charge supplémentaire.

La limite de 512 tokens d'entrée n'est pas critique pour le filtrage du spam: vous n'avez pas besoin d'analyser l'intégralité de l'email, les premiers paragraphes suffisent pour comprendre son caractère. En même temps, le modèle de base DeepPavlov/rubert-base-cased-conversational, sur lequel le fine-tune est construit, a été entraîné à l'origine sur le russe conversationnel — cela devrait aider à distinguer plus précisément la correspondance vivante des envois publicitaires et semi-publicitaires.

Qu'est-ce que cela signifie?

L'étude de cas montre que pour les tâches appliquées étroites comme le filtrage du spam, les grands LLMs en nuage ne sont pas nécessaires: un petit modèle BERT local avec 177 millions de paramètres traite plus rapidement et moins cher, fonctionnant complètement hors ligne et sans VPN.

Questions fréquemment posées

Quel modèle l'auteur utilise-t-il pour le filtrage du spam?

C'est ruBert-base-antispam de HuggingFace — un fine-tune du DeepPavlov/rubert-base-cased-conversational, 177 millions de paramètres, 12 couches de transformateur et taille cachée 768.

Combien de ressources un tel modèle local nécessite-t-il?

Le modèle a besoin d'environ 550 MB de RAM, et la réponse à un texte prend 100-200 millisecondes; la longueur maximale d'entrée est limitée à 512 tokens.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?

Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).

Qu'en pensez-vous ?
Chargement des commentaires…