
Tout d'abord, à quoi servent les dix millions de données IP de proxy stockées ? Pourquoi devons-nous optimiser ?
Nous comprenons le frère crawler, la main pas de millions de proxy IP sont gênés de sortir. Mais vraiment sauvé à la dix millions de temps quantitatif, le problème est venu -.Les bases de données ordinaires s'effondrent pour vous.L'autre jour, un vieux briscard m'a dit qu'il utilisait MySQL pour stocker 8 millions d'adresses IP. Il y a quelques jours, un vieux briscard m'a dit qu'il utilisait MySQL pour stocker 8 millions d'adresses IP, et qu'il devait attendre une demi-minute pour vérifier les adresses IP disponibles, alors quel est l'intérêt de jouer avec un marteau ?
Les trois fosses constituent l'élément le plus accablant :
1. les requêtes rampent comme une tortue lorsque le volume de données est important
2. l'espace disponible sur le disque dur est insuffisant.
3. l'augmentation des coûts de maintenance
Deuxièmement, l'école du monde réel de l'optimisation du stockage s'articule autour de trois axes
Astuce n° 1 : Transformer l'ensemble en pièces détachées
Ne mettez pas tous vos œufs dans le même panier, découpez les adresses IP par zone géographique. Par exemple, la section 1 de la salle des serveurs de Pékin est stockée séparément, la section 2 de la salle des serveurs de Shanghai est stockée séparément. Prenons l'exemple du pool de serveurs mandataires d'ipipgo.Technologie intelligente de découpage en tranchesIl peut automatiquement regrouper et stocker les adresses IP dans la même région, et localiser directement la tranche spécifique lors de la vérification, et la vitesse peut être plus de 5 fois plus rapide.
Conseil n° 2 : vérifiez la mémoire vive avant le disque dur
Obtenez un mécanisme de cache à deux niveaux et placez les IP récemment utilisées dans Redis. Voici une petite astuce :

Les données chaudes (utilisées au cours des 5 dernières minutes) vont dans le premier niveau, les données tièdes (utilisées le même jour) vont dans le deuxième niveau, et seul le reste va dans la base de données. Le temps de réponse mesuré peut être réduit de 3 secondes à 200 millisecondes.
| type de données | lieu de stockage | temps de réponse |
|---|---|---|
| données thermiques | cache mémoire | ≤50ms |
| données de température | Disque dur SSD | ≤200ms |
| données froides | entraînement mécanique | ≥1s |
Conseil n° 3 : requêtes parallèles multithreads
Ne soyez pas stupide et ne vérifiez pas la bibliothèque dans un seul fil de discussion, ouvrez 10 fils de discussion en même temps pour vérifier différents fractionnements. Veillez à définir le paramètremécanisme de fusible temporiséSi une tranche est bloquée, il ne faut pas qu'elle entraîne l'ensemble dans sa chute. L'interface API d'ipipgo intègre cette fonction afin d'attribuer automatiquement les tâches de requête. 1. aller vers les importants et les impitoyables 2. choisir le bon algorithme de compression 3. la grande séparation du chaud et du froid Q : La déduplication des adresses IP a-t-elle une incidence sur l'utilisation ? Q : Comment interroger rapidement les données compressées ? Q : Le stockage partagé augmente-t-il les coûts de maintenance ? L'optimisation du stockage demande trop d'efforts, il suffit d'aller directement à la page d'accueil du site Web de la Commission européenne, qui contient des informations sur l'utilisation de l'espace de stockage.ipipgo EntrepriseEt c'est fait. Leur système de stockage à domicile présente trois caractéristiques essentielles : La dernière fois que j'ai aidé l'entreprise d'un ami à migrer vers ipipgo, le coût mensuel du serveur, qui s'élevait à l'origine à 20 000 euros, a été ramené directement à 4 000 euros. La clé est que leurPanel sur la visualisation des donnéesFaire comme un voleur, l'utilisation de l'IP, les taux de survie et toutes ces données en un coup d'œil. En matière de stockage de données, il vaut mieux laisser le travail professionnel aux professionnels. Il vaut mieux construire des roues à partir de rien que de monter sur les épaules de géants. À l'heure où le marché de la propriété intellectuelle par procuration est si compétitif, n'est-il pas judicieux d'économiser du temps et de l'argent et d'en profiter pour développer votre entreprise ?Troisièmement, la technologie de compression noire pour économiser de l'espace 80%
Le même segment IP est représenté par le CIDR. Par exemple, 192.168.1.1 à 192.168.1.254 s'écrivent directement 192.168.1.0/24, ce qui permet d'économiser l'espace de stockage de 90%.
Ce sont celles qui fonctionnent le mieux lorsqu'elles sont testées :
- LZ4 : compression rapide mais taux de compression moyen
- Zstandard : l'acteur équilibré
- Brotli : taux de compression le plus élevé mais intensif en termes de CPU
Il est recommandé de choisir en fonction des besoins de l'entreprise, pour plus de rapidité avec LZ4, pour économiser de l'espace avec Brotli.
Transfert de 30 jours d'adresses IP inutilisées vers une chambre froide avec ipipgo'sFonction d'archivage intelligentTraitement automatisé. Les coûts de stockage des données froides à domicile peuvent être réduits à 1/10e de ceux des données chaudes.IV. questions fréquemment posées AQ
R : Cela n'a aucun effet ! La déduplication n'est qu'une optimisation au niveau du stockage, le système l'étend automatiquement lorsqu'il est appelé.
A : Recommandé pour ipipgorésoudre et trouversans décompresser l'ensemble des données, afin de localiser directement les morceaux de données souhaités.
R : Il est plus rentable d'utiliser une solution prête à l'emploi. Par exemple, la solution de stockage d'ipipgo peut être déployée en 10 minutes avec un cluster d'auto-sharding.V. Recommandations du programme pour sauver les cœurs et les esprits
1. l'algorithme de compression intelligent s'adapte automatiquement aux scénarios d'entreprise
2. moteur d'interrogation distribué permettant une réponse à la milliseconde
3. hiérarchisation automatique des données chaudes et froides, coûts de stockage réduits à 80%

