Overblog Tous les blogs Top blogs Technologie & Science Tous les blogs Technologie & Science
Editer l'article Suivre ce blog Administration + Créer mon blog
MENU

Progrès de notre script

8 Janvier 2013

Ces dernières semaines, nous avons fait un certain nombre de modifications à notre programme :

- Comme annoncé dans l'article précédent, nous avons inversé l'ordre de traitement du dump des pages : nous procédons maintenant d'abord à partir des informations trouvées dans la balise méta, puis ensuite seulement à partir des informations de file. Ceci afin d'éviter des problèmes par rapport à l'encodage des pages en chinois.

Etant donné que les informations des balises méta sont maintenant exploitées en premier, nous nous sommes aperçues de queslques problèmes que cela pouvait poser, et nous avons essayé de les résoudre :

  • Les informations ne sont pas exprimées d'une manière uniforme. Par exemple, on trouve utf-8 et UTF-8. Nous avons dû chercher un moyen d'exprimer une disjonction dans la clause if. Cela se fait avec : ||

  • Nous avons dû modifier l'ordre de certaines instructions et reproduire la clause qui concerne le cas où l'encodage de la page est en utf-8 au sein de la clause de détection de l'encodage avec file.

  • Nous avons dû veiller à ce que la page soit dumpée et classée dans le meme dossier et la meme colonne que les autres pages en utf-8

- Nous avons inversé les colonnes 4 et 5 de notre tableau. La colonne 5 contient désormais tous les liens vers les fichiers dump en utf-8. La colonne 4 contient les liens vers les dumps initials des pages qui n'étaient pas en utf-8.

-Nous avons ajouté à notre tableau une dernière ligne contenant le lien vers le fichier dump_total_NOMDELALANGUE.txt rassemblant tous les dumps pour chaque langue.

En vue du traitement de nos données, nous avons rajouté des balises de type <DUMP=n°del'URL> avant chaque dump.

Nous avons rencontré un problème avec ces fichiers : dans notre code, nous écrivons dans ces fichiers à l'aide de l'opérateur ">>", mais de fait, nous nous sommes aperçues qu'à chaque fois que nous lancions le programme, les données s'accumulaient à répétition. Pour réinitialiser les fichiers à chaque lancement de programme, étant donnée que ces instructions apparaissent dans des clauses if différentes, nous avons dû ajouter une clause if au début de notre programme pour vérifier l'existence de ce fichier et de le le supprimer le cas échéant.

Nous avons donc dédié la première partie de notre code à la préparation de notre environnement de travail.

- Toujours pour la préparation de l'environnement de travail, nous avions décidé de rassember nos fichiers dump convertis ou récupéré en utf-8 dans un meme dossier pour les rendre manipulables. Une simple ligne de commande avec mkdir suffit à créer ce dossier, mais pour ne pas créer de conflits, il faut avant tout vérifier l'existence de ce dossier à l'aide d'une clause if.

- Nous avons aussi essayé de retravailler l'inventation et les commentaires de notre programme, afin de le rendre plus lisible. Nous avons encore du travail sur ce point.

Pour demain, il nous reste à lancer le programme sur l'ensemble de nos fichiers. Nous nous sommes familiarisée avec l'utilisation du mini-grep, il nous reste plus qu'à ajouter cette ligne de code pour finir nos tableaux.

Publicité
Partager cet article
Repost0
Pour être informé des derniers articles, inscrivez vous :
Commenter cet article