Overblog Tous les blogs Top blogs Technologie & Science Tous les blogs Technologie & Science
Suivre ce blog Administration + Créer mon blog
MENU
Articles récents

Progrès de notre script

8 Janvier 2013

Ces dernières semaines, nous avons fait un certain nombre de modifications à notre programme : - Comme annoncé dans l'article précédent, nous avons inversé l'ordre de traitement du dump des pages : nous procédons maintenant d'abord à partir des informations...

Lire la suite
Publicité

Séance du 19 décembre : problèmes d'encodage sur le chinois, installation de mini-grep et du trameur

19 Décembre 2012

Dernière séance avant les vacances et avant-dernière séance avant la date de remise du projet. Nous avons compris d'où venait le problème d'encodage des pages du chinois : file les détectait en iso-latin, et nous nous sommes aperçues en observant les...

Lire la suite

]+"..."> BASH : Avancées du script, egrep dans la balise meta, problèmes d'encodage et mini-grep

17 Décembre 2012

Cela fait près de deux semaines que nous n'avons rien publié sur notre blog, mais notre script a tout de même avancé pendant ce temps : - Nous avons enfin réussi à isoler l'information sur l'encodage dans les balises meta : egrep -io "charset *=[^ \>]+"...

Lire la suite

BASH : Toujours plus loin

4 Décembre 2012

Voici notre avancé de la semaine : - Nous avons finalement réussi à implémenter notre clause if sur le retour curl. - Nous avons ajouté une nouvelle condition au traitement des pages dont l'encodage n'est pas de l'utf-8 : nous avons vérifié l'existence...

Lire la suite
Publicité

BASH : nouvelle étape

27 Novembre 2012

Nous avons repris notre programme précédent, et nous y avons apporté quelques améliorations, à savoir : - Nous avons amélioré la détection de l'encodage des pages en utilisant la commande file sur la page aspirée, avant d'exécuter le dump. Nous avons...

Lire la suite

BASH : Script 3 Dump initial des pages

20 Novembre 2012

L'étape suivante de notre projet a consisté à sélectionner les contenu texte des pages apirées et à l'enregistrer dans un nouveau fichier. Nous avons donc du rajouter une autre colonne à notre tableau contenant le lien menant à ce nouveau fichier. Voici...

Lire la suite

Essai avec perl

19 Novembre 2012 , Rédigé par Amélie BOSC

J'ai voulu essayer de refaire un script perl obtenant les mêmes résultats que celui réalisé avec bash jusqu'à présent. J'ai voulu aussi ajouter des sections à notre tableau, pour distinguer les quatres sous-corpus que comportent nos fichiers d'URLS :...

Lire la suite

Deuxième script : addition d'une colonne pour les pages aspirées

13 Novembre 2012

La deuxième étape de notre projet consiste à aspirer localement les pages dont nous avons relevé les URLS, pour ensuite pouvoir les traiter et les analyser plus tard. Deux possibilités s'offraient à nous : utiliser la commande wget ou utiliser la commande...

Lire la suite
Publicité

Script du premier tableau - version 2

11 Novembre 2012

Voici une deuxième version plus efficace de notre premier script. Suivant les conseils donnés en cours, nous avons rajouté une boucle sur la création de chaque tableau par langue et pour éviter des copier-collers. Nous avons aussi arrangé le tableau pour...

Lire la suite

Premier script shell

6 Novembre 2012

Le résultat de notre projet sera présenté sous forme de tableau html, que nous aurons généré automatiquement. La première étape de notre travail consiste donc pour nous à obtenir un tableau contenant toutes les URLS que nous avons relevées, numérotées....

Lire la suite
1 2 > >>