Top articles
-
Deuxième script : addition d'une colonne pour les pages aspirées
La deuxième étape de notre projet consiste à aspirer localement les pages dont nous avons relevé les URLS, pour ensuite pouvoir les traiter et les analyser plus tard. Deux possibilités s'offraient à nous : utiliser la commande wget ou utiliser la commande...
-
Script du premier tableau - version 2
Voici une deuxième version plus efficace de notre premier script. Suivant les conseils donnés en cours, nous avons rajouté une boucle sur la création de chaque tableau par langue et pour éviter des copier-collers. Nous avons aussi arrangé le tableau pour...
-
Premier script shell
Le résultat de notre projet sera présenté sous forme de tableau html, que nous aurons généré automatiquement. La première étape de notre travail consiste donc pour nous à obtenir un tableau contenant toutes les URLS que nous avons relevées, numérotées....
-
Essai avec perl
J'ai voulu essayer de refaire un script perl obtenant les mêmes résultats que celui réalisé avec bash jusqu'à présent. J'ai voulu aussi ajouter des sections à notre tableau, pour distinguer les quatres sous-corpus que comportent nos fichiers d'URLS :...
-
BASH : nouvelle étape
Nous avons repris notre programme précédent, et nous y avons apporté quelques améliorations, à savoir : - Nous avons amélioré la détection de l'encodage des pages en utilisant la commande file sur la page aspirée, avant d'exécuter le dump. Nous avons...
-
BASH : Script 3 Dump initial des pages
L'étape suivante de notre projet a consisté à sélectionner les contenu texte des pages apirées et à l'enregistrer dans un nouveau fichier. Nous avons donc du rajouter une autre colonne à notre tableau contenant le lien menant à ce nouveau fichier. Voici...
-
BASH : Toujours plus loin
Voici notre avancé de la semaine : - Nous avons finalement réussi à implémenter notre clause if sur le retour curl. - Nous avons ajouté une nouvelle condition au traitement des pages dont l'encodage n'est pas de l'utf-8 : nous avons vérifié l'existence...
-
Progrès de notre script
Ces dernières semaines, nous avons fait un certain nombre de modifications à notre programme : - Comme annoncé dans l'article précédent, nous avons inversé l'ordre de traitement du dump des pages : nous procédons maintenant d'abord à partir des informations...
-
Séance du 19 décembre : problèmes d'encodage sur le chinois, installation de mini-grep et du trameur
Dernière séance avant les vacances et avant-dernière séance avant la date de remise du projet. Nous avons compris d'où venait le problème d'encodage des pages du chinois : file les détectait en iso-latin, et nous nous sommes aperçues en observant les...
-
BASH : Avancées du script, egrep dans la balise meta, problèmes d'encodage et mini-grep
Cela fait près de deux semaines que nous n'avons rien publié sur notre blog, mais notre script a tout de même avancé pendant ce temps : - Nous avons enfin réussi à isoler l'information sur l'encodage dans les balises meta : egrep -io "charset *=[^ \>]+"...
-
Recherche d'URLS
Voici une petite présentation de notre corpus d'URLS : Avant de commencer la recherche de nos URLS, nous nous sommes demandé dans quels types de textes nous serions susceptibles de trouver une expression de l'idée de devoir. Nous avons retenu quatre types...
-
Premier contact avec Linux
Séance du 10 octobre 2012 : Lors de cette séance nous avons appris les commandes de base qui nous deviendront indispensables ce semestre. Après un rappel sur l'organisation des répertoires et du fonctionnement des chemins d'accès, entre autres l'opposition...
-
Présentation
Juste un petit article pour attirer votre attention sur la page de présentation de notre projet.