Scraping et résumé automatiques d'articles de presse dans NocoDB
Ce workflow d'automatisation est conçu pour aider les organisations à collecter et traiter efficacement le contenu d'actualités provenant de sites web sans flux RSS.
Il utilise des techniques de scraping web pour extraire les derniers articles de presse, exploite la génération de résumés par IA et l'extraction de mots-clés pour distiller les informations clés, et enregistre les résultats dans une base de données NocoDB pour une analyse et un reporting ultérieurs. Le workflow est déclenché selon un planning hebdomadaire, garantissant que les actualités les plus récentes sont systématiquement capturées et traitées. En automatisant ces tâches répétitives de collecte et de traitement de données, cette solution permet aux équipes de rester informées des tendances et évolutions du secteur sans la charge de la surveillance et de la synthèse manuelles.
Comment Latenode estime le temps et le coût
Latenode facture le temps d'exécution des workflows en secondes CPU. Les 10 000 premières secondes CPU sont gratuites chaque mois, puis l'utilisation suit la tarification pay-as-you-go à la seconde CPU. Les nœuds AI Plug-and-Play (PnP) sont facturés séparément — chaque token PnP coûte 1 USD, en pay-as-you-go au coût du fournisseur plus une petite commission de traitement, sans clés API requises.
Tarifs complets — comment fonctionnent les secondes CPU →Aperçu du workflow
Ce que fait ce modèle
- Extrait le contenu des actualités de sites web sans flux RSS en utilisant des techniques de web scraping
- Génère des résumés et extrait des mots-clés des articles d’actualités grâce à l’IA
- Stocke les données d’actualités traitées dans une base de données NocoDB pour des analyses ultérieures
- Planifie le workflow de collecte et de traitement des données pour une exécution hebdomadaire
- Gagne du temps et des efforts en automatisant les tâches répétitives de surveillance et de synthèse des actualités
Comment ça marche
Déclenchement hebdomadaire du scraping
Ce workflow d’automatisation est déclenché tous les mercredis à 4h32 pour extraire les dernières actualités d’un site web sans flux RSS.
Récupérer le site d’actualités
Le workflow utilise une intégration de navigateur sans tête pour charger le site d’actualités cible et récupérer son contenu HTML.
Extraire les liens des actualités
Une intégration JavaScript est utilisée pour analyser le HTML et extraire les URL de tous les articles d’actualités individuels sur le site.
Extraire les dates de publication
L’intégration JavaScript extrait également la date de publication de chaque article d’actualités à partir du HTML du site.
Filtrer les articles récents
Le workflow filtre ensuite la liste des articles d’actualités pour ne conserver que ceux publiés au cours des 7 derniers jours, garantissant ainsi que le contenu le plus récent est traité.
Traiter chaque article récent
Pour chaque article récent, le workflow effectue les étapes suivantes pour extraire, résumer et enregistrer le contenu.
Récupérer le contenu de l’article
L’intégration de navigateur sans tête est utilisée pour charger le contenu complet de l’article d’actualités actuel.
Extraire les détails de l’article
Une intégration JavaScript extrait le titre et le contenu complet de l’article d’actualités actuel à partir du HTML chargé.
Générer le résumé
Le workflow utilise une intégration OpenAI pour générer un résumé concis de l’article d’actualités actuel.
Extraire les mots-clés
Une autre intégration OpenAI est utilisée pour identifier les 3 mots-clés les plus importants dans l’article d’actualités actuel.
Enregistrer dans NocoDB
Enfin, les détails de l’article, le résumé et les mots-clés sont stockés dans une base de données NocoDB pour des analyses et des rapports ultérieurs.
Guide de configuration
Ajouter l'identifiant API OpenAI
1. Dans le panneau des identifiants Latenode, ajoutez un nouvel identifiant pour l'intégration OpenAI. 2. Saisissez votre clé API OpenAI.
Configurer la connexion à la base de données NocoDB
1. Dans le panneau des identifiants Latenode, ajoutez un nouvel identifiant pour l'intégration NocoDB. 2. Saisissez votre ID de projet NocoDB et votre jeton API.
Configurer le web scraping avec Headless Browser
1. Dans le constructeur visuel Latenode, ajoutez un nœud Headless Browser. 2. Configurez le nœud pour visiter l'URL du site d'actualités cible. 3. Mettez en place une gestion de connexion ou de cookies si nécessaire pour accéder au contenu des actualités.
Extraire les liens et les dates des articles d'actualités
1. Dans le constructeur visuel Latenode, ajoutez un nœud Code après le nœud Headless Browser. 2. Écrivez du code JavaScript pour extraire les liens et les dates des articles d'actualités du HTML de la page web.
Enregistrer les données des articles d'actualités dans NocoDB
1. Dans le constructeur visuel Latenode, ajoutez un nœud NocoDB après les étapes précédentes. 2. Configurez le nœud pour enregistrer les données des articles d'actualités (titre, date, lien, résumé, mots-clés) dans la base de données NocoDB.
Prérequis
FAQ