Requiero apoyo tecnico para habilitar Crawling en Instancia de AWS
Budget: $30 – $60 USD
Estoy haciendo un Crawling a una Pagina web para obtener información usando la librería puppeteer y Nodejs,
1) Si realizo el crawling en una Instancia EC2 Linux AWS carga correctamente la pagina pero al momento de ejecutar el click sobre el boton de búsqueda, solo se recarga y no muestra información, esto sucede siempre.
2) si realizo la misma prueba en mi maquina local (Windows 10) funciona en algunas ocasiones y en otras no. La pagina indica que tiene recaptcha pero en ningún momento de la navegación sale algún verificador de recaptcha, esta es la configuración actual del código.
Necesito apoyo para resolver este problema.
const puppeteer = require("puppeteer");
function crawling() {
return new Promise(async (res, rej) => {
try {
const broswer = await puppeteer.launch({ headless: true });
const page = (await broswer.pages())[0];
page.setUserAgent('Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/91.0.4472.114 Safari/537.36')
page.setExtraHTTPHeaders({ 'Accept-Language': 'en-US,en;q=0.9' })
await page.goto("https://www.cma-cgm.com/ebusiness/tracking", { waitUntil: 'networkidle2' });
await page.click("#Reference", { delay: 100 });
await page.type('#Reference', 'SNG0303983B', { delay: 300 }); // Types slower, like a user
await page.click("#btnTracking", { delay: 100 });
await page.waitForNavigation({ waitUntil: "domcontentloaded" });
res("success tracking");
} catch (error) {
rej(error)
}
})
}
1) Si realizo el crawling en una Instancia EC2 Linux AWS carga correctamente la pagina pero al momento de ejecutar el click sobre el boton de búsqueda, solo se recarga y no muestra información, esto sucede siempre.
2) si realizo la misma prueba en mi maquina local (Windows 10) funciona en algunas ocasiones y en otras no. La pagina indica que tiene recaptcha pero en ningún momento de la navegación sale algún verificador de recaptcha, esta es la configuración actual del código.
Necesito apoyo para resolver este problema.
const puppeteer = require("puppeteer");
function crawling() {
return new Promise(async (res, rej) => {
try {
const broswer = await puppeteer.launch({ headless: true });
const page = (await broswer.pages())[0];
page.setUserAgent('Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/91.0.4472.114 Safari/537.36')
page.setExtraHTTPHeaders({ 'Accept-Language': 'en-US,en;q=0.9' })
await page.goto("https://www.cma-cgm.com/ebusiness/tracking", { waitUntil: 'networkidle2' });
await page.click("#Reference", { delay: 100 });
await page.type('#Reference', 'SNG0303983B', { delay: 300 }); // Types slower, like a user
await page.click("#btnTracking", { delay: 100 });
await page.waitForNavigation({ waitUntil: "domcontentloaded" });
res("success tracking");
} catch (error) {
rej(error)
}
})
}