ilia 40c7cdece3
All checks were successful
CI / skip-ci-check (pull_request) Successful in 8s
CI / docker-ci (pull_request) Successful in 10s
CI / secret-scan (pull_request) Successful in 7s
feat: add Google Jobs extractor and fix scraper reliability gaps
Ship a Camoufox-backed Google Jobs source, restore Glassdoor results discarded by a python-jobspy GraphQL quirk, and fix Himalayas/Gradcracker zero-job failures. Also harden prior-skip dismiss matching and multi-profile basic-auth switching for CA/US runs.
2026-07-09 15:11:53 -04:00
..

himalayas-extractor

Pulls listings from the public Himalayas API.

  • No authentication required.
  • Paginates with limit + offset (50 per page, up to 5 pages / 250 jobs).
  • No server-side search — filters client-side by matching title + categories against each pipeline search term.
  • All listings are flagged isRemote: true.
  • Caps results per term via the himalayasMaxJobsPerTerm setting (default 100).