/** Live smoke: pnpm tsx connectors/scrapfly/chrono24/_smoke.ts [/brand/model--modN.htm …] (CAPTURE=1 to save fixtures). ~40 Scrapfly credits per page. */ import { createRouter, createCrawlContext, getConnectorMeta } from '@rareindex/connectors'; import { saveFixture } from '@rareindex/connectors/testing'; import { env } from '@rareindex/shared'; import createConnector from './index.js'; const e = env(); const meta = getConnectorMeta('chrono24'); const connector = createConnector(meta); const router = createRouter({ firecrawlApiKey: e.FIRECRAWL_API_KEY, scrapflyApiKey: e.SCRAPFLY_API_KEY }); const seeds = process.argv.slice(2); const ctx = createCrawlContext({ router, meta: { ...meta, config: { ...meta.config, pagesPerSeed: 1 } }, options: { mode: 'probe', limit: Number(process.env.LIMIT ?? 1), seeds: seeds.length ? seeds : undefined } }); for await (const raw of connector.crawl(ctx)) { const recs = await connector.normalize({ ...raw, externalId: raw.externalId ?? null, fetchedAt: raw.fetchedAt ?? new Date() }); const p = raw.payload as { brand: string; model: string; offers: unknown[]; totalListings: number | null }; console.log(`\n# ${raw.url} — ${p.brand} ${p.model}: ${p.offers.length} offers on page, ${p.totalListings} total → ${recs.length} listings`); for (const r of recs.slice(0, 3)) console.log(JSON.stringify(r).slice(0, 700)); if (process.env.CAPTURE) { const slug = raw.url.split('/').slice(-2).join('__').replace(/\.htm$/, ''); saveFixture('chrono24', slug, { raw: { url: raw.url, externalId: raw.externalId ?? null, kind: raw.kind, engine: raw.engine, fetchedAt: raw.fetchedAt ?? new Date(), payload: raw.payload }, expect: { minCount: 10, kinds: ['listing'] }, note: `captured live from ${raw.url}` }); } } console.log('\nengine stats', ctx.engineStats, 'anomalies', ctx.anomalies);