import requests, re, json, time HDRS={"User-Agent":"Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 Chrome/126 Safari/537.36","HX-Request":"true"} seen=set(); stale=0; page=1 while stale<3 and page<200: r=requests.get(f"https://alimentsduquebec.com/entreprises?page={page}",headers=HDRS,timeout=25) links=set(re.findall(r'href="(https://alimentsduquebec\.com/entreprises/[a-z0-9\-]+)"',r.text)) new=links-seen if not new: stale+=1 else: stale=0 seen|=links if page%10==0: print(page,len(seen),flush=True) page+=1; time.sleep(0.15) print("final pages:",page,"unique:",len(seen)) open("data/raw/adq_enterprise_urls.txt","w").write("\n".join(sorted(seen)))