HTML 82.1%
Python 14.6%
TypeScript 1.9%
CSS 1%
JavaScript 0.5%
1# =============================================================================2# Job·Ka — Groupe KA3# Auteur : Simon-Pierre Boucher4# Contact : contact@spboucher.ai5# Fichier : jobka/normalize.py6# Rôle : Normalisation commune des offres (salaires, dates, mode/type7# d'emploi, lieu, catégorie, exigences, séniorité) — jamais de8# valeur inventée9# Créé : 2026-08-17 Modifié : 2026-09-1810# =============================================================================11"""Couche de normalisation commune appelée par JobPosting.finalize().1213Philosophie héritée de Lou·Ka : parseurs déterministes (regex, tables de14mots-clés FR/EN), bornes de plausibilité, et surtout — une valeur absente15reste absente (None / chaîne vide), on ne devine jamais.16"""17from __future__ import annotations1819import datetime as _dt20import re21import unicodedata2223__all__ = [24 "strip_accents", "clean_text", "clean_html", "parse_salary",25 "sanitize_salary", "salary_from_text", "salary_to_yearly",26 "salary_to_hourly", "parse_date", "parse_work_mode",27 "parse_employment_type", "parse_location", "canonical_city",28 "is_quebec_location", "categorize", "detect_language",29 "extract_benefits", "clean_title", "extract_requirements",30 "parse_seniority",31]323334# ---------------------------------------------------------------------------35# Texte36# ---------------------------------------------------------------------------3738def strip_accents(s: str) -> str:39 return "".join(c for c in unicodedata.normalize("NFD", s)40 if unicodedata.category(c) != "Mn")414243def _key(s: str) -> str:44 """Minuscules sans accents — pour le matching de mots-clés."""45 return strip_accents((s or "").lower())464748def clean_text(s: str) -> str:49 """Espaces insécables -> espace, blancs réduits."""50 s = (s or "").replace("\xa0", " ").replace(" ", " ").replace(" ", " ")51 return re.sub(r"[ \t]+", " ", s).strip()525354_BLOCK_TAGS = re.compile(55 r"</?(?:p|div|br|li|ul|ol|h[1-6]|tr|table|section|article)[^>]*>", re.I)5657# Résidu HTML après une passe : balise ouvrante plausible ou entité encore58# encodée — signe d'un contenu doublement échappé.59_HTML_LEFTOVER = re.compile(60 r"<(?:p|br|li|ul|ol|div|span|strong|em|b|i|h[1-6]|a)\b|&(?:amp|lt|gt|nbsp|#\d+);",61 re.I)626364def clean_html(html: str) -> str:65 """HTML -> texte lisible : balises de bloc = sauts de ligne, le reste retiré.6667 Suffisant pour les descriptions d'offres (les connecteurs qui ont besoin68 d'un vrai parseur utilisent BeautifulSoup eux-mêmes).69 """70 if not html:71 return ""72 import html as _html73 s = html74 # Contenus sur-échappés (entités dans les entités — Greenhouse/Lever) :75 # nettoyer en boucle tant qu'il reste des balises/entités (max 3 passes).76 for _ in range(3):77 s = _html.unescape(s)78 s = re.sub(r"<(script|style)[^>]*>.*?</\1>", " ", s, flags=re.I | re.S)79 s = _BLOCK_TAGS.sub("\n", s)80 s = re.sub(r"<[^>]+>", " ", s)81 if not _HTML_LEFTOVER.search(s):82 break83 s = s.replace("\xa0", " ").replace(" ", " ")84 s = re.sub(r"[ \t]+", " ", s)85 s = re.sub(r" ?\n ?", "\n", s)86 return re.sub(r"\n{3,}", "\n\n", s).strip()878889# ---------------------------------------------------------------------------90# Salaires — transparence salariale = différenciateur clé de Job·Ka91# ---------------------------------------------------------------------------9293# Bornes de plausibilité par unité (CAD). Hors bornes = on jette (pas de94# salaire inventé, pas de « 1 $/h » venu d'un parsing raté).95_SALARY_BOUNDS = {96 "hour": (14.0, 250.0),97 "day": (100.0, 2000.0),98 "week": (500.0, 10000.0),99 "biweek": (1000.0, 20000.0),100 "month": (1800.0, 45000.0),101 "year": (20000.0, 600000.0),102}103104# Heures/an de référence pour les conversions (semaine de 40 h).105_HOURS_PER_YEAR = 2080.0106107_UNIT_PATTERNS = [108 ("hour", r"(?:/|par|per|an?)\s*(?:h\b|hr\b|hre\b|heure|hour)|horaire|hourly"),109 ("year", r"(?:/|par|per|an?)\s*(?:an\b|année|annee|year|yr\b)|annuel|annual|yearly|per\s+annum"),110 ("month", r"(?:/|par|per)\s*(?:mois|month)|mensuel|monthly"),111 ("biweek", r"(?:aux|par|per)\s*(?:2|deux|two)\s*semaines|bi-?weekly|quinzaine"),112 ("week", r"(?:/|par|per)\s*(?:sem\b|semaine|week|wk\b)|hebdomadaire|weekly"),113 ("day", r"(?:/|par|per)\s*(?:jour|day)|journalier|daily"),114]115116_NUM_RE = re.compile(r"\d{1,3}(?:[ ,]\d{3})+(?:[.,]\d{1,2})?|\d+(?:[.,]\d{1,2})?[kK]?")117118119def _parse_number(tok: str) -> float | None:120 tok = tok.strip()121 k = tok.lower().endswith("k")122 if k:123 tok = tok[:-1]124 # « 52,000 » (milliers anglais) vs « 52000,00 » / « 25,50 » (décimales)125 tok = tok.replace(" ", " ").replace(" ", " ")126 if re.fullmatch(r"\d{1,3}(?:[ ,]\d{3})+(?:[.,]\d{1,2})?", tok):127 # séparateur de milliers : retirer espaces/virgules de groupe128 tok = re.sub(r"[ ,](?=\d{3}\b)", "", tok)129 tok = tok.replace(",", ".").replace(" ", "")130 try:131 v = float(tok)132 except ValueError:133 return None134 return v * 1000 if k else v135136137def parse_salary(raw: str) -> tuple[float | None, float | None, str | None]:138 """Texte de salaire -> (min, max, unité) ou (None, None, None).139140 Exige un signe monétaire ($, CAD, dollars) OU une unité explicite proche141 des nombres — sans quoi « 35 heures/semaine » deviendrait un salaire.142 """143 s = clean_text(raw)144 if not s:145 return (None, None, None)146 key = _key(s)147148 unit = None149 for u, pat in _UNIT_PATTERNS:150 if re.search(pat, key):151 unit = u152 break153154 has_money = bool(re.search(r"\$|cad\b|dollar", key))155 if not has_money and unit is None:156 return (None, None, None)157158 nums = [_parse_number(m.group(0)) for m in _NUM_RE.finditer(s)]159 nums = [n for n in nums if n is not None]160 if not nums:161 return (None, None, None)162163 # Sans unité explicite : inférer par l'ordre de grandeur (avec $ obligatoire)164 if unit is None:165 probe = max(nums)166 if probe < 300:167 unit = "hour"168 elif probe >= 18000:169 unit = "year"170 else:171 return (None, None, None) # zone ambiguë : ne pas deviner172173 lo, hi = _SALARY_BOUNDS[unit]174 vals = sorted(n for n in nums if lo <= n <= hi)175 if not vals:176 return (None, None, None)177 return (vals[0], vals[-1] if len(vals) > 1 else vals[0], unit)178179180_TO_YEAR = {"hour": _HOURS_PER_YEAR, "day": 260.0, "week": 52.0,181 "biweek": 26.0, "month": 12.0, "year": 1.0}182183184def salary_to_yearly(value: float | None, unit: str | None) -> float | None:185 if value is None or unit not in _TO_YEAR:186 return None187 return round(value * _TO_YEAR[unit], 0)188189190def salary_to_hourly(value: float | None, unit: str | None) -> float | None:191 y = salary_to_yearly(value, unit)192 return round(y / _HOURS_PER_YEAR, 2) if y is not None else None193194195def sanitize_salary(lo: float | None, hi: float | None, unit: str | None196 ) -> tuple[float | None, float | None, str | None]:197 """Bornes de plausibilité sur les salaires STRUCTURÉS fournis par les ATS.198199 Certaines sources étiquettent mal l'unité (75 000 « /mois » ou « /h » pour200 un salaire annuel — vu chez Lever et dans les JSON-LD de portails) : si la201 valeur sort des bornes de son unité, on tente une réinterprétation vers202 l'unité dont les bornes la contiennent (année d'abord, puis heure). Aucune203 unité plausible -> on jette (pas de salaire aberrant publié).204 """205 if lo is None or unit not in _SALARY_BOUNDS:206 return (lo, hi, unit)207 b = _SALARY_BOUNDS[unit]208 if not (b[0] <= lo <= b[1]):209 for candidate in ("year", "hour"):210 cb = _SALARY_BOUNDS[candidate]211 if candidate != unit and cb[0] <= lo <= cb[1]:212 unit, b = candidate, cb213 break214 else:215 return (None, None, None)216 if hi is not None and not (b[0] <= hi <= b[1]):217 hi = None # max aberrant : on garde le min plausible seul218 if hi is not None and hi < lo:219 lo, hi = hi, lo220 return (lo, hi, unit)221222223# Contextes où un montant en $ n'est PAS un salaire (financement, dépenses,224# allocations…) — garde-fou de l'extraction depuis la description.225_NOT_SALARY_CONTEXT = re.compile(226 r"financement|funding|amorcage|seed|investisse|invest(?:ment|or)|"227 r"revenu[s]?\b|revenue|chiffre d affaires|budget|remboursement|"228 r"reimburse|expense|allocation|allowance|subvention|credit d impot|"229 r"cotisation|rabais|discount|gift|carte[- ]cadeau|referral (?:bonus|fee)|"230 r"signing bonus|prime (?:a l embauche|de demarrage|de reference)|"231 r"million|milliard")232233234def salary_from_text(text: str) -> tuple[float | None, float | None,235 str | None, str]:236 """Cherche une mention salariale dans un texte libre (description).237238 Découpe en phrases (les points décimaux « 182,500.00 » ne coupent pas),239 ignore les contextes non salariaux (financement, remboursements…), puis240 parse la première phrase plausible. Retourne (min, max, unité, libellé).241 """242 if not text or "$" not in text:243 return (None, None, None, "")244 for sentence in re.split(r"(?<!\d)\.(?!\d)|\n|;", text):245 if "$" not in sentence or not re.search(r"\d", sentence):246 continue247 frag = clean_text(sentence)[:160]248 if _NOT_SALARY_CONTEXT.search(_key(frag)):249 continue250 lo, hi, unit = parse_salary(frag)251 if lo is not None:252 return (lo, hi, unit, frag)253 return (None, None, None, "")254255256# ---------------------------------------------------------------------------257# Dates — ISO 8601, jamais de date inventée258# ---------------------------------------------------------------------------259260_MONTHS = {261 "janvier": 1, "jan": 1, "january": 1,262 "fevrier": 2, "fev": 2, "february": 2, "feb": 2,263 "mars": 3, "mar": 3, "march": 3,264 "avril": 4, "avr": 4, "april": 4, "apr": 4,265 "mai": 5, "may": 5,266 "juin": 6, "june": 6, "jun": 6,267 "juillet": 7, "juil": 7, "july": 7, "jul": 7,268 "aout": 8, "august": 8, "aug": 8,269 "septembre": 9, "sept": 9, "sep": 9, "september": 9,270 "octobre": 10, "oct": 10, "october": 10,271 "novembre": 11, "nov": 11, "november": 11,272 "decembre": 12, "dec": 12, "december": 12,273}274275_REL_RE = re.compile(276 r"(?:il y a|posted)\s+(\d+)\+?\s*(jour|day|semaine|week|mois|month)|"277 r"(\d+)\+?\s*(jour|day|semaine|week|mois|month)s?\s+ago", re.I)278_TODAY_RE = re.compile(r"aujourd'?hui|today|posted today|date du jour", re.I)279_YESTERDAY_RE = re.compile(r"hier|yesterday", re.I)280281282def parse_date(raw, today: _dt.date | None = None) -> str | None:283 """Valeur de date hétéroclite -> ISO « YYYY-MM-DD », ou None.284285 Accepte : ISO (+ horodatages), epoch secondes/millisecondes, formats286 textuels FR/EN (« 1er juillet 2026 », « July 1st, 2026 »), et les dates287 relatives (« il y a 3 jours », « Posted 30+ Days Ago »).288 """289 if raw is None:290 return None291 today = today or _dt.date.today()292293 if isinstance(raw, (int, float)): # epoch (Lever : millisecondes)294 ts = float(raw)295 if ts > 1e12:296 ts /= 1000.0297 if 1e9 <= ts <= 4e9:298 return _dt.date.fromtimestamp(ts).isoformat()299 return None300301 s = clean_text(str(raw))302 if not s:303 return None304 key = _key(s)305306 m = re.search(r"(\d{4})-(\d{2})-(\d{2})", s) # ISO (avec ou sans heure)307 if m:308 try:309 return _dt.date(int(m.group(1)), int(m.group(2)), int(m.group(3))).isoformat()310 except ValueError:311 return None312313 if _TODAY_RE.search(key):314 return today.isoformat()315 if _YESTERDAY_RE.search(key):316 return (today - _dt.timedelta(days=1)).isoformat()317318 m = _REL_RE.search(key)319 if m:320 n = int(m.group(1) or m.group(3))321 unit = (m.group(2) or m.group(4) or "").lower()322 days = n * (7 if unit.startswith(("sem", "week"))323 else 30 if unit.startswith(("moi", "month")) else 1)324 return (today - _dt.timedelta(days=days)).isoformat()325326 # « 1er juillet 2026 » / « July 1st, 2026 » / « déc. 2026 »327 m = re.search(r"(?:(\d{1,2})(?:er|e|st|nd|rd|th)?\s+)?([a-z]{3,9})\.?,?\s+(?:(\d{1,2})(?:er|st|nd|rd|th)?,?\s+)?(\d{4})", key)328 if m:329 mois = _MONTHS.get(m.group(2))330 if mois:331 jour = int(m.group(1) or m.group(3) or 1)332 try:333 return _dt.date(int(m.group(4)), mois, jour).isoformat()334 except ValueError:335 return None336337 m = re.fullmatch(r"(\d{1,2})/(\d{1,2})/(\d{4})", s) # jj/mm/aaaa (usage QC)338 if m:339 d, mo, y = int(m.group(1)), int(m.group(2)), int(m.group(3))340 if mo > 12 and d <= 12: # en fait mm/jj/aaaa341 d, mo = mo, d342 try:343 return _dt.date(y, mo, d).isoformat()344 except ValueError:345 return None346 return None347348349# ---------------------------------------------------------------------------350# Mode de travail / type d'emploi351# ---------------------------------------------------------------------------352353_MODE_RULES = [354 ("teletravail", r"100\s*%\s*(?:teletravail|remote)|full(?:y)?[ -]remote|"355 r"teletravail|travail a distance|remote(?:\b|-first)|a distance"),356 ("hybride", r"hybrid|hybride|flexible?\s*(?:work|travail)"),357 ("presentiel", r"presentiel|sur (?:place|site)|on[- ]?site|in[- ]?(?:office|person)"),358]359360361def parse_work_mode(raw: str) -> str | None:362 key = _key(raw)363 if not key:364 return None365 # « hybride » prime sur les mentions accessoires de télétravail366 if re.search(_MODE_RULES[1][1], key):367 return "hybride"368 for mode, pat in _MODE_RULES:369 if re.search(pat, key):370 return mode371 return None372373374_TYPE_RULES = [375 ("stage", r"\bstage\b|stagiaire|intern(?:ship)?\b|co-?op\b|alternance"),376 ("saisonnier", r"saisonn|seasonal"),377 ("contractuel", r"contrat\b|contract(?:uel|or)?\b|temporaire|temporary|terme|"378 r"fixed[- ]term|duree determinee|pigiste|freelance|consultant"),379 ("temps_partiel", r"temps[- ]partiel|part[- ]?time|partiel\b"),380 ("temps_plein", r"temps[- ]plein|full[- ]?time|permanent|regulier|"381 r"regular\b|duree indeterminee"),382]383384385def parse_employment_type(raw: str) -> str | None:386 key = _key(raw)387 if not key:388 return None389 for typ, pat in _TYPE_RULES:390 if re.search(pat, key):391 return typ392 return None393394395# ---------------------------------------------------------------------------396# Lieu — extraction ville/région + garde-fou « offre au Québec »397# ---------------------------------------------------------------------------398399# Villes québécoises fréquentes dans les libellés d'offres (clé sans accents).400# Sert à la fois au parsing et au filtre is_quebec_location.401_QC_CITIES = {402 "montreal": "Montréal", "quebec": "Québec", "ville de quebec": "Québec",403 "quebec city": "Québec", "laval": "Laval", "gatineau": "Gatineau",404 "longueuil": "Longueuil", "sherbrooke": "Sherbrooke",405 "saguenay": "Saguenay", "chicoutimi": "Saguenay",406 "levis": "Lévis", "trois-rivieres": "Trois-Rivières",407 "trois rivieres": "Trois-Rivières", "terrebonne": "Terrebonne",408 "brossard": "Brossard", "repentigny": "Repentigny",409 "boucherville": "Boucherville", "saint-jerome": "Saint-Jérôme",410 "drummondville": "Drummondville", "saint-jean-sur-richelieu":411 "Saint-Jean-sur-Richelieu", "granby": "Granby", "shawinigan": "Shawinigan",412 "joliette": "Joliette", "victoriaville": "Victoriaville",413 "rimouski": "Rimouski", "rouyn-noranda": "Rouyn-Noranda",414 "baie-comeau": "Baie-Comeau", "sept-iles": "Sept-Îles",415 "fermont": "Fermont",416 "val-d'or": "Val-d'Or", "val d'or": "Val-d'Or", "alma": "Alma",417 "sainte-foy": "Québec", "anjou": "Montréal", "dorval": "Dorval",418 "boisbriand": "Boisbriand", "blainville": "Blainville",419 "mirabel": "Mirabel", "saint-hyacinthe": "Saint-Hyacinthe",420 "beloeil": "Belœil", "chateauguay": "Châteauguay", "magog": "Magog",421 "thetford mines": "Thetford Mines", "saint-georges": "Saint-Georges",422 "riviere-du-loup": "Rivière-du-Loup", "matane": "Matane",423 "sorel-tracy": "Sorel-Tracy", "varennes": "Varennes",424 "vaudreuil-dorion": "Vaudreuil-Dorion", "salaberry-de-valleyfield":425 "Salaberry-de-Valleyfield", "kirkland": "Kirkland",426 "pointe-claire": "Pointe-Claire", "saint-laurent": "Montréal",427 "ville saint-laurent": "Montréal", "verdun": "Montréal",428 "westmount": "Westmount", "candiac": "Candiac", "la prairie": "La Prairie",429 "mont-tremblant": "Mont-Tremblant", "saint-bruno": "Saint-Bruno-de-Montarville",430 "bromont": "Bromont", "cowansville": "Cowansville",431 "rougemont": "Rougemont",432 "saint-augustin-de-desmaures": "Saint-Augustin-de-Desmaures",433 "l'ancienne-lorette": "L'Ancienne-Lorette",434}435436_QC_MARKERS = re.compile(437 r"\bqc\b|\bquebec\b|\bqu[e]bec, canada\b|province de quebec", re.I)438_POSTAL_RE = re.compile(r"\b([GHJ]\d[A-Z])\s*(\d[A-Z]\d)\b", re.I) # G/H/J = Québec439440# « Quebec » suivi d'un type de voie anglophone = nom de RUE, pas la province441# (« 3401 Quebec St. Suite 8000, Denver, CO » — bug solmentalhealth 2026-09-14 :442# offre de Denver publiée comme Québec/Capitale-Nationale). Neutralisé avant443# tout matching de marqueur/ville. Le (?!-) protège les abréviations de saints444# des libellés québécois légitimes (« CAN Quebec St-Hubert », « Ste-Thérèse »).445_QUEBEC_STREET_RE = re.compile(446 r"\bquebec\s+(?:st|street|ave|avenue|blvd|boulevard|rd|road|dr|drive|"447 r"ct|court|ln|lane|way|pl|place|hwy|highway|pkwy|parkway)\b\.?(?!-)")448449# Villes canadiennes hors Québec (et grandes villes étrangères) fréquentes450# dans les flux pancanadiens/mondiaux — jamais des villes d'offres451# québécoises : à rejeter lors du parsing de lieu (clés sans accents).452_NON_QC_CITIES = frozenset({453 "toronto", "ottawa", "vancouver", "calgary", "edmonton", "winnipeg",454 "mississauga", "brampton", "hamilton", "kitchener", "waterloo", "halifax",455 "dartmouth", "victoria", "saskatoon", "regina", "st. john's", "st johns",456 "saint john", "fredericton", "moncton", "charlottetown", "london",457 "markham", "vaughan", "richmond hill", "oakville", "burlington", "oshawa",458 "whitby", "ajax", "pickering", "guelph", "kingston", "barrie",459 "kelowna", "kamloops", "nanaimo", "abbotsford", "surrey", "burnaby",460 "coquitlam", "langley", "north york", "scarborough", "etobicoke",461 "north vancouver", "milton", "cambridge", "st. catharines",462 "niagara falls", "thunder bay", "sudbury", "greater sudbury",463 "sault ste. marie", "red deer", "lethbridge", "medicine hat",464 "grande prairie", "fort mcmurray", "yellowknife", "whitehorse", "iqaluit",465 "can", "canada", "ontario", "alberta", "british columbia", "manitoba",466 "saskatchewan", "nova scotia", "new brunswick",467 "new york", "new york city", "san francisco", "boston", "chicago",468 "seattle", "austin", "denver", "los angeles", "miami", "atlanta",469 "dallas", "houston", "philadelphia", "washington", "phoenix", "portland",470 "paris", "londres", "amsterdam", "berlin", "munich", "dublin", "madrid",471 "barcelona", "barcelone", "lisbon", "lisbonne", "sydney", "melbourne",472 "singapore", "singapour", "tokyo", "bangalore", "bengaluru", "mumbai",473 "mexico city", "sao paulo", "bogota", "buenos aires", "las vegas",474 "orlando", "nashville", "macau",475})476477478def canonical_city(raw: str) -> str:479 """Canonicalise un nom de ville (« Montreal » -> « Montréal »,480 « Quebec City » -> « Québec »). Inconnu : retourne le texte nettoyé."""481 s = clean_text(raw)482 if not s:483 return ""484 key = _key(s)485 exact = _QC_CITIES.get(key)486 if exact:487 return exact488 for ck, city in _QC_CITIES.items():489 if re.fullmatch(re.escape(ck), key):490 return city491 return s492493494def parse_location(raw: str) -> dict:495 """Libellé de lieu -> {city, region, postal_code} (champs possiblement vides).496497 Ex. « Montréal, QC, Canada », « Ville de Québec, Québec », « Remote - QC ».498 """499 s = clean_text(raw)500 out = {"city": "", "region": "", "postal_code": ""}501 if not s:502 return out503 m = _POSTAL_RE.search(s)504 if m:505 out["postal_code"] = f"{m.group(1).upper()} {m.group(2).upper()}"506 key = _QUEBEC_STREET_RE.sub(" ", _key(s))507 for ck, city in _QC_CITIES.items():508 if re.search(rf"(?<![a-z]){re.escape(ck)}(?![a-z])", key):509 out["city"] = city510 break511 if _QC_MARKERS.search(key) or out["city"] or (512 out["postal_code"] and out["postal_code"][0] in "GHJ"):513 out["region"] = "Québec"514 if not out["city"]:515 # premier segment avant la virgule, si ça ressemble à un nom de ville :516 # contient des lettres, ≤ 3 mots, pas un mot générique ni un nom de517 # succursale (« Caisse Desjardins de… », « Centre de services… »)518 seg = clean_text(s.split(",")[0])519 seg_key = _key(seg)520 if (seg and len(seg) <= 40 and re.search(r"[a-z]", seg_key)521 and len(seg.split()) <= 3522 and seg_key not in _NON_QC_CITIES523 and not re.search(524 r"remote|teletravail|canada|multiple|various|partout|"525 r"\d+\s+locations?|\d+\s+lieux|caisse|succursale|"526 r"centre de services|siege social", seg_key)):527 out["city"] = seg528 return out529530531# Code de province canadienne ou d'État américain explicitement HORS Québec532# (« Kirkland, WA », « London, ON ») : jamais une offre québécoise, même si la533# ville est homonyme d'une ville du Québec (Kirkland WA ≠ Kirkland QC — bug534# derumarketcatering 2026-08-26 : restaurant de l'État de Washington affiché535# comme Montréal). Codes ambigus avec le français exclus volontairement :536# CA (Canada/Californie), OR (Val-d'Or), LA (La Prairie), DE, IN, ME, MT.537_NON_QC_REGION_RE = re.compile(538 r"[,\s](on|bc|ab|sk|mb|ns|nb|pe|pei|nl|yt|nt|nu|"539 r"wa|ny|tx|fl|il|ma|md|mi|mn|mo|ms|nc|nd|ne|nh|nj|nm|nv|oh|ok|"540 r"pa|ri|sc|sd|tn|ut|va|vt|wi|wv|wy|ak|al|ar|az|co|ct|dc|ga|hi|"541 r"ia|id|ks|ky)\.?(?=$|[,\s])")542543544def is_quebec_location(raw: str) -> bool:545 """Vrai si le libellé pointe vers le Québec (filtre des ATS pancanadiens)."""546 key = _QUEBEC_STREET_RE.sub(" ", _key(clean_text(raw)))547 if not key:548 return False549 if key in _NON_QC_CITIES: # libellé = ville canadienne/monde hors QC550 return False551 if _QC_MARKERS.search(key):552 return True553 m = _POSTAL_RE.search(raw)554 if m and m.group(1)[0].upper() in "GHJ":555 return True556 if _NON_QC_REGION_RE.search(key): # « Kirkland, WA » : homonyme hors QC557 return False558 return any(re.search(rf"(?<![a-z]){re.escape(ck)}(?![a-z])", key)559 for ck in _QC_CITIES)560561562# ---------------------------------------------------------------------------563# Catégorisation — taxonomie interne déterministe (mots-clés FR/EN)564# ---------------------------------------------------------------------------565566_CATEGORY_RULES = [567 ("TI", r"developpe|developer|logiciel|software|devops|donnees|data\b|"568 r"informatique|programmeur|programmer|cybersecurit|cloud|fullstack|"569 r"full[- ]stack|backend|frontend|sre\b|qa\b|scrum|infrastructure ti|"570 r"intelligence artificielle|machine learning|\bia\b|\bai\b|analyste ti"),571 ("Santé", r"infirmier|infirmiere|nurse|medecin|pharmac|dentaire|sante\b|"572 r"prepose aux beneficiaires|\bpab\b|physiotherap|ergotherap|"573 r"psycholog|travailleur social|clinique|medical"),574 ("Ingénierie", r"ingenieur|engineer(?!ing manager, software)|genie\b|"575 r"mecanique du batiment|electrique|civil\b|structurel"),576 ("Construction", r"construction|charpentier|menuisier|plombier|electricien|"577 r"contremaitre|chantier|grutier|briqueteur|couvreur|paysagiste"),578 ("Finance", r"comptab|account(?:ant|ing)|finance|financier|paie\b|payroll|audit|"579 r"fiscalite|tresorerie|actuaire|actuarial|credit\b|placement"),580 ("Éducation", r"enseignant|professeur|teacher|educat|tuteur|formateur|"581 r"pedagog|garderie|cpe\b"),582 ("Juridique", r"avocat|juriste|notaire|parajuriste|paralegal|legal counsel|"583 r"conformite|compliance"),584 ("RH", r"ressources humaines|\brh\b|recrut|talent|human resources|\bhr\b|"585 r"acquisition de talents"),586 ("Marketing", r"marketing|communication|contenu|content|marque|brand|"587 r"medias sociaux|social media|seo\b|publicite|graphiste|designer"),588 ("Ventes", r"vente|ventes|sales|representant|account (?:executive|manager)|"589 r"developpement des affaires|business development|conseiller commercial"),590 ("Service à la clientèle", r"service a la clientele|customer (?:service|success|"591 r"support)|centre d'appels|call cent"),592 ("Transport", r"chauffeur|camionneur|driver|livreur|logistique|logistics|"593 r"transport|entrepot|warehouse|cariste|repartiteur"),594 ("Production", r"production|manufactur|usine|operateur|machiniste|soudeur|"595 r"welder|assembleur|journalier|emballage|maintenance industrielle"),596 ("Restauration", r"cuisinier|chef\b|serveur|barista|restauration|plongeur|"597 r"boulanger|patissier|traiteur|banquet"),598 ("Commerce de détail", r"commis|caissier|retail|magasin|boutique|"599 r"marchandiseur|gerant de magasin"),600 ("Administration", r"adjoint|administratif|secretaire|receptionniste|"601 r"coordonnat|commis de bureau|office (?:manager|clerk)"),602]603604605# ---------------------------------------------------------------------------606# Langue de l'offre — heuristique légère par mots-outils (fr | en | bilingue)607# ---------------------------------------------------------------------------608609# Mots-outils très fréquents et quasi exclusifs à chaque langue (sans accents).610_FR_STOPWORDS = re.compile(611 r"\b(?:le|la|les|des|une|et|est|sont|pour|avec|vous|nous|notre|nos|vos|"612 r"dans|chez|aux|du|au|ainsi|plus de|afin|etre|sera|poste|equipe|"613 r"exigences|taches|milieu|travail)\b")614_EN_STOPWORDS = re.compile(615 r"\b(?:the|and|for|with|you|your|we|our|is|are|will|this|that|team|"616 r"work|skills|of|to be|as well|role|responsibilities|requirements|"617 r"experience in|ability)\b")618619620def detect_language(title: str, description: str = "") -> str:621 """Langue du texte de l'offre : « fr », « en », « bilingue », ou "".622623 Comptage de mots-outils sur le début du texte — déterministe, jamais de624 valeur inventée : texte trop court ou ambigu -> "".625 """626 text = _key(f"{title}\n{description or ''}"[:4000])627 if len(text) < 30:628 return ""629 fr = len(_FR_STOPWORDS.findall(text))630 en = len(_EN_STOPWORDS.findall(text))631 total = fr + en632 if total < 5:633 return ""634 # les deux langues nettement présentes -> offre bilingue635 if fr >= 8 and en >= 8 and min(fr, en) / max(fr, en) >= 0.35:636 return "bilingue"637 if fr > en:638 return "fr"639 if en > fr:640 return "en"641 return ""642643644# ---------------------------------------------------------------------------645# Avantages — extraction des blocs « Avantages / Benefits » des descriptions646# ---------------------------------------------------------------------------647648_BENEFITS_HEADING = re.compile(649 r"^\s*(?:les\s+|nos\s+|our\s+|tes\s+|vos\s+)?(?:avantages(?:\s+sociaux|"650 r"\s+offerts|\s+et\s+conditions)?|"651 r"benefits(?:\s+&\s+perks|\s+offered)?|perks(?:\s+(?:and|&)\s+benefits)?|"652 r"ce que (?:nous|l'on|on) (?:t'|te\s+|vous\s+)?offr(?:ons|e)|"653 r"nous (?:t'|te\s+|vous\s+)?offrons|on (?:t'|te\s+|vous\s+)offre|"654 r"what we offer|what'?s in it for you|why join us|why work (?:with|for) us|"655 r"pourquoi (?:nous rejoindre|nous choisir|te joindre a nous|"656 r"vous joindre a nous|travailler (?:chez|avec) nous)|we offer)"657 r"\s*:?\s*$", re.I)658_BENEFIT_LINE_MAX = 120659660661def extract_benefits(description: str) -> list[str]:662 """Liste d'avantages depuis un bloc structuré de la description.663664 Cherche un titre de section « Avantages/Benefits/… » seul sur sa ligne,665 puis prend les lignes courtes qui suivent (puces), en s'arrêtant à la666 première ligne longue ou au prochain titre. Max 12 items — si le bloc ne667 ressemble pas à une liste, on ne retourne rien (pas d'à-peu-près).668 """669 if not description:670 return []671 lines = description.split("\n")672 for i, line in enumerate(lines):673 if not _BENEFITS_HEADING.match(strip_accents(line)):674 continue675 items: list[str] = []676 for nxt in lines[i + 1:]:677 t = clean_text(nxt).lstrip("•-–—*·◦▪ ").strip()678 if not t:679 if items:680 break # fin du bloc (ligne vide après les puces)681 continue682 if len(t) > _BENEFIT_LINE_MAX or _BENEFITS_HEADING.match(683 strip_accents(t)):684 break685 # un « titre » de section suivant (courte ligne sans ponctuation686 # finale, capitalisée) termine aussi le bloc687 if items and len(t.split()) <= 4 and t.endswith(":"):688 break689 items.append(t.rstrip(" ;,.").strip())690 if len(items) >= 12:691 break692 if len(items) >= 2:693 return items694 return []695696697# ---------------------------------------------------------------------------698# Exigences — expérience, scolarité, langues (depuis la description)699# ---------------------------------------------------------------------------700701# Années d'expérience : « 3 à 5 ans d'expérience », « minimum de 5 ans »,702# « 5+ years of experience », « two (2) years of relevant experience »…703_EXP_PATTERNS = [704 # « X à Y ans/years … expérience » (fourchette) — on garde le MIN705 re.compile(r"(\d{1,2})\s*(?:a|-|to)\s*\d{1,2}\s*(?:ans?|years?)"706 r"[^.\n]{0,40}?(?:d )?experience", re.I),707 # « X ans/années/years (+) d'expérience »708 re.compile(r"(\d{1,2})\s*\+?\s*(?:ans?|annees?|years?)"709 r"[^.\n]{0,40}?(?:d )?experience", re.I),710 # « expérience … de X ans » / « experience of X+ years »711 re.compile(r"experience[^.\n]{0,50}?(?:de|of|d au moins|minimum(?: de)?|"712 r"at least)\s*(\d{1,2})\s*\+?\s*(?:ans?|annees?|years?)", re.I),713 # « minimum de X ans » / « at least X years » (sans le mot expérience)714 re.compile(r"(?:minimum(?: de)?|au moins|at least)\s*(\d{1,2})\s*"715 r"(?:ans?|annees?|years?)\b", re.I),716]717718# Scolarité : du plus élevé au moins élevé — on retourne le PLUS BAS exigé719# quand plusieurs sont acceptés (« bac ou maîtrise » -> baccalauréat).720# Les sigles QC (DEP/DEC/AEC/DES) ne comptent que dans un contexte scolaire721# (« dec. » est aussi l'abréviation de décembre).722_EDU_SCHOOL_CONTEXT = re.compile(723 r"diplome|dipl\.|etudes|formation|scolarite|degree|diploma|education|"724 r"detenir|detention|obtenu|completed?\b|graduate", re.I)725_EDU_LEVELS = [ # (niveau canonique, motif, sigle nécessitant le contexte ?)726 ("secondaire", r"diplome d etudes secondaires|\bdes\b|secondaire (?:5|v)\b|"727 r"high school diploma|secondary school diploma", True),728 ("DEP", r"diplome d etudes professionnelles|\bdep\b|"729 r"vocational diploma", True),730 ("AEC", r"attestation d etudes collegiales|\baec\b", True),731 ("DEC", r"diplome d etudes collegiales|\bdec\b|techniques? collegiales?|"732 r"college diploma|cegep", True),733 ("certificat", r"certificat universitaire|university certificate", False),734 ("baccalauréat", r"baccalaureat|bachelor|\bbacc\b|bac universitaire|"735 r"\bbac\b (?:en|in)\b|undergraduate degree|"736 r"b\.?\s?(?:sc|ing|a\.?a|com)\b", False),737 ("maîtrise", r"maitrise|master s degree|masters degree|\bmba\b|"738 r"m\.?\s?sc\.?\b|graduate degree", False),739 ("doctorat", r"doctorat|\bphd\b|ph\.?\s?d\b|doctoral", False),740]741742# Langues exigées : mention explicite d'exigence (pas la langue du TEXTE —743# ça, c'est detect_language). « bilingue », « anglais requis », « fluent in744# English », « maîtrise du français »…745_LANG_BILINGUAL = re.compile(r"bilingu", re.I)746_LANG_REQ_FR = re.compile(747 r"francais[^.\n]{0,30}?(?:requis|exige|obligatoire|essentiel|"748 r"fonctionnel|avance|courant|parle et ecrit|oral et ecrit)|"749 r"(?:maitrise|connaissance|excellente maitrise) (?:de la langue |du )?"750 r"francais|french (?:is )?(?:required|mandatory|essential)|"751 r"fluent in french|fluency in french|french proficiency", re.I)752_LANG_REQ_EN = re.compile(753 r"anglais[^.\n]{0,30}?(?:requis|exige|obligatoire|essentiel|"754 r"fonctionnel|avance|courant|parle et ecrit|oral et ecrit)|"755 r"(?:maitrise|connaissance|excellente maitrise) (?:de la langue |de l )?"756 r"anglais|english (?:is )?(?:required|mandatory|essential)|"757 r"fluent in english|fluency in english|english proficiency", re.I)758759760def extract_requirements(title: str, description: str) -> dict:761 """Exigences structurées depuis le texte de l'offre — clés présentes762 seulement quand l'information est explicite (jamais de valeur inventée) :763764 - ``experience_years`` : années d'expérience minimales exigées (int)765 - ``education`` : plus bas diplôme exigé (secondaire, DEP, AEC,766 DEC, certificat, baccalauréat, maîtrise, doctorat)767 - ``languages`` : langues exigées (["français"], ["anglais"], …)768 """769 out: dict = {}770 text = _key(f"{title or ''}\n{description or ''}"[:8000])771 text = re.sub(r"[’']", " ", text) # « d'expérience » -> « d experience »772 if len(text) < 20:773 return out774775 years: list[int] = []776 for pat in _EXP_PATTERNS:777 for m in pat.finditer(text):778 try:779 n = int(m.group(1))780 except (TypeError, ValueError):781 continue782 if 1 <= n <= 30: # bornes de plausibilité783 years.append(n)784 if years:785 out["experience_years"] = min(years) # l'exigence MINIMALE786787 for level, pat, needs_ctx in _EDU_LEVELS:788 for m in re.finditer(pat, text):789 if needs_ctx:790 window = text[max(0, m.start() - 120):m.end() + 120]791 if not _EDU_SCHOOL_CONTEXT.search(window):792 continue793 out["education"] = level794 break795 if "education" in out:796 break # plus bas niveau exigé trouvé797798 langs: list[str] = []799 if _LANG_BILINGUAL.search(text):800 langs = ["français", "anglais"]801 else:802 if _LANG_REQ_FR.search(text):803 langs.append("français")804 if _LANG_REQ_EN.search(text):805 langs.append("anglais")806 if langs:807 out["languages"] = langs808 return out809810811# ---------------------------------------------------------------------------812# Séniorité — stage | junior | intermediaire | senior | direction813# ---------------------------------------------------------------------------814815_SENIORITY_TITLE = [816 ("stage", r"\bstagiaire\b|\bstage\b|\bintern(?:ship)?\b|\bco-?op\b|"817 r"alternance|etudiant"),818 ("direction", r"directeur|directrice|\bdirector\b|vice[- ]?president|"819 r"\bvp\b|\bpdg\b|\bceo\b|\bcfo\b|\bcto\b|\bcoo\b|"820 r"chef de (?:service|departement|division|la direction)|"821 r"head of|\bdg\b|gestionnaire de (?:service|departement)"),822 ("senior", r"\bsenior\b|\bsr\.?\b|\bprincipal(?:e)?\b|\blead\b|"823 r"\bexpert(?:e)?\b|chef d equipe|team lead|superviseur|"824 r"\bniveau (?:3|iii)\b|\biii\b"),825 ("junior", r"\bjunior\b|\bjr\.?\b|debutant|entry[- ]level|"826 r"\bniveau (?:1|i)\b|premier emploi|releve"),827 ("intermediaire", r"intermediaire|intermediate|\bniveau (?:2|ii)\b|\bii\b"),828]829830# libellés d'expérience des ATS (SmartRecruiters/LinkedIn-style) -> séniorité831_SENIORITY_ATS = [832 ("stage", r"internship|stage"),833 ("direction", r"director|executive|direction"),834 ("senior", r"mid[- ]?senior|senior"),835 ("intermediaire", r"associate|intermediaire|intermediate|mid[- ]?level"),836 ("junior", r"entry|junior|debutant"),837]838839840def parse_seniority(title: str, requirements: dict | None = None,841 employment_type: str | None = None) -> str | None:842 """Niveau de séniorité du poste, ou None si aucun signal explicite.843844 Ordre des signaux : type d'emploi « stage », titre du poste, libellé845 d'expérience fourni par l'ATS, puis années d'expérience exigées.846 """847 if employment_type == "stage":848 return "stage"849 key = _key(title or "")850 if key:851 for level, pat in _SENIORITY_TITLE:852 if re.search(pat, key):853 return level854 req = requirements or {}855 label = _key(str(req.get("experience", "")))856 if label and "not applicable" not in label:857 for level, pat in _SENIORITY_ATS:858 if re.search(pat, label):859 return level860 years = req.get("experience_years")861 if isinstance(years, (int, float)):862 if years <= 2:863 return "junior"864 if years <= 4:865 return "intermediaire"866 return "senior"867 return None868869870# ---------------------------------------------------------------------------871# Titre d'affichage — casse propre, codes de réquisition et suffixes retirés872# ---------------------------------------------------------------------------873874# codes de réquisition : « [R-12345] », « (REQ 2026-42) », « - JR0035678 »…875_REQ_CODE = re.compile(876 # en tête : « 123456 - Titre », « [REQ-1234] Titre » (≥5 chiffres nus pour877 # ne pas manger une année « 2026 - Programme d'été »)878 r"^\s*[\[(]?(?:req(?:uisition)?|jr|job)[\s#:-]*\d{3,10}[\])]?\s*[-–—:|]\s*|"879 r"^\s*[\[(]?\d{5,10}[\])]?\s*[-–—:|]\s*|"880 # en queue : « Titre - R-12345 », « Titre (JOB 004521) »881 r"\s*[-–—|(]\s*(?:req(?:uisition)?|job|poste)?\s*#?\s*(?:[A-Z]{1,4}-?)?\d{4,10}\s*[)\]]?\s*$|"882 # au milieu : « Titre [R-12345] suite »883 r"\s*[\[(](?:R|REQ|JR|JOB)[-_ ]?\d{3,10}[\])]\s*", re.I)884885# petits mots gardés en minuscules lors de la remise en casse d'un titre886# tout-majuscules ; sigles usuels gardés en majuscules887_TITLE_SMALL = {"de", "du", "des", "la", "le", "les", "et", "en", "à", "a",888 "au", "aux", "d'", "l'", "of", "the", "and", "in", "for",889 "to", "or", "ou", "un", "une", "sur", "pour"}890_TITLE_ACRONYMS = {"rh", "ti", "it", "qa", "qc", "pab", "cpa", "cfa", "erp",891 "sap", "crm", "sst", "cnc", "hvac", "rpa", "bi", "ia",892 "ai", "vp", "pdg", "dg"}893894895def _smart_case(title: str) -> str:896 """Titre TOUT EN MAJUSCULES -> casse de phrase lisible (sigles préservés)."""897 words = title.lower().split()898 out = []899 for i, w in enumerate(words):900 base = w.strip("()[],.;:/")901 if base in _TITLE_ACRONYMS:902 out.append(w.replace(base, base.upper()))903 elif i > 0 and base in _TITLE_SMALL:904 out.append(w)905 else:906 out.append(w[:1].upper() + w[1:])907 return " ".join(out)908909910def clean_title(title: str, city: str = "") -> str:911 """Titre d'affichage : codes de réquisition retirés, suffixe « - <ville> »912 redondant retiré, casse corrigée si tout-majuscules. Le titre SOURCE n'est913 jamais modifié — ceci alimente une colonne d'affichage distincte."""914 t = clean_text(title)915 if not t:916 return ""917 prev = None918 while prev != t: # les codes peuvent être empilés919 prev = t920 t = _REQ_CODE.sub(" ", t).strip(" -–—|:")921 t = clean_text(t)922 # suffixe « - Montréal » / « (Montréal, QC) » identique à la ville de923 # l'offre : repéré sans accents, coupé sur le titre original924 if city:925 ck = re.escape(strip_accents(city.lower()))926 m = re.search(927 rf"\s*[-–—|,(]\s*(?:ville de\s+)?{ck}(?:\s*,\s*(?:qc|quebec))?\s*\)?\s*$",928 strip_accents(t.lower()))929 if m and m.start() > 0:930 t = clean_text(t[:m.start()]).strip(" -–—|,(")931 if len(t) > 8 and t == t.upper() and t != t.lower():932 t = _smart_case(t)933 return t or clean_text(title)934935936def categorize(title: str, description: str = "") -> str:937 """Titre -> catégorie interne (repli : début de description), ou "".938939 Le titre est essayé SEUL d'abord : la description commence souvent par le940 boilerplate de l'entreprise (« leader du manufacturier… ») qui fausserait941 la catégorie du poste.942 """943 for texte in (title, description[:300]):944 key = _key(texte or "")945 if not key.strip():946 continue947 for cat, pat in _CATEGORY_RULES:948 if re.search(pat, key):949 return cat950 return ""951