SPB Git forge

spb/job-ka

Public
229commits 1branches 0releases
38.1 MBsize
maindefault branch
2 h agolast push
HTML 82.1% Python 14.6% TypeScript 1.9% CSS 1% JavaScript 0.5%
40.7 KB · 951 lines python
Raw Blame History
1# =============================================================================2# Job·Ka — Groupe KA3# Auteur  : Simon-Pierre Boucher4# Contact : contact@spboucher.ai5# Fichier : jobka/normalize.py6# Rôle    : Normalisation commune des offres (salaires, dates, mode/type7#           d'emploi, lieu, catégorie, exigences, séniorité) — jamais de8#           valeur inventée9# Créé    : 2026-08-17   Modifié : 2026-09-1810# =============================================================================11"""Couche de normalisation commune appelée par JobPosting.finalize().1213Philosophie héritée de Lou·Ka : parseurs déterministes (regex, tables de14mots-clés FR/EN), bornes de plausibilité, et surtout — une valeur absente15reste absente (None / chaîne vide), on ne devine jamais.16"""17from __future__ import annotations1819import datetime as _dt20import re21import unicodedata2223__all__ = [24    "strip_accents", "clean_text", "clean_html", "parse_salary",25    "sanitize_salary", "salary_from_text", "salary_to_yearly",26    "salary_to_hourly", "parse_date", "parse_work_mode",27    "parse_employment_type", "parse_location", "canonical_city",28    "is_quebec_location", "categorize", "detect_language",29    "extract_benefits", "clean_title", "extract_requirements",30    "parse_seniority",31]323334# ---------------------------------------------------------------------------35# Texte36# ---------------------------------------------------------------------------3738def strip_accents(s: str) -> str:39    return "".join(c for c in unicodedata.normalize("NFD", s)40                   if unicodedata.category(c) != "Mn")414243def _key(s: str) -> str:44    """Minuscules sans accents — pour le matching de mots-clés."""45    return strip_accents((s or "").lower())464748def clean_text(s: str) -> str:49    """Espaces insécables -> espace, blancs réduits."""50    s = (s or "").replace("\xa0", " ").replace(" ", " ").replace(" ", " ")51    return re.sub(r"[ \t]+", " ", s).strip()525354_BLOCK_TAGS = re.compile(55    r"</?(?:p|div|br|li|ul|ol|h[1-6]|tr|table|section|article)[^>]*>", re.I)5657# Résidu HTML après une passe : balise ouvrante plausible ou entité encore58# encodée — signe d'un contenu doublement échappé.59_HTML_LEFTOVER = re.compile(60    r"<(?:p|br|li|ul|ol|div|span|strong|em|b|i|h[1-6]|a)\b|&(?:amp|lt|gt|nbsp|#\d+);",61    re.I)626364def clean_html(html: str) -> str:65    """HTML -> texte lisible : balises de bloc = sauts de ligne, le reste retiré.6667    Suffisant pour les descriptions d'offres (les connecteurs qui ont besoin68    d'un vrai parseur utilisent BeautifulSoup eux-mêmes).69    """70    if not html:71        return ""72    import html as _html73    s = html74    # Contenus sur-échappés (entités dans les entités — Greenhouse/Lever) :75    # nettoyer en boucle tant qu'il reste des balises/entités (max 3 passes).76    for _ in range(3):77        s = _html.unescape(s)78        s = re.sub(r"<(script|style)[^>]*>.*?</\1>", " ", s, flags=re.I | re.S)79        s = _BLOCK_TAGS.sub("\n", s)80        s = re.sub(r"<[^>]+>", " ", s)81        if not _HTML_LEFTOVER.search(s):82            break83    s = s.replace("\xa0", " ").replace(" ", " ")84    s = re.sub(r"[ \t]+", " ", s)85    s = re.sub(r" ?\n ?", "\n", s)86    return re.sub(r"\n{3,}", "\n\n", s).strip()878889# ---------------------------------------------------------------------------90# Salaires — transparence salariale = différenciateur clé de Job·Ka91# ---------------------------------------------------------------------------9293# Bornes de plausibilité par unité (CAD). Hors bornes = on jette (pas de94# salaire inventé, pas de « 1 $/h » venu d'un parsing raté).95_SALARY_BOUNDS = {96    "hour": (14.0, 250.0),97    "day": (100.0, 2000.0),98    "week": (500.0, 10000.0),99    "biweek": (1000.0, 20000.0),100    "month": (1800.0, 45000.0),101    "year": (20000.0, 600000.0),102}103104# Heures/an de référence pour les conversions (semaine de 40 h).105_HOURS_PER_YEAR = 2080.0106107_UNIT_PATTERNS = [108    ("hour", r"(?:/|par|per|an?)\s*(?:h\b|hr\b|hre\b|heure|hour)|horaire|hourly"),109    ("year", r"(?:/|par|per|an?)\s*(?:an\b|année|annee|year|yr\b)|annuel|annual|yearly|per\s+annum"),110    ("month", r"(?:/|par|per)\s*(?:mois|month)|mensuel|monthly"),111    ("biweek", r"(?:aux|par|per)\s*(?:2|deux|two)\s*semaines|bi-?weekly|quinzaine"),112    ("week", r"(?:/|par|per)\s*(?:sem\b|semaine|week|wk\b)|hebdomadaire|weekly"),113    ("day", r"(?:/|par|per)\s*(?:jour|day)|journalier|daily"),114]115116_NUM_RE = re.compile(r"\d{1,3}(?:[   ,]\d{3})+(?:[.,]\d{1,2})?|\d+(?:[.,]\d{1,2})?[kK]?")117118119def _parse_number(tok: str) -> float | None:120    tok = tok.strip()121    k = tok.lower().endswith("k")122    if k:123        tok = tok[:-1]124    # « 52,000 » (milliers anglais) vs « 52000,00 » / « 25,50 » (décimales)125    tok = tok.replace(" ", " ").replace(" ", " ")126    if re.fullmatch(r"\d{1,3}(?:[ ,]\d{3})+(?:[.,]\d{1,2})?", tok):127        # séparateur de milliers : retirer espaces/virgules de groupe128        tok = re.sub(r"[ ,](?=\d{3}\b)", "", tok)129    tok = tok.replace(",", ".").replace(" ", "")130    try:131        v = float(tok)132    except ValueError:133        return None134    return v * 1000 if k else v135136137def parse_salary(raw: str) -> tuple[float | None, float | None, str | None]:138    """Texte de salaire -> (min, max, unité) ou (None, None, None).139140    Exige un signe monétaire ($, CAD, dollars) OU une unité explicite proche141    des nombres — sans quoi « 35 heures/semaine » deviendrait un salaire.142    """143    s = clean_text(raw)144    if not s:145        return (None, None, None)146    key = _key(s)147148    unit = None149    for u, pat in _UNIT_PATTERNS:150        if re.search(pat, key):151            unit = u152            break153154    has_money = bool(re.search(r"\$|cad\b|dollar", key))155    if not has_money and unit is None:156        return (None, None, None)157158    nums = [_parse_number(m.group(0)) for m in _NUM_RE.finditer(s)]159    nums = [n for n in nums if n is not None]160    if not nums:161        return (None, None, None)162163    # Sans unité explicite : inférer par l'ordre de grandeur (avec $ obligatoire)164    if unit is None:165        probe = max(nums)166        if probe < 300:167            unit = "hour"168        elif probe >= 18000:169            unit = "year"170        else:171            return (None, None, None)   # zone ambiguë : ne pas deviner172173    lo, hi = _SALARY_BOUNDS[unit]174    vals = sorted(n for n in nums if lo <= n <= hi)175    if not vals:176        return (None, None, None)177    return (vals[0], vals[-1] if len(vals) > 1 else vals[0], unit)178179180_TO_YEAR = {"hour": _HOURS_PER_YEAR, "day": 260.0, "week": 52.0,181            "biweek": 26.0, "month": 12.0, "year": 1.0}182183184def salary_to_yearly(value: float | None, unit: str | None) -> float | None:185    if value is None or unit not in _TO_YEAR:186        return None187    return round(value * _TO_YEAR[unit], 0)188189190def salary_to_hourly(value: float | None, unit: str | None) -> float | None:191    y = salary_to_yearly(value, unit)192    return round(y / _HOURS_PER_YEAR, 2) if y is not None else None193194195def sanitize_salary(lo: float | None, hi: float | None, unit: str | None196                    ) -> tuple[float | None, float | None, str | None]:197    """Bornes de plausibilité sur les salaires STRUCTURÉS fournis par les ATS.198199    Certaines sources étiquettent mal l'unité (75 000 « /mois » ou « /h » pour200    un salaire annuel — vu chez Lever et dans les JSON-LD de portails) : si la201    valeur sort des bornes de son unité, on tente une réinterprétation vers202    l'unité dont les bornes la contiennent (année d'abord, puis heure). Aucune203    unité plausible -> on jette (pas de salaire aberrant publié).204    """205    if lo is None or unit not in _SALARY_BOUNDS:206        return (lo, hi, unit)207    b = _SALARY_BOUNDS[unit]208    if not (b[0] <= lo <= b[1]):209        for candidate in ("year", "hour"):210            cb = _SALARY_BOUNDS[candidate]211            if candidate != unit and cb[0] <= lo <= cb[1]:212                unit, b = candidate, cb213                break214        else:215            return (None, None, None)216    if hi is not None and not (b[0] <= hi <= b[1]):217        hi = None            # max aberrant : on garde le min plausible seul218    if hi is not None and hi < lo:219        lo, hi = hi, lo220    return (lo, hi, unit)221222223# Contextes où un montant en $ n'est PAS un salaire (financement, dépenses,224# allocations…) — garde-fou de l'extraction depuis la description.225_NOT_SALARY_CONTEXT = re.compile(226    r"financement|funding|amorcage|seed|investisse|invest(?:ment|or)|"227    r"revenu[s]?\b|revenue|chiffre d affaires|budget|remboursement|"228    r"reimburse|expense|allocation|allowance|subvention|credit d impot|"229    r"cotisation|rabais|discount|gift|carte[- ]cadeau|referral (?:bonus|fee)|"230    r"signing bonus|prime (?:a l embauche|de demarrage|de reference)|"231    r"million|milliard")232233234def salary_from_text(text: str) -> tuple[float | None, float | None,235                                         str | None, str]:236    """Cherche une mention salariale dans un texte libre (description).237238    Découpe en phrases (les points décimaux « 182,500.00 » ne coupent pas),239    ignore les contextes non salariaux (financement, remboursements…), puis240    parse la première phrase plausible. Retourne (min, max, unité, libellé).241    """242    if not text or "$" not in text:243        return (None, None, None, "")244    for sentence in re.split(r"(?<!\d)\.(?!\d)|\n|;", text):245        if "$" not in sentence or not re.search(r"\d", sentence):246            continue247        frag = clean_text(sentence)[:160]248        if _NOT_SALARY_CONTEXT.search(_key(frag)):249            continue250        lo, hi, unit = parse_salary(frag)251        if lo is not None:252            return (lo, hi, unit, frag)253    return (None, None, None, "")254255256# ---------------------------------------------------------------------------257# Dates — ISO 8601, jamais de date inventée258# ---------------------------------------------------------------------------259260_MONTHS = {261    "janvier": 1, "jan": 1, "january": 1,262    "fevrier": 2, "fev": 2, "february": 2, "feb": 2,263    "mars": 3, "mar": 3, "march": 3,264    "avril": 4, "avr": 4, "april": 4, "apr": 4,265    "mai": 5, "may": 5,266    "juin": 6, "june": 6, "jun": 6,267    "juillet": 7, "juil": 7, "july": 7, "jul": 7,268    "aout": 8, "august": 8, "aug": 8,269    "septembre": 9, "sept": 9, "sep": 9, "september": 9,270    "octobre": 10, "oct": 10, "october": 10,271    "novembre": 11, "nov": 11, "november": 11,272    "decembre": 12, "dec": 12, "december": 12,273}274275_REL_RE = re.compile(276    r"(?:il y a|posted)\s+(\d+)\+?\s*(jour|day|semaine|week|mois|month)|"277    r"(\d+)\+?\s*(jour|day|semaine|week|mois|month)s?\s+ago", re.I)278_TODAY_RE = re.compile(r"aujourd'?hui|today|posted today|date du jour", re.I)279_YESTERDAY_RE = re.compile(r"hier|yesterday", re.I)280281282def parse_date(raw, today: _dt.date | None = None) -> str | None:283    """Valeur de date hétéroclite -> ISO « YYYY-MM-DD », ou None.284285    Accepte : ISO (+ horodatages), epoch secondes/millisecondes, formats286    textuels FR/EN (« 1er juillet 2026 », « July 1st, 2026 »), et les dates287    relatives (« il y a 3 jours », « Posted 30+ Days Ago »).288    """289    if raw is None:290        return None291    today = today or _dt.date.today()292293    if isinstance(raw, (int, float)):        # epoch (Lever : millisecondes)294        ts = float(raw)295        if ts > 1e12:296            ts /= 1000.0297        if 1e9 <= ts <= 4e9:298            return _dt.date.fromtimestamp(ts).isoformat()299        return None300301    s = clean_text(str(raw))302    if not s:303        return None304    key = _key(s)305306    m = re.search(r"(\d{4})-(\d{2})-(\d{2})", s)     # ISO (avec ou sans heure)307    if m:308        try:309            return _dt.date(int(m.group(1)), int(m.group(2)), int(m.group(3))).isoformat()310        except ValueError:311            return None312313    if _TODAY_RE.search(key):314        return today.isoformat()315    if _YESTERDAY_RE.search(key):316        return (today - _dt.timedelta(days=1)).isoformat()317318    m = _REL_RE.search(key)319    if m:320        n = int(m.group(1) or m.group(3))321        unit = (m.group(2) or m.group(4) or "").lower()322        days = n * (7 if unit.startswith(("sem", "week"))323                    else 30 if unit.startswith(("moi", "month")) else 1)324        return (today - _dt.timedelta(days=days)).isoformat()325326    # « 1er juillet 2026 » / « July 1st, 2026 » / « déc. 2026 »327    m = re.search(r"(?:(\d{1,2})(?:er|e|st|nd|rd|th)?\s+)?([a-z]{3,9})\.?,?\s+(?:(\d{1,2})(?:er|st|nd|rd|th)?,?\s+)?(\d{4})", key)328    if m:329        mois = _MONTHS.get(m.group(2))330        if mois:331            jour = int(m.group(1) or m.group(3) or 1)332            try:333                return _dt.date(int(m.group(4)), mois, jour).isoformat()334            except ValueError:335                return None336337    m = re.fullmatch(r"(\d{1,2})/(\d{1,2})/(\d{4})", s)   # jj/mm/aaaa (usage QC)338    if m:339        d, mo, y = int(m.group(1)), int(m.group(2)), int(m.group(3))340        if mo > 12 and d <= 12:      # en fait mm/jj/aaaa341            d, mo = mo, d342        try:343            return _dt.date(y, mo, d).isoformat()344        except ValueError:345            return None346    return None347348349# ---------------------------------------------------------------------------350# Mode de travail / type d'emploi351# ---------------------------------------------------------------------------352353_MODE_RULES = [354    ("teletravail", r"100\s*%\s*(?:teletravail|remote)|full(?:y)?[ -]remote|"355                    r"teletravail|travail a distance|remote(?:\b|-first)|a distance"),356    ("hybride", r"hybrid|hybride|flexible?\s*(?:work|travail)"),357    ("presentiel", r"presentiel|sur (?:place|site)|on[- ]?site|in[- ]?(?:office|person)"),358]359360361def parse_work_mode(raw: str) -> str | None:362    key = _key(raw)363    if not key:364        return None365    # « hybride » prime sur les mentions accessoires de télétravail366    if re.search(_MODE_RULES[1][1], key):367        return "hybride"368    for mode, pat in _MODE_RULES:369        if re.search(pat, key):370            return mode371    return None372373374_TYPE_RULES = [375    ("stage", r"\bstage\b|stagiaire|intern(?:ship)?\b|co-?op\b|alternance"),376    ("saisonnier", r"saisonn|seasonal"),377    ("contractuel", r"contrat\b|contract(?:uel|or)?\b|temporaire|temporary|terme|"378                    r"fixed[- ]term|duree determinee|pigiste|freelance|consultant"),379    ("temps_partiel", r"temps[- ]partiel|part[- ]?time|partiel\b"),380    ("temps_plein", r"temps[- ]plein|full[- ]?time|permanent|regulier|"381                    r"regular\b|duree indeterminee"),382]383384385def parse_employment_type(raw: str) -> str | None:386    key = _key(raw)387    if not key:388        return None389    for typ, pat in _TYPE_RULES:390        if re.search(pat, key):391            return typ392    return None393394395# ---------------------------------------------------------------------------396# Lieu — extraction ville/région + garde-fou « offre au Québec »397# ---------------------------------------------------------------------------398399# Villes québécoises fréquentes dans les libellés d'offres (clé sans accents).400# Sert à la fois au parsing et au filtre is_quebec_location.401_QC_CITIES = {402    "montreal": "Montréal", "quebec": "Québec", "ville de quebec": "Québec",403    "quebec city": "Québec", "laval": "Laval", "gatineau": "Gatineau",404    "longueuil": "Longueuil", "sherbrooke": "Sherbrooke",405    "saguenay": "Saguenay", "chicoutimi": "Saguenay",406    "levis": "Lévis", "trois-rivieres": "Trois-Rivières",407    "trois rivieres": "Trois-Rivières", "terrebonne": "Terrebonne",408    "brossard": "Brossard", "repentigny": "Repentigny",409    "boucherville": "Boucherville", "saint-jerome": "Saint-Jérôme",410    "drummondville": "Drummondville", "saint-jean-sur-richelieu":411    "Saint-Jean-sur-Richelieu", "granby": "Granby", "shawinigan": "Shawinigan",412    "joliette": "Joliette", "victoriaville": "Victoriaville",413    "rimouski": "Rimouski", "rouyn-noranda": "Rouyn-Noranda",414    "baie-comeau": "Baie-Comeau", "sept-iles": "Sept-Îles",415    "fermont": "Fermont",416    "val-d'or": "Val-d'Or", "val d'or": "Val-d'Or", "alma": "Alma",417    "sainte-foy": "Québec", "anjou": "Montréal", "dorval": "Dorval",418    "boisbriand": "Boisbriand", "blainville": "Blainville",419    "mirabel": "Mirabel", "saint-hyacinthe": "Saint-Hyacinthe",420    "beloeil": "Belœil", "chateauguay": "Châteauguay", "magog": "Magog",421    "thetford mines": "Thetford Mines", "saint-georges": "Saint-Georges",422    "riviere-du-loup": "Rivière-du-Loup", "matane": "Matane",423    "sorel-tracy": "Sorel-Tracy", "varennes": "Varennes",424    "vaudreuil-dorion": "Vaudreuil-Dorion", "salaberry-de-valleyfield":425    "Salaberry-de-Valleyfield", "kirkland": "Kirkland",426    "pointe-claire": "Pointe-Claire", "saint-laurent": "Montréal",427    "ville saint-laurent": "Montréal", "verdun": "Montréal",428    "westmount": "Westmount", "candiac": "Candiac", "la prairie": "La Prairie",429    "mont-tremblant": "Mont-Tremblant", "saint-bruno": "Saint-Bruno-de-Montarville",430    "bromont": "Bromont", "cowansville": "Cowansville",431    "rougemont": "Rougemont",432    "saint-augustin-de-desmaures": "Saint-Augustin-de-Desmaures",433    "l'ancienne-lorette": "L'Ancienne-Lorette",434}435436_QC_MARKERS = re.compile(437    r"\bqc\b|\bquebec\b|\bqu[e]bec, canada\b|province de quebec", re.I)438_POSTAL_RE = re.compile(r"\b([GHJ]\d[A-Z])\s*(\d[A-Z]\d)\b", re.I)  # G/H/J = Québec439440# « Quebec » suivi d'un type de voie anglophone = nom de RUE, pas la province441# (« 3401 Quebec St. Suite 8000, Denver, CO » — bug solmentalhealth 2026-09-14 :442# offre de Denver publiée comme Québec/Capitale-Nationale). Neutralisé avant443# tout matching de marqueur/ville. Le (?!-) protège les abréviations de saints444# des libellés québécois légitimes (« CAN Quebec St-Hubert », « Ste-Thérèse »).445_QUEBEC_STREET_RE = re.compile(446    r"\bquebec\s+(?:st|street|ave|avenue|blvd|boulevard|rd|road|dr|drive|"447    r"ct|court|ln|lane|way|pl|place|hwy|highway|pkwy|parkway)\b\.?(?!-)")448449# Villes canadiennes hors Québec (et grandes villes étrangères) fréquentes450# dans les flux pancanadiens/mondiaux — jamais des villes d'offres451# québécoises : à rejeter lors du parsing de lieu (clés sans accents).452_NON_QC_CITIES = frozenset({453    "toronto", "ottawa", "vancouver", "calgary", "edmonton", "winnipeg",454    "mississauga", "brampton", "hamilton", "kitchener", "waterloo", "halifax",455    "dartmouth", "victoria", "saskatoon", "regina", "st. john's", "st johns",456    "saint john", "fredericton", "moncton", "charlottetown", "london",457    "markham", "vaughan", "richmond hill", "oakville", "burlington", "oshawa",458    "whitby", "ajax", "pickering", "guelph", "kingston", "barrie",459    "kelowna", "kamloops", "nanaimo", "abbotsford", "surrey", "burnaby",460    "coquitlam", "langley", "north york", "scarborough", "etobicoke",461    "north vancouver", "milton", "cambridge", "st. catharines",462    "niagara falls", "thunder bay", "sudbury", "greater sudbury",463    "sault ste. marie", "red deer", "lethbridge", "medicine hat",464    "grande prairie", "fort mcmurray", "yellowknife", "whitehorse", "iqaluit",465    "can", "canada", "ontario", "alberta", "british columbia", "manitoba",466    "saskatchewan", "nova scotia", "new brunswick",467    "new york", "new york city", "san francisco", "boston", "chicago",468    "seattle", "austin", "denver", "los angeles", "miami", "atlanta",469    "dallas", "houston", "philadelphia", "washington", "phoenix", "portland",470    "paris", "londres", "amsterdam", "berlin", "munich", "dublin", "madrid",471    "barcelona", "barcelone", "lisbon", "lisbonne", "sydney", "melbourne",472    "singapore", "singapour", "tokyo", "bangalore", "bengaluru", "mumbai",473    "mexico city", "sao paulo", "bogota", "buenos aires", "las vegas",474    "orlando", "nashville", "macau",475})476477478def canonical_city(raw: str) -> str:479    """Canonicalise un nom de ville (« Montreal » -> « Montréal »,480    « Quebec City » -> « Québec »). Inconnu : retourne le texte nettoyé."""481    s = clean_text(raw)482    if not s:483        return ""484    key = _key(s)485    exact = _QC_CITIES.get(key)486    if exact:487        return exact488    for ck, city in _QC_CITIES.items():489        if re.fullmatch(re.escape(ck), key):490            return city491    return s492493494def parse_location(raw: str) -> dict:495    """Libellé de lieu -> {city, region, postal_code} (champs possiblement vides).496497    Ex. « Montréal, QC, Canada », « Ville de Québec, Québec », « Remote - QC ».498    """499    s = clean_text(raw)500    out = {"city": "", "region": "", "postal_code": ""}501    if not s:502        return out503    m = _POSTAL_RE.search(s)504    if m:505        out["postal_code"] = f"{m.group(1).upper()} {m.group(2).upper()}"506    key = _QUEBEC_STREET_RE.sub(" ", _key(s))507    for ck, city in _QC_CITIES.items():508        if re.search(rf"(?<![a-z]){re.escape(ck)}(?![a-z])", key):509            out["city"] = city510            break511    if _QC_MARKERS.search(key) or out["city"] or (512            out["postal_code"] and out["postal_code"][0] in "GHJ"):513        out["region"] = "Québec"514    if not out["city"]:515        # premier segment avant la virgule, si ça ressemble à un nom de ville :516        # contient des lettres, ≤ 3 mots, pas un mot générique ni un nom de517        # succursale (« Caisse Desjardins de… », « Centre de services… »)518        seg = clean_text(s.split(",")[0])519        seg_key = _key(seg)520        if (seg and len(seg) <= 40 and re.search(r"[a-z]", seg_key)521                and len(seg.split()) <= 3522                and seg_key not in _NON_QC_CITIES523                and not re.search(524                    r"remote|teletravail|canada|multiple|various|partout|"525                    r"\d+\s+locations?|\d+\s+lieux|caisse|succursale|"526                    r"centre de services|siege social", seg_key)):527            out["city"] = seg528    return out529530531# Code de province canadienne ou d'État américain explicitement HORS Québec532# (« Kirkland, WA », « London, ON ») : jamais une offre québécoise, même si la533# ville est homonyme d'une ville du Québec (Kirkland WA ≠ Kirkland QC — bug534# derumarketcatering 2026-08-26 : restaurant de l'État de Washington affiché535# comme Montréal). Codes ambigus avec le français exclus volontairement :536# CA (Canada/Californie), OR (Val-d'Or), LA (La Prairie), DE, IN, ME, MT.537_NON_QC_REGION_RE = re.compile(538    r"[,\s](on|bc|ab|sk|mb|ns|nb|pe|pei|nl|yt|nt|nu|"539    r"wa|ny|tx|fl|il|ma|md|mi|mn|mo|ms|nc|nd|ne|nh|nj|nm|nv|oh|ok|"540    r"pa|ri|sc|sd|tn|ut|va|vt|wi|wv|wy|ak|al|ar|az|co|ct|dc|ga|hi|"541    r"ia|id|ks|ky)\.?(?=$|[,\s])")542543544def is_quebec_location(raw: str) -> bool:545    """Vrai si le libellé pointe vers le Québec (filtre des ATS pancanadiens)."""546    key = _QUEBEC_STREET_RE.sub(" ", _key(clean_text(raw)))547    if not key:548        return False549    if key in _NON_QC_CITIES:      # libellé = ville canadienne/monde hors QC550        return False551    if _QC_MARKERS.search(key):552        return True553    m = _POSTAL_RE.search(raw)554    if m and m.group(1)[0].upper() in "GHJ":555        return True556    if _NON_QC_REGION_RE.search(key):   # « Kirkland, WA » : homonyme hors QC557        return False558    return any(re.search(rf"(?<![a-z]){re.escape(ck)}(?![a-z])", key)559               for ck in _QC_CITIES)560561562# ---------------------------------------------------------------------------563# Catégorisation — taxonomie interne déterministe (mots-clés FR/EN)564# ---------------------------------------------------------------------------565566_CATEGORY_RULES = [567    ("TI", r"developpe|developer|logiciel|software|devops|donnees|data\b|"568           r"informatique|programmeur|programmer|cybersecurit|cloud|fullstack|"569           r"full[- ]stack|backend|frontend|sre\b|qa\b|scrum|infrastructure ti|"570           r"intelligence artificielle|machine learning|\bia\b|\bai\b|analyste ti"),571    ("Santé", r"infirmier|infirmiere|nurse|medecin|pharmac|dentaire|sante\b|"572              r"prepose aux beneficiaires|\bpab\b|physiotherap|ergotherap|"573              r"psycholog|travailleur social|clinique|medical"),574    ("Ingénierie", r"ingenieur|engineer(?!ing manager, software)|genie\b|"575                   r"mecanique du batiment|electrique|civil\b|structurel"),576    ("Construction", r"construction|charpentier|menuisier|plombier|electricien|"577                     r"contremaitre|chantier|grutier|briqueteur|couvreur|paysagiste"),578    ("Finance", r"comptab|account(?:ant|ing)|finance|financier|paie\b|payroll|audit|"579                r"fiscalite|tresorerie|actuaire|actuarial|credit\b|placement"),580    ("Éducation", r"enseignant|professeur|teacher|educat|tuteur|formateur|"581                  r"pedagog|garderie|cpe\b"),582    ("Juridique", r"avocat|juriste|notaire|parajuriste|paralegal|legal counsel|"583                  r"conformite|compliance"),584    ("RH", r"ressources humaines|\brh\b|recrut|talent|human resources|\bhr\b|"585           r"acquisition de talents"),586    ("Marketing", r"marketing|communication|contenu|content|marque|brand|"587                  r"medias sociaux|social media|seo\b|publicite|graphiste|designer"),588    ("Ventes", r"vente|ventes|sales|representant|account (?:executive|manager)|"589               r"developpement des affaires|business development|conseiller commercial"),590    ("Service à la clientèle", r"service a la clientele|customer (?:service|success|"591                               r"support)|centre d'appels|call cent"),592    ("Transport", r"chauffeur|camionneur|driver|livreur|logistique|logistics|"593                  r"transport|entrepot|warehouse|cariste|repartiteur"),594    ("Production", r"production|manufactur|usine|operateur|machiniste|soudeur|"595                   r"welder|assembleur|journalier|emballage|maintenance industrielle"),596    ("Restauration", r"cuisinier|chef\b|serveur|barista|restauration|plongeur|"597                     r"boulanger|patissier|traiteur|banquet"),598    ("Commerce de détail", r"commis|caissier|retail|magasin|boutique|"599                           r"marchandiseur|gerant de magasin"),600    ("Administration", r"adjoint|administratif|secretaire|receptionniste|"601                       r"coordonnat|commis de bureau|office (?:manager|clerk)"),602]603604605# ---------------------------------------------------------------------------606# Langue de l'offre — heuristique légère par mots-outils (fr | en | bilingue)607# ---------------------------------------------------------------------------608609# Mots-outils très fréquents et quasi exclusifs à chaque langue (sans accents).610_FR_STOPWORDS = re.compile(611    r"\b(?:le|la|les|des|une|et|est|sont|pour|avec|vous|nous|notre|nos|vos|"612    r"dans|chez|aux|du|au|ainsi|plus de|afin|etre|sera|poste|equipe|"613    r"exigences|taches|milieu|travail)\b")614_EN_STOPWORDS = re.compile(615    r"\b(?:the|and|for|with|you|your|we|our|is|are|will|this|that|team|"616    r"work|skills|of|to be|as well|role|responsibilities|requirements|"617    r"experience in|ability)\b")618619620def detect_language(title: str, description: str = "") -> str:621    """Langue du texte de l'offre : « fr », « en », « bilingue », ou "".622623    Comptage de mots-outils sur le début du texte — déterministe, jamais de624    valeur inventée : texte trop court ou ambigu -> "".625    """626    text = _key(f"{title}\n{description or ''}"[:4000])627    if len(text) < 30:628        return ""629    fr = len(_FR_STOPWORDS.findall(text))630    en = len(_EN_STOPWORDS.findall(text))631    total = fr + en632    if total < 5:633        return ""634    # les deux langues nettement présentes -> offre bilingue635    if fr >= 8 and en >= 8 and min(fr, en) / max(fr, en) >= 0.35:636        return "bilingue"637    if fr > en:638        return "fr"639    if en > fr:640        return "en"641    return ""642643644# ---------------------------------------------------------------------------645# Avantages — extraction des blocs « Avantages / Benefits » des descriptions646# ---------------------------------------------------------------------------647648_BENEFITS_HEADING = re.compile(649    r"^\s*(?:les\s+|nos\s+|our\s+|tes\s+|vos\s+)?(?:avantages(?:\s+sociaux|"650    r"\s+offerts|\s+et\s+conditions)?|"651    r"benefits(?:\s+&\s+perks|\s+offered)?|perks(?:\s+(?:and|&)\s+benefits)?|"652    r"ce que (?:nous|l'on|on) (?:t'|te\s+|vous\s+)?offr(?:ons|e)|"653    r"nous (?:t'|te\s+|vous\s+)?offrons|on (?:t'|te\s+|vous\s+)offre|"654    r"what we offer|what'?s in it for you|why join us|why work (?:with|for) us|"655    r"pourquoi (?:nous rejoindre|nous choisir|te joindre a nous|"656    r"vous joindre a nous|travailler (?:chez|avec) nous)|we offer)"657    r"\s*:?\s*$", re.I)658_BENEFIT_LINE_MAX = 120659660661def extract_benefits(description: str) -> list[str]:662    """Liste d'avantages depuis un bloc structuré de la description.663664    Cherche un titre de section « Avantages/Benefits/… » seul sur sa ligne,665    puis prend les lignes courtes qui suivent (puces), en s'arrêtant à la666    première ligne longue ou au prochain titre. Max 12 items — si le bloc ne667    ressemble pas à une liste, on ne retourne rien (pas d'à-peu-près).668    """669    if not description:670        return []671    lines = description.split("\n")672    for i, line in enumerate(lines):673        if not _BENEFITS_HEADING.match(strip_accents(line)):674            continue675        items: list[str] = []676        for nxt in lines[i + 1:]:677            t = clean_text(nxt).lstrip("•-–—*·◦▪ ").strip()678            if not t:679                if items:680                    break          # fin du bloc (ligne vide après les puces)681                continue682            if len(t) > _BENEFIT_LINE_MAX or _BENEFITS_HEADING.match(683                    strip_accents(t)):684                break685            # un « titre » de section suivant (courte ligne sans ponctuation686            # finale, capitalisée) termine aussi le bloc687            if items and len(t.split()) <= 4 and t.endswith(":"):688                break689            items.append(t.rstrip(" ;,.").strip())690            if len(items) >= 12:691                break692        if len(items) >= 2:693            return items694    return []695696697# ---------------------------------------------------------------------------698# Exigences — expérience, scolarité, langues (depuis la description)699# ---------------------------------------------------------------------------700701# Années d'expérience : « 3 à 5 ans d'expérience », « minimum de 5 ans »,702# « 5+ years of experience », « two (2) years of relevant experience »…703_EXP_PATTERNS = [704    # « X à Y ans/years … expérience » (fourchette) — on garde le MIN705    re.compile(r"(\d{1,2})\s*(?:a|-|to)\s*\d{1,2}\s*(?:ans?|years?)"706               r"[^.\n]{0,40}?(?:d )?experience", re.I),707    # « X ans/années/years (+) d'expérience »708    re.compile(r"(\d{1,2})\s*\+?\s*(?:ans?|annees?|years?)"709               r"[^.\n]{0,40}?(?:d )?experience", re.I),710    # « expérience … de X ans » / « experience of X+ years »711    re.compile(r"experience[^.\n]{0,50}?(?:de|of|d au moins|minimum(?: de)?|"712               r"at least)\s*(\d{1,2})\s*\+?\s*(?:ans?|annees?|years?)", re.I),713    # « minimum de X ans » / « at least X years » (sans le mot expérience)714    re.compile(r"(?:minimum(?: de)?|au moins|at least)\s*(\d{1,2})\s*"715               r"(?:ans?|annees?|years?)\b", re.I),716]717718# Scolarité : du plus élevé au moins élevé — on retourne le PLUS BAS exigé719# quand plusieurs sont acceptés (« bac ou maîtrise » -> baccalauréat).720# Les sigles QC (DEP/DEC/AEC/DES) ne comptent que dans un contexte scolaire721# (« dec. » est aussi l'abréviation de décembre).722_EDU_SCHOOL_CONTEXT = re.compile(723    r"diplome|dipl\.|etudes|formation|scolarite|degree|diploma|education|"724    r"detenir|detention|obtenu|completed?\b|graduate", re.I)725_EDU_LEVELS = [   # (niveau canonique, motif, sigle nécessitant le contexte ?)726    ("secondaire", r"diplome d etudes secondaires|\bdes\b|secondaire (?:5|v)\b|"727                   r"high school diploma|secondary school diploma", True),728    ("DEP", r"diplome d etudes professionnelles|\bdep\b|"729            r"vocational diploma", True),730    ("AEC", r"attestation d etudes collegiales|\baec\b", True),731    ("DEC", r"diplome d etudes collegiales|\bdec\b|techniques? collegiales?|"732            r"college diploma|cegep", True),733    ("certificat", r"certificat universitaire|university certificate", False),734    ("baccalauréat", r"baccalaureat|bachelor|\bbacc\b|bac universitaire|"735                     r"\bbac\b (?:en|in)\b|undergraduate degree|"736                     r"b\.?\s?(?:sc|ing|a\.?a|com)\b", False),737    ("maîtrise", r"maitrise|master s degree|masters degree|\bmba\b|"738                 r"m\.?\s?sc\.?\b|graduate degree", False),739    ("doctorat", r"doctorat|\bphd\b|ph\.?\s?d\b|doctoral", False),740]741742# Langues exigées : mention explicite d'exigence (pas la langue du TEXTE —743# ça, c'est detect_language). « bilingue », « anglais requis », « fluent in744# English », « maîtrise du français »…745_LANG_BILINGUAL = re.compile(r"bilingu", re.I)746_LANG_REQ_FR = re.compile(747    r"francais[^.\n]{0,30}?(?:requis|exige|obligatoire|essentiel|"748    r"fonctionnel|avance|courant|parle et ecrit|oral et ecrit)|"749    r"(?:maitrise|connaissance|excellente maitrise) (?:de la langue |du )?"750    r"francais|french (?:is )?(?:required|mandatory|essential)|"751    r"fluent in french|fluency in french|french proficiency", re.I)752_LANG_REQ_EN = re.compile(753    r"anglais[^.\n]{0,30}?(?:requis|exige|obligatoire|essentiel|"754    r"fonctionnel|avance|courant|parle et ecrit|oral et ecrit)|"755    r"(?:maitrise|connaissance|excellente maitrise) (?:de la langue |de l )?"756    r"anglais|english (?:is )?(?:required|mandatory|essential)|"757    r"fluent in english|fluency in english|english proficiency", re.I)758759760def extract_requirements(title: str, description: str) -> dict:761    """Exigences structurées depuis le texte de l'offre — clés présentes762    seulement quand l'information est explicite (jamais de valeur inventée) :763764    - ``experience_years`` : années d'expérience minimales exigées (int)765    - ``education``        : plus bas diplôme exigé (secondaire, DEP, AEC,766                             DEC, certificat, baccalauréat, maîtrise, doctorat)767    - ``languages``        : langues exigées (["français"], ["anglais"], …)768    """769    out: dict = {}770    text = _key(f"{title or ''}\n{description or ''}"[:8000])771    text = re.sub(r"[’']", " ", text)         # « d'expérience » -> « d experience »772    if len(text) < 20:773        return out774775    years: list[int] = []776    for pat in _EXP_PATTERNS:777        for m in pat.finditer(text):778            try:779                n = int(m.group(1))780            except (TypeError, ValueError):781                continue782            if 1 <= n <= 30:                  # bornes de plausibilité783                years.append(n)784    if years:785        out["experience_years"] = min(years)  # l'exigence MINIMALE786787    for level, pat, needs_ctx in _EDU_LEVELS:788        for m in re.finditer(pat, text):789            if needs_ctx:790                window = text[max(0, m.start() - 120):m.end() + 120]791                if not _EDU_SCHOOL_CONTEXT.search(window):792                    continue793            out["education"] = level794            break795        if "education" in out:796            break                             # plus bas niveau exigé trouvé797798    langs: list[str] = []799    if _LANG_BILINGUAL.search(text):800        langs = ["français", "anglais"]801    else:802        if _LANG_REQ_FR.search(text):803            langs.append("français")804        if _LANG_REQ_EN.search(text):805            langs.append("anglais")806    if langs:807        out["languages"] = langs808    return out809810811# ---------------------------------------------------------------------------812# Séniorité — stage | junior | intermediaire | senior | direction813# ---------------------------------------------------------------------------814815_SENIORITY_TITLE = [816    ("stage", r"\bstagiaire\b|\bstage\b|\bintern(?:ship)?\b|\bco-?op\b|"817              r"alternance|etudiant"),818    ("direction", r"directeur|directrice|\bdirector\b|vice[- ]?president|"819                  r"\bvp\b|\bpdg\b|\bceo\b|\bcfo\b|\bcto\b|\bcoo\b|"820                  r"chef de (?:service|departement|division|la direction)|"821                  r"head of|\bdg\b|gestionnaire de (?:service|departement)"),822    ("senior", r"\bsenior\b|\bsr\.?\b|\bprincipal(?:e)?\b|\blead\b|"823               r"\bexpert(?:e)?\b|chef d equipe|team lead|superviseur|"824               r"\bniveau (?:3|iii)\b|\biii\b"),825    ("junior", r"\bjunior\b|\bjr\.?\b|debutant|entry[- ]level|"826               r"\bniveau (?:1|i)\b|premier emploi|releve"),827    ("intermediaire", r"intermediaire|intermediate|\bniveau (?:2|ii)\b|\bii\b"),828]829830# libellés d'expérience des ATS (SmartRecruiters/LinkedIn-style) -> séniorité831_SENIORITY_ATS = [832    ("stage", r"internship|stage"),833    ("direction", r"director|executive|direction"),834    ("senior", r"mid[- ]?senior|senior"),835    ("intermediaire", r"associate|intermediaire|intermediate|mid[- ]?level"),836    ("junior", r"entry|junior|debutant"),837]838839840def parse_seniority(title: str, requirements: dict | None = None,841                    employment_type: str | None = None) -> str | None:842    """Niveau de séniorité du poste, ou None si aucun signal explicite.843844    Ordre des signaux : type d'emploi « stage », titre du poste, libellé845    d'expérience fourni par l'ATS, puis années d'expérience exigées.846    """847    if employment_type == "stage":848        return "stage"849    key = _key(title or "")850    if key:851        for level, pat in _SENIORITY_TITLE:852            if re.search(pat, key):853                return level854    req = requirements or {}855    label = _key(str(req.get("experience", "")))856    if label and "not applicable" not in label:857        for level, pat in _SENIORITY_ATS:858            if re.search(pat, label):859                return level860    years = req.get("experience_years")861    if isinstance(years, (int, float)):862        if years <= 2:863            return "junior"864        if years <= 4:865            return "intermediaire"866        return "senior"867    return None868869870# ---------------------------------------------------------------------------871# Titre d'affichage — casse propre, codes de réquisition et suffixes retirés872# ---------------------------------------------------------------------------873874# codes de réquisition : « [R-12345] », « (REQ 2026-42) », « - JR0035678 »…875_REQ_CODE = re.compile(876    # en tête : « 123456 - Titre », « [REQ-1234] Titre » (≥5 chiffres nus pour877    # ne pas manger une année « 2026 - Programme d'été »)878    r"^\s*[\[(]?(?:req(?:uisition)?|jr|job)[\s#:-]*\d{3,10}[\])]?\s*[-–—:|]\s*|"879    r"^\s*[\[(]?\d{5,10}[\])]?\s*[-–—:|]\s*|"880    # en queue : « Titre - R-12345 », « Titre (JOB 004521) »881    r"\s*[-–—|(]\s*(?:req(?:uisition)?|job|poste)?\s*#?\s*(?:[A-Z]{1,4}-?)?\d{4,10}\s*[)\]]?\s*$|"882    # au milieu : « Titre [R-12345] suite »883    r"\s*[\[(](?:R|REQ|JR|JOB)[-_ ]?\d{3,10}[\])]\s*", re.I)884885# petits mots gardés en minuscules lors de la remise en casse d'un titre886# tout-majuscules ; sigles usuels gardés en majuscules887_TITLE_SMALL = {"de", "du", "des", "la", "le", "les", "et", "en", "à", "a",888                "au", "aux", "d'", "l'", "of", "the", "and", "in", "for",889                "to", "or", "ou", "un", "une", "sur", "pour"}890_TITLE_ACRONYMS = {"rh", "ti", "it", "qa", "qc", "pab", "cpa", "cfa", "erp",891                   "sap", "crm", "sst", "cnc", "hvac", "rpa", "bi", "ia",892                   "ai", "vp", "pdg", "dg"}893894895def _smart_case(title: str) -> str:896    """Titre TOUT EN MAJUSCULES -> casse de phrase lisible (sigles préservés)."""897    words = title.lower().split()898    out = []899    for i, w in enumerate(words):900        base = w.strip("()[],.;:/")901        if base in _TITLE_ACRONYMS:902            out.append(w.replace(base, base.upper()))903        elif i > 0 and base in _TITLE_SMALL:904            out.append(w)905        else:906            out.append(w[:1].upper() + w[1:])907    return " ".join(out)908909910def clean_title(title: str, city: str = "") -> str:911    """Titre d'affichage : codes de réquisition retirés, suffixe « - <ville> »912    redondant retiré, casse corrigée si tout-majuscules. Le titre SOURCE n'est913    jamais modifié — ceci alimente une colonne d'affichage distincte."""914    t = clean_text(title)915    if not t:916        return ""917    prev = None918    while prev != t:              # les codes peuvent être empilés919        prev = t920        t = _REQ_CODE.sub(" ", t).strip(" -–—|:")921        t = clean_text(t)922    # suffixe « - Montréal » / « (Montréal, QC) » identique à la ville de923    # l'offre : repéré sans accents, coupé sur le titre original924    if city:925        ck = re.escape(strip_accents(city.lower()))926        m = re.search(927            rf"\s*[-–—|,(]\s*(?:ville de\s+)?{ck}(?:\s*,\s*(?:qc|quebec))?\s*\)?\s*$",928            strip_accents(t.lower()))929        if m and m.start() > 0:930            t = clean_text(t[:m.start()]).strip(" -–—|,(")931    if len(t) > 8 and t == t.upper() and t != t.lower():932        t = _smart_case(t)933    return t or clean_text(title)934935936def categorize(title: str, description: str = "") -> str:937    """Titre -> catégorie interne (repli : début de description), ou "".938939    Le titre est essayé SEUL d'abord : la description commence souvent par le940    boilerplate de l'entreprise (« leader du manufacturier… ») qui fausserait941    la catégorie du poste.942    """943    for texte in (title, description[:300]):944        key = _key(texte or "")945        if not key.strip():946            continue947        for cat, pat in _CATEGORY_RULES:948            if re.search(pat, key):949                return cat950    return ""951