51 lines
2.6 KiB
Python
51 lines
2.6 KiB
Python
"""Auto-Discovery: liest die Klimageräte-Kategorieseiten der scrapebaren Baumärkte
|
|
und findet Produktseiten SELBST (statt hartkodierter URLs). So wächst die Abdeckung
|
|
automatisch mit dem Sortiment. Server-gerenderte Chains: toom, OBI.
|
|
Hornbach-Listing = JS (liefert keine Links), Bauhaus = IP-Block (403) -> brauchen Proxy/Headless.
|
|
Curated SOURCES bleiben für den Cross-Shop-Preisvergleich (gleiche productId über Shops)."""
|
|
import re
|
|
|
|
# Kategorie-Seiten + Produktlink-Muster je Chain
|
|
CATALOG = [
|
|
{"chain":"toom","kind":"baumarkt","cc":"DE","base":"https://toom.de",
|
|
"cat":"https://toom.de/c/bauen-renovieren/klima-lueftung/klimaanlagen/klimageraete",
|
|
"re":r'/p/([a-z0-9-]+)/(\d+)', "slug_grp":1, "id_grp":2},
|
|
{"chain":"OBI","kind":"baumarkt","cc":"DE","base":"https://www.obi.de",
|
|
"cat":"https://www.obi.de/search/klimager%C3%A4te/",
|
|
"re":r'/p/(\d+)/([a-z0-9-]+)', "slug_grp":2, "id_grp":1},
|
|
]
|
|
# Nur echte Klimageräte behalten, Zubehör/Empfehlungs-Querlinks raus (Daten-Hygiene)
|
|
KEEP = re.compile(r'(klimage|klimaanlage|klimasplit|split-klima|portasplit|mobiles?-klima|btu|pinguino|comfee|midea|delonghi|suntec|klarstein|remko|trotec|aeg|bosch)', re.I)
|
|
SKIP = re.compile(r'(ventilator|fensterabdicht|abluftschlauch|fernbedien|ersatzfilter|halterung|wandhalter|zubeh|konvektor|heizk|luftentfeucht|luftk\w+hler|tischvent|standvent|deckenvent|abdeckhaube|abdeckung|reinig|kuehlverbind|k\w+hlverbind|kuehlleitung|\bleitung\b|\bkit\b|montage|adapter|schlauch)', re.I)
|
|
|
|
def _name(slug):
|
|
s=re.sub(r'\b(eek|a|aplus|aplusplus|schwarz|weiss|grau|inkl|mit|und)\b',' ',slug.replace('-',' '),flags=re.I)
|
|
s=re.sub(r'\s+',' ',s).strip().title()
|
|
return s[:60] or slug
|
|
|
|
async def discover(client, cap=20):
|
|
out=[]
|
|
for c in CATALOG:
|
|
try:
|
|
r=await client.get(c["cat"], timeout=25, follow_redirects=True)
|
|
if r.status_code!=200:
|
|
continue
|
|
seen=set(); found=0
|
|
for m in re.finditer(c["re"], r.text):
|
|
slug=m.group(c["slug_grp"]); pid_num=m.group(c["id_grp"])
|
|
if not KEEP.search(slug) or SKIP.search(slug):
|
|
continue
|
|
url=c["base"]+m.group(0)
|
|
if url in seen:
|
|
continue
|
|
seen.add(url)
|
|
out.append({"chain":c["chain"],"kind":c["kind"],"cc":c["cc"],
|
|
"productId":f"disc-{c['chain'].lower()}-{pid_num}",
|
|
"name":_name(slug),"url":url,"discovered":True})
|
|
found+=1
|
|
if found>=cap:
|
|
break
|
|
except Exception:
|
|
pass
|
|
return out
|