Crawler: Auto-Discovery der Klimageraete-Kategorieseiten (toom+OBI) findet Produkte selbst (Daten-Hygiene-Filter, Zubehoer raus); 3-Min-Takt; paralleles Crawling; discovered-Flag + Counts im Snapshot

This commit is contained in:
2026-06-29 12:29:14 +00:00
parent 1396ae50e1
commit 6b127737ac
3 changed files with 69 additions and 6 deletions
+50
View File
@@ -0,0 +1,50 @@
"""Auto-Discovery: liest die Klimageräte-Kategorieseiten der scrapebaren Baumärkte
und findet Produktseiten SELBST (statt hartkodierter URLs). So wächst die Abdeckung
automatisch mit dem Sortiment. Server-gerenderte Chains: toom, OBI.
Hornbach-Listing = JS (liefert keine Links), Bauhaus = IP-Block (403) -> brauchen Proxy/Headless.
Curated SOURCES bleiben für den Cross-Shop-Preisvergleich (gleiche productId über Shops)."""
import re
# Kategorie-Seiten + Produktlink-Muster je Chain
CATALOG = [
{"chain":"toom","kind":"baumarkt","cc":"DE","base":"https://toom.de",
"cat":"https://toom.de/c/bauen-renovieren/klima-lueftung/klimaanlagen/klimageraete",
"re":r'/p/([a-z0-9-]+)/(\d+)', "slug_grp":1, "id_grp":2},
{"chain":"OBI","kind":"baumarkt","cc":"DE","base":"https://www.obi.de",
"cat":"https://www.obi.de/search/klimager%C3%A4te/",
"re":r'/p/(\d+)/([a-z0-9-]+)', "slug_grp":2, "id_grp":1},
]
# Nur echte Klimageräte behalten, Zubehör/Empfehlungs-Querlinks raus (Daten-Hygiene)
KEEP = re.compile(r'(klimage|klimaanlage|klimasplit|split-klima|portasplit|mobiles?-klima|btu|pinguino|comfee|midea|delonghi|suntec|klarstein|remko|trotec|aeg|bosch)', re.I)
SKIP = re.compile(r'(ventilator|fensterabdicht|abluftschlauch|fernbedien|ersatzfilter|halterung|wandhalter|zubeh|konvektor|heizk|luftentfeucht|luftk\w+hler|tischvent|standvent|deckenvent|abdeckhaube|abdeckung|reinig|kuehlverbind|k\w+hlverbind|kuehlleitung|\bleitung\b|\bkit\b|montage|adapter|schlauch)', re.I)
def _name(slug):
s=re.sub(r'\b(eek|a|aplus|aplusplus|schwarz|weiss|grau|inkl|mit|und)\b',' ',slug.replace('-',' '),flags=re.I)
s=re.sub(r'\s+',' ',s).strip().title()
return s[:60] or slug
async def discover(client, cap=20):
out=[]
for c in CATALOG:
try:
r=await client.get(c["cat"], timeout=25, follow_redirects=True)
if r.status_code!=200:
continue
seen=set(); found=0
for m in re.finditer(c["re"], r.text):
slug=m.group(c["slug_grp"]); pid_num=m.group(c["id_grp"])
if not KEEP.search(slug) or SKIP.search(slug):
continue
url=c["base"]+m.group(0)
if url in seen:
continue
seen.add(url)
out.append({"chain":c["chain"],"kind":c["kind"],"cc":c["cc"],
"productId":f"disc-{c['chain'].lower()}-{pid_num}",
"name":_name(slug),"url":url,"discovered":True})
found+=1
if found>=cap:
break
except Exception:
pass
return out