Crawler: Auto-Discovery der Klimageraete-Kategorieseiten (toom+OBI) findet Produkte selbst (Daten-Hygiene-Filter, Zubehoer raus); 3-Min-Takt; paralleles Crawling; discovered-Flag + Counts im Snapshot
This commit is contained in:
@@ -0,0 +1,50 @@
|
||||
"""Auto-Discovery: liest die Klimageräte-Kategorieseiten der scrapebaren Baumärkte
|
||||
und findet Produktseiten SELBST (statt hartkodierter URLs). So wächst die Abdeckung
|
||||
automatisch mit dem Sortiment. Server-gerenderte Chains: toom, OBI.
|
||||
Hornbach-Listing = JS (liefert keine Links), Bauhaus = IP-Block (403) -> brauchen Proxy/Headless.
|
||||
Curated SOURCES bleiben für den Cross-Shop-Preisvergleich (gleiche productId über Shops)."""
|
||||
import re
|
||||
|
||||
# Kategorie-Seiten + Produktlink-Muster je Chain
|
||||
CATALOG = [
|
||||
{"chain":"toom","kind":"baumarkt","cc":"DE","base":"https://toom.de",
|
||||
"cat":"https://toom.de/c/bauen-renovieren/klima-lueftung/klimaanlagen/klimageraete",
|
||||
"re":r'/p/([a-z0-9-]+)/(\d+)', "slug_grp":1, "id_grp":2},
|
||||
{"chain":"OBI","kind":"baumarkt","cc":"DE","base":"https://www.obi.de",
|
||||
"cat":"https://www.obi.de/search/klimager%C3%A4te/",
|
||||
"re":r'/p/(\d+)/([a-z0-9-]+)', "slug_grp":2, "id_grp":1},
|
||||
]
|
||||
# Nur echte Klimageräte behalten, Zubehör/Empfehlungs-Querlinks raus (Daten-Hygiene)
|
||||
KEEP = re.compile(r'(klimage|klimaanlage|klimasplit|split-klima|portasplit|mobiles?-klima|btu|pinguino|comfee|midea|delonghi|suntec|klarstein|remko|trotec|aeg|bosch)', re.I)
|
||||
SKIP = re.compile(r'(ventilator|fensterabdicht|abluftschlauch|fernbedien|ersatzfilter|halterung|wandhalter|zubeh|konvektor|heizk|luftentfeucht|luftk\w+hler|tischvent|standvent|deckenvent|abdeckhaube|abdeckung|reinig|kuehlverbind|k\w+hlverbind|kuehlleitung|\bleitung\b|\bkit\b|montage|adapter|schlauch)', re.I)
|
||||
|
||||
def _name(slug):
|
||||
s=re.sub(r'\b(eek|a|aplus|aplusplus|schwarz|weiss|grau|inkl|mit|und)\b',' ',slug.replace('-',' '),flags=re.I)
|
||||
s=re.sub(r'\s+',' ',s).strip().title()
|
||||
return s[:60] or slug
|
||||
|
||||
async def discover(client, cap=20):
|
||||
out=[]
|
||||
for c in CATALOG:
|
||||
try:
|
||||
r=await client.get(c["cat"], timeout=25, follow_redirects=True)
|
||||
if r.status_code!=200:
|
||||
continue
|
||||
seen=set(); found=0
|
||||
for m in re.finditer(c["re"], r.text):
|
||||
slug=m.group(c["slug_grp"]); pid_num=m.group(c["id_grp"])
|
||||
if not KEEP.search(slug) or SKIP.search(slug):
|
||||
continue
|
||||
url=c["base"]+m.group(0)
|
||||
if url in seen:
|
||||
continue
|
||||
seen.add(url)
|
||||
out.append({"chain":c["chain"],"kind":c["kind"],"cc":c["cc"],
|
||||
"productId":f"disc-{c['chain'].lower()}-{pid_num}",
|
||||
"name":_name(slug),"url":url,"discovered":True})
|
||||
found+=1
|
||||
if found>=cap:
|
||||
break
|
||||
except Exception:
|
||||
pass
|
||||
return out
|
||||
Reference in New Issue
Block a user