Ergänze Kontaktdaten einer Partnerauswahl
Sammle nach der Recherche möglicher Händler deren öffentliche Kontaktkanäle. Prüfe den passenden Kanal für deine Partneranfrage.
Halte öffentliche Kontakte und Social-Links je Domain in einer Tabelle fest.
Starte mit Firmenwebsites. Sammle veröffentlichte Kontaktkanäle und ordne Profile nach Netzwerk, damit dein Team mehr als einen Domainnamen hat.
Probiere diese Beispiele für Marketing, Wachstum und Wettbewerbsrecherche.
Sammle nach der Recherche möglicher Händler deren öffentliche Kontaktkanäle. Prüfe den passenden Kanal für deine Partneranfrage.
Halte öffentliche Kontakte und Social-Links je Domain in einer Tabelle fest.
Starte mit einer kategoriebasierten Google-Search-Domainliste. Prüfe Websites, sammle Profile und untersuche Zielgruppe und Positionierung.
Ergänze Quellseiten und eigene Notizen in der Firmenliste.
Prüfe bei mehreren Marken E-Mails, Telefone und Social-Links jeder Website. Besprich fehlende Angaben oder veraltete Links mit den Verantwortlichen.
Halte ein Kontaktaudit mit Links zu geprüften Seiten fest.
VOM ERSTEN LAUF ZUM REGELMÄSSIGEN ABLAUF
{
"startUrls": ["https://apify.com", "https://www.iana.org"],
"maxPagesPerSite": 8,
"maxResults": 2,
"skipSitesWithoutContacts": false
}Fügen Sie dies in den JSON-Eingabeeditor des Actors ein. Ersetzen Sie die Beispielziele vor dem Start.
Das aktuelle Eingabeformular auf Apify ansehenDer Scraper besucht eine Website und priorisiert Seiten mit möglichen öffentlichen Kontaktdaten. Verwende möglichst bestätigte Website-URLs. Abkürzungen über Firmennamen können eine Domain nur erraten und brauchen eine zusätzliche Identitätsprüfung.
| Suchmethode | Wann es sinnvoll ist | Was sich ändert |
|---|---|---|
| Website-Domains | Wann es sinnvoll istDu kennst genau die Entität, deren Daten du sammeln möchtest. | Was sich ändertWebsite-URLs oder Domains als Zeichenketten oder Objekte mit url. Jeder Standort wird getrennt gescannt. Namen und Profile können zu geratenen Domains werden; nutzen Sie geprüfte Websites. |
| Abkürzungen über Firmennamen | Wann es sinnvoll istDu möchtest passende Ergebnisse finden, bevor du konkrete Ziele auswählst. | Was sich ändertEine Website zusätzlich zu oder statt startUrls. Eine Geschäftsadresse kann als Domain gelesen werden; eine geprüfte Website ist eindeutiger. |
| Crawling-Tiefe | Wann es sinnvoll istDu möchtest eine breitere Abdeckung und kannst einen größeren Lauf zulassen. | Was sich ändert1 bis 100 Seiten je Website, Standard 8. Bevorzugt Kontakt, Impressum, Über-uns, Team und Support statt aller Links. Für große Websites erhöhen, nicht für mehr Domains. |
Begrenzt gelieferte Website-Datensätze, nicht E-Mail-Adressen oder Seiten. Je Domain entsteht gewöhnlich eine Zeile mit Kontaktlisten. Leer verarbeitet die ganze Eingabeliste.
Den verwandten Scraper vergleichenVerwenden Sie in JSON die genauen Feldnamen unten. Geben Sie Listenwerte im Apify-Formular einzeln ein und verwenden Sie Zahlen und Wahrheitswerte im richtigen Datentyp.
Standardwert und Vorbelegung sind verschieden. Der Standardwert gilt, wenn du eine Einstellung auslässt; die Vorbelegung ist ein Beispiel im Apify-Formular. Prüfe Ziele und Limits vor jedem Lauf. Manche Einstellungen haben keinen Standardwert im Schema. Du musst trotzdem mindestens ein unterstütztes Ziel angeben.
startUrlsWebsite-URLs oder Domains als Zeichenketten oder Objekte mit url. Jeder Standort wird getrennt gescannt. Namen und Profile können zu geratenen Domains werden; nutzen Sie geprüfte Websites.
urlEine Website zusätzlich zu oder statt startUrls. Eine Geschäftsadresse kann als Domain gelesen werden; eine geprüfte Website ist eindeutiger.
maxPagesPerSite1 bis 100 Seiten je Website, Standard 8. Bevorzugt Kontakt, Impressum, Über-uns, Team und Support statt aller Links. Für große Websites erhöhen, nicht für mehr Domains.
maxResultsBegrenzt gelieferte Website-Datensätze, nicht E-Mail-Adressen oder Seiten. Je Domain entsteht gewöhnlich eine Zeile mit Kontaktlisten. Leer verarbeitet die ganze Eingabeliste.
skipSitesWithoutContactstrue lässt gelesene Websites ohne Kontakte weg; false behält leere Kontaktzeilen zur Abdeckungsprüfung. Unerreichbare oder gesperrte Seiten sind separate Fehler, kein Nachweis fehlender Kontakte.
maxConcurrency1 bis 20 Websites gleichzeitig, Standard 5. Parallelisiert verschiedene Hosts, nicht mehr Seiten derselben Website. Behalten Sie eine Pause je Website bei.
delayMsPause zwischen Anfragen an dieselbe Website in Millisekunden. Andere parallele Websites werden nicht pausiert. Standard 300 ist ein guter Ausgangspunkt.
requestTimeoutSecs5 bis 120 Sekunden Wartezeit je Seite, Standard 20. Für langsame Seiten erhöhen, für schnelle Listen senken. Kein Zeitlimit für den ganzen Actor.
proxyConfigurationFür gewöhnliche öffentliche Unternehmensseiten optional; Standard ohne Proxy. Bei großen Listen oder verweigerten Seiten testen und Fehler nicht als leere Websites einstufen.
resumeSpeichert den Fortschritt etwa alle 30 Sekunden für Neustarts oder Migrationen durch Apify. Lassen Sie es normalerweise aktiviert.
continueFromLastRunSetzt unerledigte Arbeit des vorherigen Laufs mit passender Eingabe fort. Bisherige Daten bleiben in dessen Dataset. Nutzen Sie false für neue oder regelmäßige Erhebungen.
impersonateBrowser-Identität der Anfragen. Behalten Sie den Actor-Standard bei, außer bei der Diagnose sofortiger Sperren. Sie verändert den Fingerabdruck der Anfrage, nicht die angefragten Daten.
Diese Referenz folgt den Eingabefeldern des Actors. Prüfen Sie das aktuelle Formular, bevor Sie einen produktiven Ablauf ändern. Das aktuelle Eingabeformular auf Apify ansehen.
Jedes Beispiel ist ein eigener Lauf. Beginnen Sie klein, prüfen Sie die Ergebnisse und erweitern Sie dann. Passen Sie Ziele, Länder und Zeiträume an Ihre Frage an.
Sammle öffentliche Kontakte von vier bekannten Domains mit bis zu acht Seiten je Website. Behalte leere Zeilen für die Abdeckungsprüfung. Ersetze die Beispiele vor dem Start durch deine Rechercheliste.
{
"startUrls": [
"https://apify.com",
"https://www.iana.org",
"https://www.python.org",
"https://www.getdbt.com"
],
"maxPagesPerSite": 8,
"maxResults": 4,
"skipSitesWithoutContacts": false
}Erhöhe das Budget für zwei Domains auf 20 Seiten, wenn Kontakte verteilt sind. Der Actor priorisiert wahrscheinliche Kontaktseiten; auch ein größeres Budget ist ein begrenzter Crawl, nicht jede URL der Website.
{
"startUrls": ["https://apify.com", "https://www.getdbt.com"],
"maxPagesPerSite": 20,
"maxResults": 2,
"skipSitesWithoutContacts": false,
"maxConcurrency": 2,
"delayMs": 500
}Setze skipSitesWithoutContacts für eine Kontaktliste auf true. Prüfe zuerst einen Lauf mit false: Ohne leere Zeilen ist der Export praktischer, aber die Abdeckung weniger sichtbar.
{
"startUrls": [
"https://apify.com",
"https://www.iana.org",
"https://www.python.org",
"https://www.getdbt.com"
],
"maxPagesPerSite": 8,
"maxResults": 4,
"skipSitesWithoutContacts": true
}Erwarte einen Datensatz je Website mit Arrays öffentlicher E-Mails, Telefonnummern und Social-Profile. Leere Arrays können fehlende Kontakte, blockierte Seiten oder JavaScript-Inhalte bedeuten, die dieser HTTP-Scraper nicht rendert. Prüfe Logs und Quellen vor Schlussfolgerungen. Verifiziere erratene Domains vor dem Join mit deiner Firmenliste.
resume schützt den aktuellen Lauf bei einem Neustart durch Apify. continueFromLastRun setzt einen früheren Lauf mit derselben Konfiguration fort; vorhandene Daten bleiben im alten Dataset. Führen Sie beide Datasets zusammen und erhöhen Sie erreichte Grenzen. Starten Sie neu, um heutige Änderungen zu erfassen.
Speichere eine Konfiguration oben als input.json. Setze APIFY_TOKEN im Terminal auf deinen Apify-API-Token und sende die Datei als Anfrageinhalt.
curl --fail-with-body --request POST \
--url "https://api.apify.com/v2/actors/jmlp~web-contact-scraper/runs" \
--header "Authorization: Bearer $APIFY_TOKEN" \
--header "Content-Type: application/json" \
--data-binary @input.jsonDie Antwort enthält eine Run-ID und defaultDatasetId, keine fertigen Ergebnisse. Warte auf einen erfolgreichen Abschluss, setze DATASET_ID auf diese Dataset-ID und rufe die Einträge ab. Nutze bei großen Datensätzen limit und offset zur Paginierung.
curl --fail-with-body \
--url "https://api.apify.com/v2/datasets/$DATASET_ID/items?format=json" \
--header "Authorization: Bearer $APIFY_TOKEN"Apifys API-Referenz für Start und Export
Optionen für den Datenexport
Ändern Sie jeweils nur eine Einstellung, behalten Sie eine kleine Grenze und prüfen Sie die Zusammenfassung vor einer Erweiterung.
Website-URLs oder Domains als Zeichenketten oder Objekte mit url. Jeder Standort wird getrennt gescannt. Namen und Profile können zu geratenen Domains werden; nutzen Sie geprüfte Websites.
Erwarte einen Datensatz je Website mit Arrays öffentlicher E-Mails, Telefonnummern und Social-Profile. Leere Arrays können fehlende Kontakte, blockierte Seiten oder JavaScript-Inhalte bedeuten, die dieser HTTP-Scraper nicht rendert. Prüfe Logs und Quellen vor Schlussfolgerungen. Verifiziere erratene Domains vor dem Join mit deiner Firmenliste.
true lässt gelesene Websites ohne Kontakte weg; false behält leere Kontaktzeilen zur Abdeckungsprüfung. Unerreichbare oder gesperrte Seiten sind separate Fehler, kein Nachweis fehlender Kontakte.
Erfolg bedeutet, dass der Actor die Anfrage bearbeitet hat, nicht dass die Quelle Daten geliefert hat. Prüfen Sie SUMMARY.inputProblem, SUMMARY.problem und das Protokoll auf fehlende Ziele, ungültige Filter oder verweigerte Anfragen. Testen Sie ein bekanntes Ziel mit weniger Filtern.
Prüfen Sie globale Grenzen, Such- und Seitengrenzen, Abdeckung und Duplikate. Mehrere Suchen können denselben Datensatz finden. Die angezeigte Gesamtzahl der Quelle kann öffentlich nicht verfügbare Datensätze enthalten. Prüfen Sie offene Aufgaben, bevor Sie den Bestand als vollständig ansehen.
Verknüpfe über normalisierte Domain. Lege Kontaktarrays in eigene Spalten mit Notizen zu bevorzugtem Kanal, Relevanz und Quellen.
Anleitung lesenLass Claude Kanäle nach Netzwerk ordnen und fehlende oder unklare Datensätze markieren. Ein allgemeines Postfach identifiziert keine Person; Veröffentlichung bestätigt keine Zustellbarkeit.
Anleitung lesenZeige Domains mit E-Mail, Telefon oder LinkedIn. Behalte Fehler im Bericht, um fehlende Daten von fehlenden Kontaktkanälen zu unterscheiden.
Anleitung lesenSpeichere je Domain und Lauf einen Datensatz mit Zeit. Nutze UNNEST für separate E-Mail-, Telefon- und Profiltabellen und behalte Quellbelege.
Anleitung lesenPrüfe jmlp/web-contact-scraper für https://apify.com mit höchstens acht Seiten pro Website. Ordne öffentliche E-Mails, Telefone und Profile, zitiere Seiten und markiere Fehler oder fehlende Kanäle. Behaupte keine bestätigte Zustellbarkeit.Behalte Erfassungszeit und Original-IDs, um die Herkunft eines Ergebnisses zu prüfen oder spätere Läufe zu vergleichen.
Er sammelt veröffentlichte Kontakte, keine privaten Angaben, und prüft keine Zustellbarkeit. Manche Websites liefern nichts. Prüfe Fehler und Quellen vor einer relevanten Ansprache.
Nein. Er extrahiert veröffentlichte Adressen. Zustellbarkeitsprüfung ist ein separater Prozess.
Ja. Prüfe Websites, normalisiere Domains und nutze die geprüfte Liste. Kontrolliere rekonstruierte URLs vor der Weitergabe an andere Crawler.
Quelle und aktuelle Produktdetails: JMLPs Website Contacts Actor auf Apify.
Sag mir, was du sammeln oder verstehen möchtest. Ich helfe mit einem individuellen Scraper, einer Pipeline oder der Analyse.
Projekt besprechen