Wynd Labs logo
Wynd Labs
Posted 32 days agoVerified live 6h ago

Data Engineer

Brief overview

Remote
UndergradOr in progress
PythonAsync ProgrammingMultiprocessingWeb Scraping at ScalePlatform APIsDistributed Data PipelinesCeleryKafkaRabbitMQData WarehousingClickHouseBigQueryDockerKubernetesHelmLinux Server AdministrationGitHub Actions

About the company

Wynd Labs logo
Wynd Labswyndlabs.ai

Wynd Labs is a platform that makes public web data accessible for AI.

Job description

Summary

Wynd Labs builds infrastructure for collecting and processing large-scale public web data used to train advanced AI models. The Data Engineer will maintain databases and scalable data pipelines, support web scraping and data collection, troubleshoot data quality and pipeline issues, document engineering work, and contribute to research and development projects.

Responsibilities

  • Maintain, optimize, and troubleshoot database queries and related data systems to support efficient data access, processing, and reliability
  • Assist in creating, maintaining, and improving data pipelines used to collect, process, transform, validate, and deliver large-scale datasets
  • Support web scraping and data collection initiatives, including developing, testing, and maintaining scripts or tools used to gather publicly available data in accordance with Company requirements
  • Monitor and troubleshoot data pipeline issues, identify data quality concerns, and assist in implementing timely fixes to maintain data accuracy and operational continuity
  • Document engineering work, including database queries, pipeline processes, scraping workflows, technical decisions, issues encountered, and resolutions implemented
  • Participate in research and development projects to improve the Company’s data products and workflows

Skills

  • Bachelor's degree or equivalent work experience
  • Python (advanced) — strong grasp of async programming, multiprocessing, and writing production-grade code for long-running data jobs
  • Web scraping at scale — hands-on experience with high-volume scraping (proxies, rate limiting, anti-bot evasion). Experience with platform APIs and large media/metadata datasets (video platforms, social media)
  • Distributed data pipelines — experience designing and operating pipelines across many workers/servers using task queues (Celery, Kafka, RabbitMQ, or similar)
  • Docker & Kubernetes — containerizing workloads, writing Helm charts/manifests, managing deployments, autoscaling scraping/processing workloads
  • Linux & bare-metal ops — comfortable managing services on Linux servers, debugging performance issues (disk I/O, network, memory) without managed-cloud abstractions
  • CI/CD for data workflows (GitHub Actions, ArgoCD)
  • Writing Scalable API
  • Data warehousing — practical experience with columnar/analytical warehouses; Databend, ClickHouse, or BigQuery strongly preferred; comfortable with complex analytical queries, partitioning strategies, cost-aware querying on cloud warehouses

Qualifications

Must Haves

  • Bachelor's degree or equivalent work experience
  • Python (advanced) — strong grasp of async programming, multiprocessing, and writing production-grade code for long-running data jobs
  • Web scraping at scale — hands-on experience with high-volume scraping (proxies, rate limiting, anti-bot evasion). Experience with platform APIs and large media/metadata datasets (video platforms, social media)
  • Distributed data pipelines — experience designing and operating pipelines across many workers/servers using task queues (Celery, Kafka, RabbitMQ, or similar)
  • Docker & Kubernetes — containerizing workloads, writing Helm charts/manifests, managing deployments, autoscaling scraping/processing workloads
  • Linux & bare-metal ops — comfortable managing services on Linux servers, debugging performance issues (disk I/O, network, memory) without managed-cloud abstractions
  • CI/CD for data workflows (GitHub Actions, ArgoCD)
  • Writing Scalable API

Nice to Haves

  • Data warehousing — practical experience with columnar/analytical warehouses; Databend, ClickHouse, or BigQuery strongly preferred; comfortable with complex analytical queries, partitioning strategies, cost-aware querying on cloud warehouses

Benefits

  • Benefits and equity package
  • Fully remote team

More jobs like this