PySpark Developer

Infosys
Bengaluru, Karnataka, India

Roles & Responsibilities

  • Design, develop, and maintain scalable data pipelines using PySpark.
  • Process and transform large datasets from multiple data sources.
  • Build and optimize ETL/ELT workflows for data ingestion and processing.
  • Develop Spark jobs for batch and real-time data processing.
  • Write complex SQL queries for data extraction and reporting.
  • Perform data cleansing, validation, and quality checks.
  • Optimize Spark performance by tuning jobs, partitions, and cluster configurations.
  • Integrate data from APIs, databases, cloud storage, and enterprise systems.
  • Work with data architects, analysts, and business stakeholders to understand requirements.
  • Troubleshoot production issues and implement performance improvements.
  • Ensure data security, governance, and compliance standards are followed.
  • Participate in code reviews and follow best development practices.
  • Maintain technical documentation for data pipelines and processes.

Score my resume against this job, free →

Get your ATS score for this role — free. Score my resume free →