O

Principal Data Architect

Omega Healthcare · Hyderabad, Telangana, India

~₹45L (est.)12–20 yrs experiencefull_timePosted 1w ago

Job description

**Job Description** **Data Architect** Job Title Data Architect Role Summary The Data Architect is a senior technical leadership role responsible for defining, designing, and governing enterprise data architecture across operational, analytical, and AI-enabled data platforms. This role owns the data architecture strategy, data models, schemas, integration patterns, performance standards, data cataloging, lineage, golden data-set design, and data security controls required to deliver trusted, scalable, and AI-ready data products. The Data Architect works closely with product, engineering, analytics, AI/ML, security, compliance, and business stakeholders to ensure structured and unstructured data is reliable, governed, discoverable, reusable, and aligned to enterprise data policy. Educational Qualification - MS/ ME / BE / MCA / M.Tech / MS in Computer Science, Information Systems, Data Engineering, or related discipline - Advanced certification or specialization in Data Architecture, Cloud Data Platforms, Data Governance, or Analytics preferred Experience - 12+ years of experience in data architecture, data engineering, enterprise data platforms, data modeling, data warehousing, lakehouse/data lake architecture, and large-scale data integration - Proven experience designing production-grade enterprise data platforms with strong focus on performance, scalability, reliability, security, governance, and maintainability - Hands-on experience with ETL/ELT pipelines, SQL optimization, schema design, metadata management, data cataloging, data lineage, and golden data-set/reference data architecture - Experience enabling AI/ML use cases through AI-ready datasets, feature-ready data assets, data quality standards, and cloud data integration patterns including AWS SageMaker data preparation workflows - Experience with languages like python, bash/ shell scripting, Go, et. al. and data-flow management tools Key Responsibilities Data Architecture & Strategy - Define and own the enterprise data architecture, data standards, data design principles, and platform roadmap across operational, analytical, reporting, and AI/ML use cases. - Design scalable data lake, lakehouse, warehouse, and domain-aligned data product architectures that support high-volume structured and unstructured data. - Establish architectural patterns for ingestion, transformation, storage, consumption, data sharing, and interoperability across enterprise systems. - Drive architecture reviews and data design governance to ensure solutions meet enterprise data policy, security, compliance, and audit expectations. ETL/ELT, Integration & Data Pipelines - Architect robust ETL/ELT pipelines for batch, near-real-time, and event-driven data processing - Define reusable integration patterns for source-system onboarding, schema evolution, data validation, reconciliation, error handling, and operational observability. - Guide engineering teams on pipeline design for performance, fault tolerance, recovery, monitoring, and cost optimization. - Ensure pipelines maintain metadata, lineage, quality metrics, and traceability from source to curated/golden data layers. Data Modeling, Schema Design & Performance - Lead conceptual, logical, and physical data modeling across transactional, analytical, dimensional, and domain-oriented data structures. - Own schema design standards, naming conventions, data contracts, partitioning strategies, indexing approaches, and query optimization guidelines. - Optimize data models and SQL patterns for performance, concurrency, latency, scalability, and cost across databases, warehouses, and distributed data platforms. - Define standards for schema versioning, schema change impact analysis, backward compatibility, and controlled migration from legacy to modern data structures. AI Data Readiness & Golden Data-Sets - Define AI data readiness standards for completeness, consistency, provenance, explainability, quality, privacy, and usability in analytics, ML, GenAI, and agentic AI workflows. - Architect golden data-sets, canonical data models, reference data, and master data patterns to support trusted downstream reporting, automation, and AI decision support. - Partner with AI/ML teams to prepare fit-for-purpose data assets for model training, evaluation, RAG pipelines, feature engineering, and AWS SageMaker-based workflows where applicable. - Ensure structured and unstructured data assets are curated with metadata, access controls, retention rules, quality checks, lineage, and business definitions. Data Governance, Catalog, Lineage & Policy - Establish and enforce enterprise data governance standards covering data ownership, stewardship, classification, sensitivity, retention, usage, quality, and lifecycle management. - Define data catalog and business glossary practices so data assets are discoverable, well-described, classified, and reusable across product, analytics, and AI teams. - Ensure end-to-end lineage is captured across ingestion, transformation, curation, consumption, and archival stages to support auditability, compliance, and impact analysis. - Translate enterprise data policy into technical design controls, including access management, row/column-level security, encryption, masking, tokenization, and audit logging. Cloud Data Platforms & Production Readiness - Architect and govern data solutions on AWS, Azure, or hybrid cloud platforms using modern data storage, orchestration, processing, cataloging, and analytics services. - Provide architectural guidance for AWS SageMaker data preparation and AI/ML integration patterns, ensuring data assets are secure, governed, and production-ready. - Define standards for CI/CD, infrastructure-as-code alignment, data deployment practices, environment promotion, monitoring, alerting, and operational readiness. - Ensure reliability, scalability, availability, maintainability, and cost efficiency of data platforms and data pipelines