Responsibilities
-Build and optimize data pipelines for AIGC (Generative AI) workflows, including data collection, cleaning, annotation, augmentation, and quality evaluation.
-Develop and maintain high‑quality datasets to support training, fine‑tuning, and evaluation of large models (LLMs, diffusion models, multimodal models).
-Design scalable and efficient data processing frameworks to improve throughput, stability, and reliability.
-Collaborate closely with AI/ML engineers to understand model training requirements and develop data strategies (sampling, distribution control, alignment data, RLHF data, etc.).
-Establish data quality monitoring systems and continuously improve data standards, governance processes, and security practices.
-Research and apply advanced data augmentation and synthetic data generation techniques to enhance model performance.
-Support AIGC product development with data‑related tasks, including prompt optimization and inference‑time data improvements.