About this role
Research and develop a multimodal controllable video generation framework supporting inputs such as keyboard, controller, trajectory, and voice; design control modules for camera, motion, posture, and multi-player collaborative control and collaborate with engine/agent teams to integrate controllable signals and optimize with Reinforcement Learning post-training.
Skills for this role
Computer VisionDeep LearningConditional Generation ModelsMultimodal GenerationDiffusion ModelsCamera ControlTrajectory ControlPosture ControlMulti-player Collaborative ControlMulti-channel ControlGame Engine Input/Output LogicFrame SynchronizationPythonPyTorchReinforcement LearningReal-time Video GenerationGame AILow-latency System Design