About this role
Operate AssureAI's Trustworthiness evaluation pillar by building and running evaluation datasets and suites (bias, toxicity, red-team, explainability) for Gemini-based agents. Maintain CI/CD threshold gates, package audit evidence for reviews, track dataset coverage, and triage failing checks to appropriate owners.
Skills for this role
AssureAIEvaluation DatasetsRed-TeamingBias/fairness testingExplainabilitySHAPLIMEThreshold GatesCI/CDAudit EvidencePythonDeepEvalRagasPromptfooGemini EnterpriseADK agentsRAG evaluationProvenanceToxicity testingCloud BuildGitHub ActionsEU AI ActNIST AI RMFISO/IEC 42001Adversarial-prompt methodologyAI assurance