仕事内容と成果
- 評価メトリクス、ベンチマーク、評価データセットを設計する。
- 自動評価をCI/CDに組み込み、変更による品質低下を検知する。
- 安全性テストと統計分析を行い、開発チームへ改善材料を返す。
目指す状態:モデルやプロンプトの変更を、品質と安全性の根拠を持って判断できるようにする。
経験の接点
以下は経験を整理するための軸であり、採用要件ではありません。
ある求人例の要件
職種全体の要件ではなく、公開情報で確認した個別の例です。
- JAPAN AIの例では、LLMまたは生成AIの評価手法、統計学・実験計画法、PythonでのMLまたは評価パイプライン構築を必須条件としている。
- 同求人はMLエンジニア、データサイエンティスト、リサーチエンジニア、またはML評価関連職種で3年以上の実務経験を必須条件としている。
- JAPAN AI: AI Evaluation Scientist 参考 確認日:2026-09-09。求人例の確認(2026-09-09)。生成AIの評価科学と評価パイプラインを扱う国内求人例。仕事内容の参考例であり、継続募集は保証しません。
応募前に準備すること
- 01
評価対象を具体化する
正しさ、安全性、タスク成功など、何を測るかと測れない理由を分けて書く。
- 02
比較可能な評価を実装する
固定データ、期待値、集計方法を用意し、変更前後の差を再現可能にする。
- 03
統計の前提を確認する
サンプルの偏り、比較方法、判断の限界を説明できる分析を行う。
面談で確認する質問
- 評価指標は人間の判断とどのように照合していますか。
- 品質ゲートを通過できない変更は、誰がどの根拠で判断しますか。
- 安全性評価と通常の機能品質評価は、どこまで同じ基盤で扱いますか。