
テクマトリックス、生成AI品質評価ツール「GENFLUX Evaluation」販売開始
公開日:
テクマトリックスは2026年10月8日、Elithが提供する生成AI品質評価ツール「GENFLUX Evaluation」の販売を開始しました。生成AI、RAG、AIエージェントを対象に、回答の正確性や参照情報との整合性、安全性などを評価します。テスト質問の生成から回答収集、評価結果の可視化までを一つの環境で扱い、モデルやプロンプト変更後の比較に使えます。業務固有の評価基準の設計や、システム接続・カスタマイズをエンジニアが支援します。
ポイント
- 1テクマトリックスがElithの生成AI品質評価ツールを10月8日から販売
- 2RAGやAIエージェントの回答品質を評価し、モデル変更前後を同じテストで比較
- 3攻撃テストと業務別の評価設計・接続支援で、運用上の弱点を検証
販売開始の背景
生成AIアプリケーションでは、回答品質のばらつきや事実に基づかない回答、機密情報の露出などが課題になります。モデル、プロンプト、RAGの参照文書を変更すると、回答の挙動も変わる場合があります。
テクマトリックスは、生成AIの品質を継続的に測定・比較する評価ツールとして、ElithのGENFLUX Evaluationを販売します。両社の販売代理店契約と、導入・カスタマイズ支援を含む提携の第一弾です。
GENFLUX Evaluationの主な機能
GENFLUX Evaluationは、RAG、チャットボット、AIエージェントなどの回答品質を評価するプラットフォームです。正確性、質問との関連性、参照情報との整合性に加え、不適切な出力、機密情報の漏えい、社内ルールへの適合性などを確認します。
テスト質問の生成、回答収集、評価、結果の可視化を一つの環境で行います。スコアと個別回答を参照し、問題があるケースを特定します。モデルやプロンプト変更後も同じテストで評価し、改善効果や品質低下を比較できます。
レッドチーミングとカスタマイズ支援
レッドチーミングは、攻撃を想定して弱点を探すテストです。悪意のある指示でAIの動作を誘導するプロンプトインジェクションや、安全上の制約の回避を狙う脱獄などを検証します。通常の利用テストと攻撃テストを組み合わせ、意図しない回答や情報漏えいにつながる弱点の発見を支援します。
標準テンプレートに加え、エンジニアが業務に合わせた評価設計、システム接続、カスタマイズを支援します。業界用語、社内規程、利用シナリオを評価に反映し、顧客固有のレッドチーミングや導入環境に合わせた構築にも対応します。
出典: テクマトリックス(PR TIMES掲載の攻撃シナリオ別評価画面。スコアは評価例で、安全性を保証する数値ではありません)
販売・出荷と導入支援
販売開始日と出荷開始予定日は、いずれも2026年10月8日です。テクマトリックスとElithは、製品提供に加え、評価設計や導入・カスタマイズ支援を行います。具体的な料金や利用プランは、今回の発表内では示していません。
Q&A
Q. GENFLUX Evaluationとは何ですか?
A. 生成AIやRAG、AIエージェントの回答品質と安全性を評価するツールです。スコアと個別回答から問題があるケースを確認できます。
Q. レッドチーミングでは何を調べますか?
A. プロンプトインジェクションや脱獄を想定した攻撃テストで、意図しない回答や情報漏えいにつながる弱点を検証します。
Q. 自社の業務に合わせた評価もできますか?
A. エンジニアが業界用語、社内規程、利用シナリオを反映した評価基準の設計、システム接続、カスタマイズを支援します。
関連リンク

O!Productニュース編集部からのコメント
モデルを更新した後も同じテストで比較できると、社内のAIアプリの変更確認に使いやすそうです。スコアだけでなく個別回答も見られるので、修正箇所を探す場面で役立ちそうですね。
引用元:PR TIMES
この記事の著者
O!Productニュース編集部

