「テスト設計にかかる膨大なコストを、生成AIで劇的に削減できないだろうか?」 昨今、開発現場で耳にすることが増えたAI活用の期待。しかし、高度な知識を要するテスト設計において、AIは本当に人間の思考を補完できるのでしょうか。 先日開催された第7回社内勉強会では、QAユニットのTさんが登壇。「生成AIはQAの救世主か、ただの『ケース量産機』か?」と題し、ChatGPT、Gemini、Copilotという3つの代表的な生成AIを用いて、実践的なテストケース作成の検証結果を発表しました。 AIは完璧なアシスタントになれるのか、それとも人間の目が必要不可欠なのか。現場のQAエンジニアがリアルな仕様書を使って挑んだ、検証のエッセンスをお届けします。

1. QAエンジニアが直面する「コスト削減」と「複雑化する仕様」
最近の開発現場では、工数削減やプロセスの効率化が強く求められています。その中で、仕様の把握から複雑な組み合わせの考慮まで、高度な知識が必要とされる「テスト設計」の負荷をいかに下げるかが大きな課題となっています。 Tさんは、AIを「完璧な計算機として手足のように扱う」ためには、まずAIの強みと弱みを正しく理解する必要があると考えました。そこで今回の検証では、あえて「暗黙の前提」や「未確定な仕様」が含まれた「手荷物預かり用スマートロッカー」の複雑な仕様書を用意。これをAIに読み込ませ、テストケースの作成精度(網羅性と深さ)を測るという実践的なアプローチをとりました。
2. 3大生成AI(ChatGPT / Gemini / Copilot)の個性を丸裸に
同一のプロンプトと条件(30件のケース出力、正常系・異常系・境界値・セキュリティ観点の指定など)を与えた結果、各AIには驚くほど明確な「個性」が現れました。
- ChatGPT:仕様書に忠実な「優等生」
指示された観点をきれいに分類し、基本的なフローや一般的なエラーケースの網羅性が非常に高い結果となりました。一方で、非同期処理のタイミングによる競合など、行間を読むような複雑なケースの生成には弱い傾向が見られました。
- Gemini:文脈を読み解く「探索者」
時間操作や状態遷移の境界値テストに優れ、仕様書の隠れた意図(未記載だった延長状態など)までピックアップする深読み能力を発揮しました。想定外のセキュリティ観点を提示する鋭さを見せました。
- Copilot:リスクを警戒する「守護神」
決済やシステムの根幹に関わる、不具合発生時のリスクが高い観点を優先的に出力しました。純粋な仕様確認よりもシステムの堅牢性を重視するお堅い傾向があり、ユーザビリティの考慮がやや薄い結果となりました。
3. 万能ツールではない? AIが引き起こす「ハルシネーション」の罠
検証を通して浮き彫りになったのは、AIは「万能ツール」ではないという事実です。 質疑応答の中でTさんは、「一見それっぽく取り繕って回答するハルシネーション(もっともらしい嘘)を起こすことがある」と指摘しました。また、プロンプトでやり取りを重ねるうちに情報が混ざり、意図しない方向へ出力が寄ってしまう特性についても議論が交わされました。 QA初心者がAIに設計を丸投げできるかという質問に対しては、「現状は仕様を完全に把握し、QAの知識を持った人間でないと、AIの嘘を見抜けず飲まれてしまう」と、使い手のスキルの重要性が語られました。
4. 人とAIの「協調アプローチ」が創る新しいテスト設計
それでは、AIはQAの現場でどう活かせるのでしょうか。 Tさんが導き出した結論は、「AIを設計の土台とし、人間の深い洞察を掛け合わせる『協調アプローチ』が今後の鍵になる」というものでした。 仕様の網羅的な洗い出しや、基本的なテスト観点の迅速な適用にはAIを活用し、大幅なコスト削減を狙う。そして、複数のAIの出力を混ぜ合わせてベースを作り、人間は「非同期処理の競合」や「複雑な割り込み操作」など、AIが苦手とする探索的テストやリスクベースの思考に注力する。 AIをただの「ケース量産機」にするか、「救世主」に昇華させるかは、私たち人間の「AIを操る設計力」にかかっているのです。
編集後記
毎週水曜日に開催されている社内勉強会。今回はQAユニットのTさんによる、実際の開発現場ですぐに活かせるAI比較検証の素晴らしいセッションでした。
AIの進化を恐れるのではなく、それぞれの特性(弱点も含めて)を冷静に分析し、自分たちの視野を広げるツールとして使いこなそうとする姿勢は、当社の技術探求カルチャーを体現していると感じました。
当社では現在、最新技術を活用しながら、共にプロダクトの品質と組織を成長させていく仲間を募集しています。このような技術交流や実践的な課題解決にワクワクした方は、ぜひ採用ページもご覧ください!