中小企業診断士 経営情報システム 応用編(16〜20問)|データ分析とAI

【本問題についてのご注意】
オリジナル演習問題です(実際の過去問ではありません)。生成AIで作成し、複数のAIで相互検証していますが、誤りが含まれる可能性があります。公式テキスト・過去問と併用してください。
→ 免責事項の詳細

問16:予測モデルのタスクに関する記述として、最も適切なものはどれか。

  • A:回帰は対象をあらかじめ定めたカテゴリのいずれかに振り分けるタスクである。
  • B:分類は連続的な数値そのものを予測するタスクで、売上金額の予測などに用いられる。
  • C:決定木は数値計算専用のモデルで、条件分岐による分類・回帰には利用できない。
  • D:分類はカテゴリを予測するタスク、回帰は連続的な数値を予測するタスクであり、決定木は両方に用いられる。
【第16問:正解と解説】

正解:D

・A
【論点】分類はカテゴリ(離散値)の予測、回帰は連続値の予測である。決定木は条件分岐により分類・回帰の双方に利用できる。タスクの種類とモデルの適用範囲を区別する。【考え方】予測対象がカテゴリか連続値かで分類と回帰を区別する。決定木が両タスクに使える点を押さえ、分類と回帰の説明を入れ替える誤りに注意する。【選択肢解説】カテゴリに振り分けるのは分類であり、回帰の説明として誤り。

・B
【選択肢解説】連続的な数値を予測するのは回帰であり、分類の説明として誤り。

・C
【選択肢解説】決定木は条件分岐で分類・回帰に利用でき、利用できないという記述が誤り。

・D
【選択肢解説】分類はカテゴリ予測、回帰は数値予測で決定木は両方に用いられ正しい。

関連過去問:分類と回帰(H29類似)


問17:データマイニングのバスケット分析に関する記述として、最も適切なものはどれか。

  • A:バスケット分析は同時に購入されやすい商品の組み合わせを見つけ、支持度や信頼度などの指標で評価する。
  • B:支持度とは、ある商品Aを買った人のうち商品Bも買った人の割合を表す指標である。
  • C:バスケット分析は個々の顧客の年齢や性別だけを分析し、商品の組み合わせは一切扱わない手法である。
  • D:信頼度は全取引のうち商品AとBが同時に含まれる取引の割合を表し、条件付き確率とは無関係である。
【第17問:正解と解説】

正解:A

・A
【論点】バスケット分析は同時購入されやすい商品の組み合わせ(アソシエーション)を発見する手法で、支持度(同時出現の割合)・信頼度(条件付き確率)・リフト値などで評価する。各指標を区別する。【考え方】バスケット分析が商品の組み合わせを扱う点、支持度と信頼度の定義を押さえる。支持度と信頼度を取り違えたり、顧客属性のみの分析と混同したりしないことが要点となる。【選択肢解説】バスケット分析は同時購入の組み合わせを支持度・信頼度等で評価し正しい。

・B
【選択肢解説】商品Aを買った人のうちBも買った割合は信頼度であり、支持度の説明として誤り。

・C
【選択肢解説】バスケット分析は商品の組み合わせを扱うため、組み合わせを一切扱わないという記述が誤り。

・D
【選択肢解説】信頼度は条件付き確率に基づく指標であり、無関係という記述が誤り。

関連過去問:バスケット分析(H26類似)


問18:データ前処理に関する記述として、最も適切なものはどれか。

  • A:データクレンジングとは、元データを一切変更せずそのまま分析にかける方針を指す用語である。
  • B:データクレンジングは表記のゆれや重複、誤りを修正してデータの品質を高める前処理である。
  • C:欠損値は常に0で埋めるのが唯一正しい方法であり、平均値補完や除外などの選択肢は存在しない。
  • D:外れ値はどのようなデータでも必ず誤りであるため、発見次第すべて無条件に削除すべきである。
【第18問:正解と解説】

正解:B

・A
【論点】データクレンジングは表記ゆれ・重複・誤りの修正でデータ品質を高める前処理である。欠損値には除外・平均値補完など複数の対処法があり、外れ値も文脈に応じて扱う。前処理の考え方を区別する。【考え方】クレンジングがデータ品質を高める処理である点、欠損値・外れ値の扱いに複数の選択肢がある点を押さえる。単一の唯一解として断定する記述や、無条件削除の是非に注意する。【選択肢解説】クレンジングはデータを修正する前処理であり、一切変更しないという記述が誤り。

・B
【選択肢解説】データクレンジングは表記ゆれや重複・誤りを修正し品質を高める前処理であり正しい。

・C
【選択肢解説】欠損値の対処には除外や平均値補完などがあり、0で埋めるのが唯一という記述が誤り。

・D
【選択肢解説】外れ値が必ず誤りとは限らず、無条件削除すべきという記述が誤り。

関連過去問:データ前処理(H28類似)


問19:データの可視化に関する記述として、最も適切なものはどれか。

  • A:ヒストグラムは時系列データの推移を折れ線で表す図で、データの分布を見る用途には適さない。
  • B:箱ひげ図は2変数の相関の強さを点の散らばりで表す図で、四分位数は表現できない。
  • C:箱ひげ図は四分位数や中央値、外れ値などを1つの図で表し、データの分布やばらつきの把握に適する。
  • D:散布図はデータを階級に分けて度数を棒の高さで表す図で、2変数の関係の把握には用いない。
【第19問:正解と解説】

正解:C

・A
【論点】ヒストグラムは度数分布(分布の形)、箱ひげ図は四分位数・中央値・外れ値(ばらつき)、散布図は2変数の関係を表す。各図が何を表現するのに適するかを区別する。【考え方】各グラフが分布・ばらつき・2変数関係のどれを表すのに向くかを押さえる。ヒストグラム・箱ひげ図・散布図の役割を取り違えないことが要点となる。【選択肢解説】ヒストグラムは分布を見る図であり、時系列推移の折れ線で分布に不適という記述が誤り。

・B
【選択肢解説】箱ひげ図は四分位数を表せるため、相関を表し四分位数を表現できないという記述が誤り。

・C
【選択肢解説】箱ひげ図は四分位数・中央値・外れ値を表しばらつきの把握に適し正しい。

・D
【選択肢解説】階級ごとの度数を棒で表すのはヒストグラムであり、散布図の説明として誤り。

関連過去問:データ可視化(H27類似)


問20:モデル評価と特徴量に関する記述として、最も適切なものはどれか。

  • A:次元削減は特徴量の数を増やして情報量を最大化する処理で、計算量は必ず増加する。
  • B:AUCは値が小さいほど分類性能が高いことを示し、0に近いほど理想的な分類器である。
  • C:ROC曲線は学習の進捗を時系列で表す曲線で、分類性能の評価には用いられない。
  • D:ROC曲線は分類のしきい値を変えたときの性能を表し、その下の面積であるAUCは1に近いほど高性能を示す。
【第20問:正解と解説】

正解:D

・A
【論点】次元削減は特徴量を減らして本質的情報を保つ処理、ROC曲線はしきい値による性能変化を表し、AUC(曲線下面積)は1に近いほど高性能である。各概念を正確に区別する。【考え方】次元削減が特徴量を減らす処理である点、AUCが1に近いほど良い点、ROC曲線が分類性能の評価に使われる点を押さえる。数値の大小の向きや役割を逆にする記述に注意する。【選択肢解説】次元削減は特徴量を減らす処理であり、増やして計算量が必ず増加するという記述が誤り。

・B
【選択肢解説】AUCは1に近いほど高性能であり、小さいほど高性能という記述が誤り。

・C
【選択肢解説】ROC曲線は分類性能の評価に用いる曲線であり、学習進捗の時系列で評価に使わないという記述が誤り。

・D
【選択肢解説】ROC曲線はしきい値変化に対する性能を表しAUCは1に近いほど高性能で正しい。

関連過去問:モデル評価(H30類似)


コメント

タイトルとURLをコピーしました