ROR Labs カバー画像:10〜100倍 誤一致
|

顔認識の誤り:研究データでわかったこと

この記事のポイント ・約13分で読めます

  • NISTが2019年に189のアルゴリズムを試験したところ、誤一致(偽陽性)の率は人口集団の間でしばしば10倍から100倍以上違いましたが、最も精度の高いアルゴリズムほど差は小さくなっていました。
  • 最良のシステムは急速に改善しました。NISTの測定では、検索の失敗率は2014年の4%から2018年には0.2%に下がりました。システムがどのくらい、誰に対して間違えるかは、運用者が決めるしきい値に大きく左右されます。
  • 英国が2023年にロンドン警視庁のライブシステムを試験したところ、しきい値0.6では通行人約6,000人に1人の誤警報で、検出率に有意な人口集団間の差はありませんでした。0.56と0.58では、黒人が誤って検知される割合が多くなりました。
  • ACLU(米国自由人権協会)は、顔認識の一致をきっかけに誤認逮捕された米国人を14人数えています。調べられた事例では、失敗はたいてい、手がかりを証拠として扱った捜査の側にありました。

2020年1月、デトロイト警察はロバート・ウィリアムズさんを、ファーミントンヒルズの自宅で妻と幼い2人の子どもの目の前で逮捕しました。デトロイトの店から腕時計を盗んだ疑いで、手がかりは監視カメラの画像を使った顔認識検索から得られたものでした。映像の男は彼ではありませんでした。2024年6月、市は彼の訴訟で和解し、30万ドルを支払うことに同意し、米国自由人権協会(ACLU)が「全米で最も厳しい」と呼ぶ警察の運用方針を採用しました。

ウィリアムズさんは、顔認識の一致をきっかけに誤認逮捕されたとACLUが数える少なくとも14人の米国人のうち、最もよく知られた一人です。同じ時期に、米国立標準技術研究所(NIST)の試験は、最も精度の高いアルゴリズムが驚くほど優秀になったことを示してきました。どちらも事実です。リスクがあるのは、その二つの間のすき間です。

この記事では、よく引用される誤り率が実際に何を測っていたのか、運用者が選ぶしきい値がなぜソフトウェアと同じくらい重要なのか、最良のシステムがどこまで改善したのか、知られている逮捕で何が間違っていたのか、機械の提案を人がどれだけ正しく確認できるのか、ロンドンでの運用が何を示しているのか、そして米国と欧州で形になりつつあるルールを見ていきます。

点描画:夕暮れの誰もいない街の歩道に背の高い街灯が並び、1本の柱の高い位置に小さなカメラが一つ取り付けられている。カメラのレンズに小さな琥珀色の光が一つ。
カメラは顔を見る。その意味を決めるのは、しきい値だ。

有名な数字が測っていたもの

この問題を世に知らしめたのは、ジョイ・ブオラムウィニとティムニット・ゲブルが2018年に発表した Gender Shades という研究です。二人は、広く使われていた二つのベンチマーク用の顔画像集の79.6%と86.2%が肌の色の明るい人だったことを示し、そのうえで各国議員の写真を肌の色と性別のバランスをとって集め、3つの商用システムを試しました。肌の色の濃い女性の誤分類率は最大34.7%でした。肌の色の明るい男性では、最も高い誤り率でも0.8%でした。

これらのシステムが何をしていたかが重要です。Gender Shades が試したのは性別の分類、つまり顔が男性か女性かを推定することで、顔を特定の人物に照合することではありません。警察が使う作業とは別のものです。それでも、この監査には効果がありました。イニオルワ・デボラ・ラジとブオラムウィニが2018年8月に同じ監査をやり直したとき、3社はいずれも7か月以内に新しい版を出しており、最も正確な集団と最も不正確な集団の差は大きく縮んでいました。元の研究に含まれていなかったアマゾンのシステムは、肌の色の濃い女性の31.4%をまだ誤分類していました。

Gender Shades:監査の前と後の差

最も正しく分類された集団と最も誤った集団の誤り率の差(パーセントポイント)。性別の分類であり、人物の照合ではない。

IBM、2017年5月34.4
IBM、2018年8月16.7
Face++、2017年5月33.7
Face++、2018年8月3.6
Microsoft、2017年5月20.8
Microsoft、2018年8月1.5

出典:Buolamwini J、Gebru T、Proceedings of Machine Learning Research 81:77–91(2018)、Raji ID、Buolamwini J、Communications of the ACM(2022)、doi:10.1145/3571151。

人物照合の問題に大規模な答えが出たのは2019年12月、NISTが人口統計学的影響に関する報告書を公表したときです。99の開発者による主に商用の189のアルゴリズムを、国務省、国土安全保障省、FBIのデータベースから集めた849万人分、1,827万枚の画像で試しました。別々の二人を同一人物と誤って判定する誤一致(偽陽性)の率は、集団の間でしばしば10倍から100倍以上違いました。女性では男性の2〜5倍高く、160万枚のFBIの逮捕写真を検索する試験では、アフリカ系米国人の女性で高くなっていました。

NISTの2019年の人口統計学的研究でわかったこと

189のアルゴリズムでの1対1と1対多の試験。結果はアルゴリズムによって大きく異なった。

誤りの種類結果
偽陽性(人種・出身別)一部の集団でしばしば10倍から100倍以上高い。西アフリカ・東アフリカ、東アジア、アメリカ先住民の人で最も高い
偽陽性(性別)女性で2〜5倍高い
偽陰性(見逃し)アルゴリズムごとの違いが大きく、差はしばしば3倍未満
中国で開発されたアルゴリズム一部は東アジア系と白人の顔の間に目立った差がなかった

出典:Grother P、Ngan M、Hanaoka K、NISTIR 8280、Face Recognition Vendor Test Part 3: Demographic Effects(2019)。

NIST自身、これを一文でまとめることには注意を促しています。報告書の筆頭著者パトリック・グローザーは「アルゴリズム全体について何かを言うのは通常は誤りだが、調べたものの大多数で人口統計学的な差の実証的な証拠を見つけた」と述べました。大多数はすべてではなく、製品間の幅は非常に大きいものでした。

誤りを決めるのは「しきい値」

顔認識システムは「はい」か「いいえ」を答えるわけではありません。類似度のスコアを出し、どこまで高ければ一致とみなすかを誰かが決めます。しきい値を低くすると本当の一致を多く見つけますが、見知らぬ人も多く拾います。高くすると誤警報は減りますが、本当の一致を見逃します。NISTは、ほとんどのシステムがすべての比較に一つの固定したしきい値を使っていると指摘しています。ある集団で別人どうしのスコアが高めに出るなら、同じ設定でもその集団では誤一致が多くなります。

つまり、一つの誤り率や一つの「バイアス」の数字は、しきい値を明示して初めて意味を持ちます。ジャクリーン・カバゾスらによる2019年の研究は、4つのアルゴリズムを東アジア系と白人の顔で試し、4つすべてで人種による偏りの大きさがしきい値によって変わることを見いだしました。同じ誤受理率にするには、東アジア系の顔のほうが高いしきい値を必要としました。それ以前のNISTの研究も、偽陽性を一定に保つのに必要なしきい値が、比べる人々の人口構成によって変わることを示しています。

そのため、同じソフトウェアを使う二つの警察でも、誤りの出方は違ってきます。候補を増やすためにしきい値を下げる警察は、誤った手がかりを増やすことを選んでいます。それが害になるかどうかは、その後に何をするか次第です。

最良のシステムはどこまで良くなったか

この技術は2010年代に劇的に変わりました。2018年、NISTは39の開発者の127のアルゴリズムを、2,660万枚の写真のデータベースで試しました。最良の検索アルゴリズムが一致する写真を見つけられなかったのは0.2%で、2014年の4%、2010年の5%から大きく下がりました。NISTはこのソフトウェアを、4年間でデータベース検索が20倍良くなったと表現しつつ、「業界全体の能力には依然として非常に大きなばらつきがある」と注意しました。

NISTの試験での最良の検索失敗率

大規模なデータベースで、首位のアルゴリズムが一致する写真を見つけられなかった検索の割合。

2010年5%
2014年4%
2018年0.2%

出典:NIST「NIST Evaluation Shows Advance in Face Recognition Software’s Capabilities」(2018年11月)。2018年の試験は127のアルゴリズム、2,660万枚の写真。

精度と公平さは結びついていることがわかりました。2020年2月の議会証言で、NISTのチャールズ・ロミンは、最も精度の高いアルゴリズムが失敗するのは検索の約0.25%だと述べ、「精度の高いアルゴリズムほど人口統計学的な影響は小さい」と説明しました。最も精度の高い1対多のアルゴリズムの一部は、集団の間でほぼ同じ偽陽性率を示しました。

2022年のNISTの追加報告は、二種類の誤りを分けて考えました。見逃しの差は主に一部の集団の撮影の悪さ、たとえば肌の色の濃い人の露出不足によるもので、より良いカメラや照明で減らせるとしています。一方、高画質の写真でも現れる、はるかに大きな偽陽性の差は、開発者が直さなければならないとしました。ガブリエラ・パンゲリナンらの2023年の研究も、画像に顔がどれだけ写っているかが精度の差を最もよく説明すると報告しています。

実験室の結果は、良い写真でのアルゴリズムの性能を示すもので、店のカメラの粗い静止画での性能ではありません。劣化させた合成顔を使った2025年のプレプリントでは、ぼけや低解像度で誤りが増え、女性や黒人の顔でより多く増えましたが、精度は多くの従来の法科学的手法を上回ったままでした。

知られている14件の誤認逮捕

点描画:淡い色の部屋で、何も置かれていない小さな机のそばに木の椅子が一脚あり、後ろには閉じた扉。机の上に琥珀色の光が一つ。
手がかりが逮捕に変わった場所。

2026年4月、ACLUは、顔認識の一致をきっかけに誤認逮捕されたことが知られている米国の14人を挙げました。そのうち3人はデトロイト警察に逮捕され、3人とも黒人でした。この一覧は最低限の数で、明るみに出た事例だけを数えています。

ポーチャ・ウッドラフさんの事例は、一致がどのように証拠に変わるかを示しています。2023年2月、妊娠8か月だった彼女はカージャックの容疑で逮捕されました。デトロイト警察はガソリンスタンドの映像を顔認識にかけ、彼女の記録写真を写真面割りに入れ、被害者が彼女を選びました。容疑は取り下げられました。2025年8月、連邦判事は、一致とは独立した相当な理由があったとして彼女の訴えを退けましたが、面割りに誰を入れるかを選んだのはソフトウェアでした。

最も新しい事例はテネシー州の女性で、2025年7月にノースダコタ州の銀行詐欺容疑で逮捕され、容疑は約6か月後に取り下げられました。彼女の訴状は、一致が監視映像ではなく、容疑者の偽造身分証の写真に対してなされたと主張しています。

2025年1月のワシントン・ポストの調査は、少なくとも8件の誤認逮捕を見つけ、そのうち7件は黒人でした。警察官は結果を「100%の一致」と書いたり、ソフトウェアが容疑者を「即座に、疑いなく」特定したと述べたりしていました。12州の15の警察で、一致の使い方が自らの基準から外れていたことも見つけています。

8件の誤認逮捕で捜査員が省いたこと

ワシントン・ポストが調べた8件のうち、警察官が基本的な手順を怠った件数。

容疑者のアリバイを確認しなかった8件中6件
重要な証拠を集めなかった8件中5件
身体的特徴の違いを無視した8件中3件
矛盾する証拠を退けた8件中2件

出典:ワシントン・ポストの調査(2025年1月)。Fortune(2025年1月16日)の要約による。

2022年に発表された米国1,136都市の研究では、警察の顔認識の利用は、黒人と白人の逮捕率の差が大きいことと関連していました。観察研究なので因果関係は示せませんが、個々の事例の傾向と一致します。被害を受けたのは圧倒的に黒人で、失敗はソフトウェアと同じくらい捜査の側にありました。

確認する人間

顔認識についての警察の方針は、どれも同じことを言っています。一致は手がかりであり、人が確認すべきものだ、と。しかし、知らない人の顔を人がどれだけ正しく確認できるかについての研究は厳しい内容です。2014年の研究では、目の前の人と身分証の写真を照合した30人の旅券担当官が10%の割合で誤り、不正な写真の14%を本人と認めました。経験年数による違いはありませんでした。

専門家はずっと優秀です。ジョナサン・フィリップスが率いた2018年の研究は、同じ難しい顔写真のペアを、57人の法科学顔鑑定官、ほかの専門家、指紋鑑定官、学生、そして4つのアルゴリズムに判定させました。最新のアルゴリズムは鑑定官の中央値をわずかに上回りました。最も良い結果は、鑑定官1人とそのアルゴリズムを組み合わせたときで、鑑定官2人の組み合わせを上回りました。ただし、どの専門家グループにも、学生の中央値を下回る人がいました。

難しい顔照合テストでの人とアルゴリズム

精度の中央値(曲線下面積。1.0は誤りなし、0.5は偶然と同じ)。

学生0.68
指紋鑑定官0.76
スーパーレコグナイザー0.83
法科学顔レビュアー0.87
法科学顔鑑定官0.93
最良のアルゴリズム(2017年)0.96
鑑定官1人+最良のアルゴリズム1.0

出典:Phillips PJ ほか、PNAS(2018)、doi:10.1073/pnas.1721355115。難しい画像ペア20組。

教訓は「人間はだめ」や「機械は優秀」よりも狭いものです。確認が役立つのは、確認する人が訓練を受けていて、確認が独立しているときです。2枚の写真をちらりと見比べる刑事や、ソフトウェアの提案をもとに作られた面割りを見せられる目撃者は、独立した確認とはまったく言えません。

ロンドンの街頭のライブカメラ

点描画:曇り空の下、誰もいない広い歩行者用の通りに白いバンが1台止まり、屋根に短いカメラのマストが立っている。マストの先端に琥珀色の光が一つ。
何千もの顔と、ほんの数件の警報。

ライブ顔認識は、事件後の検索とは仕組みが違います。カメラが通り過ぎるすべての顔をリアルタイムで監視リストと比べ、システムが検知した人を警察官が呼び止めます。2023年、英国国立物理学研究所(NPL)は、ロンドン警視庁が使うNEC製システムについて、警察の依頼による研究を公表しました。5回の運用で7,000〜38,000人の人波の中に405人のボランティアを混ぜ、約18万枚の画像の監視リストを使いました。これは当時実際に使われていたどの監視リストよりも約20倍大きいものでした。

警視庁の標準のしきい値0.6では、監視リストに載ったボランティアの89%を見つけ、通行人の約6,000人に1人を誤って検知しました。性別や民族による検出率の差は統計的に有意ではありませんでした。より低い0.56と0.58の設定では、誤警報に有意な偏りが現れ、黒人が誤って検知される割合が多くなりました。0.64以上では誤警報はありませんでした。

一つのシステム、四つの設定

2023年の英国国立物理学研究所の試験で、しきい値によって警視庁のライブシステムがどう変わったか。

しきい値試験でわかったこと
0.56と0.58誤警報に統計的に有意な偏りがあり、黒人が誤って検知される割合が多かった
0.60(標準)監視リストのボランティアの89%を検出。誤警報は約6,000人に1人。検出率に有意な人口集団間の差なし
0.62試験中の誤警報は1件だけ
0.64以上誤警報なし

出典:National Physical Laboratory、NPL Report MS 43、Facial Recognition Technology in Law Enforcement: Equitability Study(2023年3月)。アルゴリズムは NEC NeoFace V4。

小さな率でも積み重なります。6,000人に1人なら、38,000人の人波では約6件の誤警報になります。2024年9月から2025年9月までの数字として、警視庁は203回の運用、3,147,436人の顔の読み取り、2,077件の警報、962件の逮捕、10件の誤警報を報告しました。約31万5,000人に1件です。誤って検知された10人のうち8人は黒人でした。率を計算するには少なすぎますが、問題を開いたままにしておくには十分です。

デトロイト、ブリュッセル、ハーグのルール

ロバート・ウィリアムズさんとのデトロイト市の2024年の和解は、米国で最も具体的なルールを定めました。警察は、顔認識の結果だけに基づいて、また独立した証拠なしに顔認識の直後に行った写真面割りに基づいて、人を逮捕してはなりません。警察官は、有色人種と女性で誤認率が高いことを含めてこの技術について研修を受けなければならず、市は、2017年以降に顔認識検索が逮捕状につながったすべての事例を点検しなければなりません。裁判所は4年間、管轄を保持します。ACLUによると、米国の20を超える市や自治体が、警察によるこの技術の使用を全面的に禁止しています。

欧州連合(EU)はライブでの利用についてさらに踏み込んでいます。2025年2月2日から適用されているAI法第5条は、法執行目的で公共の場所においてリアルタイムの遠隔生体識別を行うことを禁じています。例外は、誘拐や人身取引の特定の被害者の捜索、生命への具体的で差し迫った脅威の防止、重大犯罪の容疑者の所在特定に厳密に必要な場合だけで、それぞれの利用には裁判官または独立した機関の事前の許可が必要です。同法は、インターネットや監視カメラの画像を無差別に収集して顔認識データベースを作ることも禁じています。

この最後のルールは、Clearview AI の事業モデルそのものです。2024年9月、オランダのデータ保護当局は、同意なしに300億枚を超える写真のデータベースを作ったとして、同社に3,050万ユーロの制裁金を科したと発表しました。違反を続けた場合はさらに最大510万ユーロが科されます。ほかの欧州の規制当局もすでに同社に制裁金を科していました。当局のアレイド・ウォルフセン委員長は「顔認識は非常に侵襲的な技術であり、世界中の誰にでも勝手に使ってよいものではない」と述べました。

根拠から言えること

根拠がほかよりしっかり支えているのは三つの点です。第一に、誤り率は「顔認識」一般の性質ではなく、特定のアルゴリズム、画像、しきい値の性質です。最良のアルゴリズムは非常に正確で、人口集団間の差も最も小さくなっています。第二に、集団間の差は見逃しより偽陽性ではるかに大きく、知られている誤認逮捕で被害を受けたのは圧倒的に黒人でした。第三に、それらの逮捕は、独立した裏づけなしに候補者を容疑者として扱った捜査の後に起きました。より良いソフトウェアは一つ目の問題を減らします。三つ目を直せるのは手続きだけです。

よくある質問

顔認識は黒人や女性に対して偏っていますか?

NISTが2019年に試験した多くのアルゴリズムでは、黒人やアジア系の人、女性など一部の集団で偽陽性率が高くなっていました。最も精度の高いアルゴリズムでは、差はずっと小さくなっていました。

警察の顔認識はどのくらい正確ですか?

アルゴリズム、写真、しきい値によります。NISTの試験で最良のアルゴリズムは、2018年に大規模なデータベースの検索の約0.2%で一致を見逃しましたが、質の悪い監視映像では精度が下がります。

顔認識のせいで誤認逮捕された人は何人いますか?

ACLUは2026年4月までに米国で14件を数えています。すべての誤認が公になるわけではないので、これは最低限の数です。

欧州ではライブ顔認識は合法ですか?

EUのAI法は、事前の許可を得たうえでの、厳しく限定された重大な場合を除き、警察が公共の場でリアルタイムの識別を行うことを禁じています。英国はこの法律に縛られず、ロンドン警視庁はライブシステムの運用を続けています。

誤認されたと思ったらどうすればいいですか?

顔認識が使われたか、どんな独立した証拠があるかを尋ね、弁護士に相談してください。ワシントン・ポストの調査では、8件の誤認逮捕のうち6件でアリバイが確認されていませんでした。

まとめ

  • NISTが2019年に189のアルゴリズムを試験したところ、誤一致(偽陽性)の率は人口集団の間でしばしば10倍から100倍以上違いましたが、最も精度の高いアルゴリズムほど差は小さくなっていました。
  • 最良のシステムは急速に改善しました。NISTの測定では、検索の失敗率は2014年の4%から2018年には0.2%に下がりました。システムがどのくらい、誰に対して間違えるかは、運用者が決めるしきい値に大きく左右されます。
  • 英国が2023年にロンドン警視庁のライブシステムを試験したところ、しきい値0.6では通行人約6,000人に1人の誤警報で、検出率に有意な人口集団間の差はありませんでした。0.56と0.58では、黒人が誤って検知される割合が多くなりました。
  • ACLU(米国自由人権協会)は、顔認識の一致をきっかけに誤認逮捕された米国人を14人数えています。調べられた事例では、失敗はたいてい、手がかりを証拠として扱った捜査の側にありました。
  • 訓練を受けた人も確実な安全網ではありません。旅券担当官は不正な写真の14%を本人と認めました。デトロイトは一致だけに基づく逮捕を禁じ、EUは公共の場でのリアルタイム識別を制限しています。

この記事は、公表された研究、公的機関の評価、報道を一般的な情報として要約したもので、法的な助言ではありません。警察の本人特定に関わることになった場合や、自分の画像の使われ方に不安がある場合は、資格のある弁護士や各国のデータ保護当局に相談してください。

さらに読む:アルゴリズムごとの人口統計学的な結果の全体は Grother、Ngan、Hanaoka、NISTIR 8280(2019)。ライブシステムがしきい値によってどう振る舞うかは National Physical Laboratory、NPL Report MS 43(2023)。人と機械の顔照合の比較は Phillips ほか、PNAS(2018)。

おすすめの3冊
  • Unmasking AI、Joy Buolamwini(2023)。Gender Shades の研究者自身が、監査がどう始まり、その後何が起きたかを書いた本。偏ったテストデータが誤りを隠す仕組みがよく分かりますが、回想録であり主張の書で、中立的な総説ではありません。
  • Your Face Belongs to Us、Kashmir Hill(2023)。記者が Clearview AI と、数十億枚の写真の収集の歴史を追った本。データベースがどう作られ使われたかの取材は充実していますが、精度試験の説明は手薄です。
  • Race After Technology、Ruha Benjamin(2019)。社会学者が、新しい技術が古い不平等をどう再生産しうるかを論じた本。誤認逮捕の事例を考える枠組みとして役立ちますが、一つの立場を主張する本で、NISTの新しい結果より前に書かれています。

参考文献

  1. Buolamwini J, Gebru T. Gender Shades. Proceedings of Machine Learning Research 81:77–91 (2018).
  2. Raji ID, Buolamwini J. Actionable Auditing Revisited. Communications of the ACM (2022), doi:10.1145/3571151.
  3. Grother P, Ngan M, Hanaoka K. NISTIR 8280, Face Recognition Vendor Test Part 3: Demographic Effects (2019).
  4. NIST, “NIST Study Evaluates Effects of Race, Age, Sex on Face Recognition Software” (December 2019).
  5. Cavazos JG, Phillips PJ, Castillo CD, O’Toole AJ. arXiv:1912.07398 (2019).
  6. O’Toole AJ et al. NISTIR 7757 (2011), doi:10.6028/NIST.IR.7757.
  7. NIST, “NIST Evaluation Shows Advance in Face Recognition Software’s Capabilities” (November 2018).
  8. Romine CH, NIST congressional testimony on facial recognition technology (6 February 2020).
  9. Grother P. NISTIR 8429, FRVT Part 8 (2022), doi:10.6028/NIST.IR.8429.ipd.
  10. Pangelinan G et al. arXiv:2304.07175 (2023).
  11. Cuellar M, To HK, Mehrotra A. arXiv:2505.14320 (2025, preprint).
  12. ACLU, “More than a Dozen Wrongful Arrests Due to Police Reliance on Facial Recognition Technology” (14 April 2026).
  13. ACLU of Michigan, press release on the Williams v. City of Detroit settlement (28 June 2024).
  14. Fortune, Detroit settlement (29 June 2024) and Washington Post investigation summary (16 January 2025).
  15. CBS Detroit, Woodruff ruling (August 2025).
  16. Valley News Live, Fargo wrongful-arrest lawsuit (15 September 2026).
  17. Johnson TL et al. Government Information Quarterly (2022), doi:10.1016/j.giq.2022.101753.
  18. White D, Kemp RI, Jenkins R, Matheson M, Burton AM. PLoS One (2014), doi:10.1371/journal.pone.0103510.
  19. Phillips PJ et al. PNAS (2018), doi:10.1073/pnas.1721355115.
  20. National Physical Laboratory, NPL Report MS 43 (March 2023).
  21. The Register, Met live facial recognition figures (3 November 2025).
  22. EU Artificial Intelligence Act, Article 5 (prohibitions applying from 2 February 2025).
  23. Library of Congress Global Legal Monitor and NL Times on the Dutch DPA Clearview fine (2024).

類似投稿