人工知能と機械学習は、いわゆる第4次産業革命の最前線にある技術です。人類の歴史が始まって以来、人間は生活と仕事の効率性を向上させるために努力してきました。当初、人間は単純な手作業と創意工夫に頼っていました。ピラミッド、万里の長城、ストーンヘンジといった建造物は、このようにして人類によって生み出されたと考えられています。その後、機械化、蒸気、水力といった技術が導入され、生産、移動、都市化が進展した第1次産業革命が起こりました。第2次産業革命は、大量生産と電気の発明によって火がつきました。電子技術とデジタル技術の導入は第3次産業革命を象徴し、コンピュータやインターネットなどが誕生しました。今日、私たちは人工知能と機械学習の飛躍的な進歩と実用化によって可能になった新たな時代に突入しています。
人間対機械
人工知能は、日常的なタスクを実行するために必要な時間、費用、人間の知能を大幅に削減することで、人間の業務の効率化を支援することを目的としています。簡単に言えば、コンピューターに自己学習機能が与えられ、過去と現在の情報に基づいて結果を正確に予測し、パターンを識別し、自動的に調整できるようになります。機械は、場合によっては、より効率的で、人類と同じくらい賢くなり始めます。
コンピューターが特定のタスクを実行する際に人間と同等(あるいはそれ以上)に賢くなる可能性は、「人間対機械」の議論を引き起こします。信念が何であれ、人間にはコンピューターには決してない感情、直感、本能があるということに私たち全員が同意できます。
人工知能について議論するとき、どの機械学習のカテゴリーやアルゴリズムが最適かについてよく議論されます。機械学習アルゴリズムは、一般的に、ラベル (ラベル付きデータ) に関する事前知識のない教師なし学習、ラベル (ラベル付きデータ) に関するある程度の知識がある教師あり学習、および 3 つのタイプの中間にある強化学習の XNUMX つのタイプに分類されます。これらのカテゴリーには、KNN、K 平均法、決定木、SVM、人工ニューラル ネットワーク、Q 学習など、より具体的なアルゴリズムがあります。では、どれが優れているのでしょうか。人生のあらゆることと同様に、すべてには長所と短所があり、機械学習に関しては、モデル自体について議論するのではなく、データの品質について議論する傾向があります。機械学習モデルはデータに基づいて実行され、適切な量と品質のデータとデータの種類がなければ、理論上はどれほど優れていても、機械学習モデルは役に立たなくなる可能性があります。これは、適切な機械学習アルゴリズムを選択することの影響を弱めるものではありません。特定のユースケースを解決するには、データとアルゴリズムが相互に補完する必要があります。
データは最も重要
Stellar Cyberでは、創業当初から、データ、それも大量のデータ、そして何よりも重要なのは、侵害検出の問題を解決するために適切な種類のデータを収集することを最優先の使命としてきました。収集したデータは、重複排除、正規化、その他様々な処理によってサニタイズします。次に、脅威インテリジェンス、ファイルダウンロードの状況、IPアドレスの地理的位置など、他の情報とデータを関連付けます。この情報付加により、データセット全体に適切なコンテキストが付与されます。このプロセスを経て、コンテキストが付加されたクリーンなデータが得られます。これらの重要なタスクが完了してから初めて、機械学習を実行します。
限定されたデータと完全なデータを持つ AI
銀行がクレジットカード詐欺を検出する方法の例を詳しく見てみましょう。顧客が普段はカリフォルニア州サンノゼでのみクレジットカードを使用していて、初めて日本の東京に旅行し、このカードを使おうとした場合、一部の銀行はそれを異常としてフラグ付けし、クレジットカードを無効にします。これにより、販売店からカードが拒否されたと伝えられると、顧客は恥ずかしさを感じ、イライラすることがよくあります。これは確かに「機械学習」による異常かもしれませんが、カードの正当な使用である可能性があるため、クレジットカードを無効にする必要はありません。
上記の問題の根本は、通常、データ自体が単一 (カード使用の場所のみ) であり、カードが最後に使用された時間、使用された場所、または使用方法などのコンテキストが欠如していることにあります。システムが時間、場所、場所間の距離、場所の評判、または使用方法 (カード端末または Web サイトなど) などの他の情報を相関させることができれば、機械学習アルゴリズムは実際の不正をより正確に判断できます。
別の例として、カリフォルニア州サンノゼで午後4時(太平洋標準時)にカードが使用され、その後同日午後5時(太平洋標準時)にウクライナの小さな都市で再び使用されたカードを考えてみましょう。この場合、不正利用の可能性は前の例よりもはるかに高くなります。このような結論に至るための関連データは、サンノゼでの使用後、ウクライナまで移動するのにかかる時間と、ウクライナの小さな都市(評判の悪い、あまり人が訪れない小さな都市)でのカードの使用です。
閉会の辞
これは、人間が実行し、問題を解決するためにそのデータを分析するのに飽きてしまうような、大量のデータを伴う反復的なタスクを完了するのに、人工知能が非常に役立つことを示しています。しかし、このテクノロジーは人間に取って代わるでしょうか? 私はそうは思わないようです。AI は反復的なタスクの解決で 90% 以上を達成できるかもしれませんが、問題に対する最終決定を下すには常に 10% 以上の労力が必要になります。さらに、他の効率化の進歩と同様に、解放された時間を再利用して、以前よりもさらに多くの作業を行うことができます。ある機械学習アルゴリズムは他のアルゴリズムよりも優れているのでしょうか? その答えは、解決しようとしている問題を理解することにあると私は信じています。また、データの品質はアルゴリズム自体と同じくらい重要であるとも信じています。
ジョン・ピーターソン
SVP 製品ライン管理
Stellar Cyber


