人工智能入门

人工智能和机器学习是引领所谓“第四工业革命”的前沿技术。自人类诞生以来,人们就不断努力提高生活和工作的效率。起初,人类依靠简单的体力劳动和智慧。我们相信,正是凭借这种能力,人类才建造了金字塔、长城和巨石阵等奇迹。随后,第一次工业革命到来,机械化、蒸汽动力和水力发电的出现,推动了生产、交通和城市化的进步。第二次工业革命的兴起,源于大规模生产和电力的发明。电子和数字技术的引入,以及计算机和互联网等技术的出现,标志着第三次工业革命的到来。如今,人工智能和机器学习的巨大进步及其在实际应用中的广泛应用,正引领我们迈入一个全新的时代。

 

人与机器

人工智能旨在通过显着减少执行日常任务所需的时间,金钱和智能,来帮助人们更有效地运作。 简而言之,为计算机提供了自学习功能,以便它们可以根据过去和当前的信息准确地预测结果,识别模式并自动进行调整。 在某些情况下,机器开始变得更加高效和智能。

 

在执行某些任务时,计算机变得像人类一样聪明(甚至比人类聪明)的潜力引发了“人与机器”的争论。 无论人们相信什么,我们都可以同意的一件事是,人类拥有了计算机可能永远不会拥有的东西:情感,直觉和直觉。

 

当人们辩论人工智能的话题时,他们常常会争论哪种机器学习类别或算法是最好的。 机器学习算法通常分为3种类型,在没有标签(标签数据)先验知识的情况下是无监督的,在有标签(标签数据)知识的情况下监督的,以及在这两种类型之间的强化。 这些类别中有更具体的算法,例如KNN,K-means,决策树,SVM,人工神经网络,Q学习等。那么,哪个更好? 嗯,就像生活中的任何事物一样,一切都有优点和缺点,并且在机器学习方面,我倾向于不争论模型本身,而是将对话重定向到数据质量。 机器学习模型基于数据运行,并且没有适当数量和质量的数据以及数据类型,因此无论从理论上讲多么好,机器学习模型都将变得无用。 这不会减少选择正确的机器学习算法的影响。 数据和算法必须相互补充才能解决特定的用例。

 

数据是参数

Stellar Cyber​​,我们公司成立之初的首要任务就是收集数据——海量数据——更重要的是,收集正确的数据类型,以解决入侵检测问题。数据收集完成后,我们会对其进行清理,包括去重、规范化以及其他一系列操作。接下来,我们会将数据与其他信息关联起来,例如威胁情报、文件下载行为、IP 地址的地理位置等等。这种信息丰富化能够更好地理解整个数据集的上下文。最终,我们会得到包含丰富上下文信息的干净数据。只有在完成这些重要步骤之后,我们才会进行机器学习。

 

AI与有限的VS完整的数据

让我们仔细看看银行如何执行信用卡欺诈检测的示例。 如果客户通常仅在加利福尼亚州圣何塞使用其信用卡,而第一次前往日本东京并尝试使用此卡,则某些银行会将其标记为异常并停用该信用卡。 当商人告诉他们信用卡被拒绝时,这常常使顾客感到尴尬和沮丧。 尽管这确实可能是“机器学习”异常,但它可能无法保证停用信用卡,因为这可能是卡的合法使用。

 

上述问题的根源通常会浮出水面,因为数据本身是唯一的(仅使用卡的位置)并且缺乏上下文,例如上次使用卡的时间,使用的位置或使用方式。 如果系统要关联其他信息,例如时间,位置,位置之间的距离,位置的信誉或其使用方式(例如,卡终端或网站),则机器学习算法可以更好地确定实际欺诈行为。

 

再举一个例子,假设一张卡在太平洋标准时间下午 4 点于加利福尼亚州圣何塞使用,然后当天下午 5 点又在乌克兰的一个小城市使用。这种情况的欺诈概率远高于前一个例子。得出此类结论的相关数据包括:从圣何塞使用到乌克兰所需的旅行时间以及在乌克兰一个偏僻小城市(通常人迹罕至)使用该卡的时间。

 

结束语

这说明了人工智能在完成涉及大量数据的重复性任务方面非常有用,这些数据使人类厌倦了执行和分析数据以解决问题。 但是,这项技术会取代人类吗? 我倾向于不这样认为。 在解决重复性任务时,人工智能可以使您达到90%以上,但始终需要10%以上的工作才能对问题做出最终决定。 此外,与其他效率方面的进步一样,我们可以重用腾出的时间来做比以前更多的工作。 一种机器学习算法比另一种更好吗? 我相信答案在于对人们试图解决的问题的理解,我也相信数据的质量与算法本身一样重要。

 

约翰彼得森

产品线管理高级副总裁

恒星网络

滚动到顶部