<dfn id="yhprb"></dfn><dfn id="yhprb"><s id="yhprb"><strike id="yhprb"></strike></s></dfn><dfn id="yhprb"></dfn><small id="yhprb"></small> <delect id="yhprb"><strike id="yhprb"></strike></delect><dfn id="yhprb"></dfn><dfn id="yhprb"></dfn><s id="yhprb"><noframes id="yhprb"><small id="yhprb"><dfn id="yhprb"></dfn></small><dfn id="yhprb"><delect id="yhprb"></delect></dfn><small id="yhprb"></small> <small id="yhprb"></small><delect id="yhprb"><strike id="yhprb"></strike></delect><dfn id="yhprb"></dfn><dfn id="yhprb"><s id="yhprb"><strike id="yhprb"></strike></s></dfn><dfn id="yhprb"><s id="yhprb"></s></dfn>

新聞中心

EEPW首頁(yè) > 智能計算 > 設計應用 > 人工智能之K近鄰算法（KNN）

人工智能之K近鄰算法（KNN）

作者：時(shí)間：2018-06-19 來(lái)源：網(wǎng)絡(luò )

加入技術(shù)交流群
- 掃碼加入
  和技術(shù)大咖面對面交流
  海量資料庫查詢(xún)

收藏

　　前言：人工智能機器學(xué)習有關(guān)算法內容，請參見(jiàn)公眾號“科技優(yōu)化生活”之前相關(guān)文章。人工智能之機器學(xué)習主要有三大類(lèi):1)分類(lèi);2)回歸;3)聚類(lèi)。今天我們重點(diǎn)探討一下K近鄰(KNN)算法。 ^_^

本文引用地址：http://dyxdggzs.com/article/201806/381808.htm

　　K近鄰KNN(k-Nearest Neighbor)算法,也叫K最近鄰算法，1968年由 Cover 和 Hart 提出，是機器學(xué)習算法中比較成熟的算法之一。K近鄰算法使用的模型實(shí)際上對應于對特征空間的劃分。KNN算法不僅可以用于分類(lèi)，還可以用于回歸。

　　KNN概念：

　　K近鄰算法KNN就是給定一個(gè)訓練數據集，對新的輸入實(shí)例，在訓練數據集中找到與該實(shí)例最鄰近的K個(gè)實(shí)例(K個(gè)鄰居)，這K個(gè)實(shí)例的多數屬于某個(gè)類(lèi)，就把該輸入實(shí)例分類(lèi)到這個(gè)類(lèi)中。

　　如果一個(gè)樣本在特征空間中的k個(gè)最相似(即特征空間中最鄰近)的樣本中的大多數屬于某一個(gè)類(lèi)別，則該樣本也屬于這個(gè)類(lèi)別。K近鄰算法使用的模型實(shí)際上對應于對特征空間的劃分。

　　通俗地講，就是“物以類(lèi)聚，人以群分”。

　　分類(lèi)策略，就是“少數從屬于多數”。

　　算法描述：

　　KNN沒(méi)有顯示的訓練過(guò)程，在測試時(shí)，計算測試樣本和所有訓練樣本的距離，根據最近的K個(gè)訓練樣本的類(lèi)別，通過(guò)多數投票的方式進(jìn)行預測。具體算法描述如下：

　　輸入：訓練數據集T={(x1,y1),(x2,y2),...,(xn,yn)}，其中xi∈Rn,yi∈{c1,c2,...,cK}和測試數據x

　　輸出：實(shí)例x所屬的類(lèi)別

　　1) 根據給定的距離度量，在訓練集T中找到與x距離最近的k個(gè)樣本，涵蓋這k個(gè)點(diǎn)的x的鄰域記作Nk(x)。

　　2)在Nk(x)中根據分類(lèi)規則(如多數表決)確定x的類(lèi)別y：

　　核心思想：

　　當無(wú)法判定當前待分類(lèi)點(diǎn)是從屬于已知分類(lèi)中的哪一類(lèi)時(shí)，依據統計學(xué)的理論看它所處的位置特征，衡量它周?chē)従拥臋嘀?，而把它歸為到權重更大的那一類(lèi)中。

　　kNN的輸入是測試數據和訓練樣本數據集，輸出是測試樣本的類(lèi)別。

　　KNN算法中，所選擇的鄰居都是已經(jīng)正確分類(lèi)的對象。KNN算法在定類(lèi)決策上只依據最鄰近的一個(gè)或者幾個(gè)樣本的類(lèi)別來(lái)決定待分樣本所屬的類(lèi)別。

　　算法要素：

　　KNN 算法有3個(gè)基本要素：

　　1)K值的選擇：K值的選擇會(huì )對算法的結果產(chǎn)生重大影響。K值較小意味著(zhù)只有與輸入實(shí)例較近的訓練實(shí)例才會(huì )對預測結果起作用，但容易發(fā)生過(guò)擬合;如果 K 值較大，優(yōu)點(diǎn)是可以減少學(xué)習的估計誤差，但缺點(diǎn)是學(xué)習的近似誤差增大，這時(shí)與輸入實(shí)例較遠的訓練實(shí)例也會(huì )對預測起作用，使預測發(fā)生錯誤。在實(shí)際應用中，K 值一般選擇一個(gè)較小的數值，通常采用交叉驗證的方法來(lái)選擇最優(yōu)的 K 值。隨著(zhù)訓練實(shí)例數目趨向于無(wú)窮和 K=1 時(shí)，誤差率不會(huì )超過(guò)貝葉斯誤差率的2倍，如果K也趨向于無(wú)窮，則誤差率趨向于貝葉斯誤差率。

　　2)距離度量：距離度量一般采用 Lp 距離，當p=2時(shí)，即為歐氏距離，在度量之前，應該將每個(gè)屬性的值規范化，這樣有助于防止具有較大初始值域的屬性比具有較小初始值域的屬性的權重過(guò)大。

　　對于文本分類(lèi)來(lái)說(shuō)，使用余弦(cosine)來(lái)計算相似度就比歐式(Euclidean)距離更合適。

　　3)分類(lèi)決策規則：該算法中的分類(lèi)決策規則往往是多數表決，即由輸入實(shí)例的K個(gè)最臨近的訓練實(shí)例中的多數類(lèi)決定輸入實(shí)例的類(lèi)別。

　　算法流程：

　　1)準備數據，對數據進(jìn)行預處理。

　　2)選用合適的數據結構存儲訓練數據和測試元組。

　　3)設定參數，如K。

　　4)維護一個(gè)距離由大到小的優(yōu)先級隊列(長(cháng)度為K)，用于存儲最近鄰訓練元組。隨機從訓練元組中選取K個(gè)元組作為初始的最近鄰元組，分別計算測試元組到這K個(gè)元組的距離，將訓練元組標號和距離存入優(yōu)先級隊列。

　　5)遍歷訓練元組集，計算當前訓練元組與測試元組的距離，將所得距離L與優(yōu)先級隊列中的最大距離Lmax。

　　6)進(jìn)行比較。若L>=Lmax，則舍棄該元組，遍歷下一個(gè)元組。若L

　　7)遍歷完畢，計算優(yōu)先級隊列中K個(gè)元組的多數類(lèi)，并將其作為測試元組的類(lèi)別。

　　8)測試元組集測試完畢后計算誤差率，繼續設定不同的K值重新進(jìn)行訓練，最后取誤差率最小的K值。

　　算法優(yōu)點(diǎn)：

　　1)KNN從原理上也依賴(lài)于極限定理，但在類(lèi)別決策時(shí)，只與極少量的相鄰樣本有關(guān)。

　　2)由于KNN方法主要靠周?chē)邢薜泥徑臉颖?，而不是靠判別類(lèi)域的方法來(lái)確定所屬類(lèi)別的，因此對于類(lèi)域的交叉或重疊較多的待分樣本集來(lái)說(shuō)，KNN方法較其他方法更為適合。

　　3)算法本身簡(jiǎn)單有效，精度高,對異常值不敏感,易于實(shí)現，無(wú)需估計參數，分類(lèi)器不需要使用訓練集進(jìn)行訓練，訓練時(shí)間復雜度為0。

　　4)KNN 分類(lèi)的計算復雜度和訓練集中的文檔數目成正比，即，如果訓練集中文檔總數為n，那么KNN的分類(lèi)時(shí)間復雜度為O(n)。

　　5)適合對稀有事件進(jìn)行分類(lèi)。

　　6)特別適合于多分類(lèi)問(wèn)題(multi-modal),對象具有多個(gè)類(lèi)別標簽，kNN比SVM的表現要好。

　　算法缺點(diǎn)：

　　1)當樣本不平衡時(shí)，樣本數量并不能影響運行結果。

　　2)算法計算量較大;

　　3)可理解性差，無(wú)法給出像決策樹(shù)那樣的規則。

　　改進(jìn)策略：

　　KNN算法因其提出時(shí)間較早，隨著(zhù)其他技術(shù)的不斷更新和完善，KNN算法逐漸顯示出諸多不足之處，因此許多KNN算法的改進(jìn)算法也應運而生。算法改進(jìn)目標主要朝著(zhù)分類(lèi)效率和分類(lèi)效果兩個(gè)方向。

　　改進(jìn)1：通過(guò)找出一個(gè)樣本的k個(gè)最近鄰居，將這些鄰居的屬性的平均值賦給該樣本，就可以得到該樣本的屬性。

　　改進(jìn)2：將不同距離的鄰居對該樣本產(chǎn)生的影響給予不同的權值(weight)，如權值與距離成反比(1/d)，即和該樣本距離小的鄰居權值大，稱(chēng)為可調整權重的K最近鄰居法WAKNN(weighted adjusted K nearestneighbor)。但WAKNN會(huì )造成計算量增大，因為對每一個(gè)待分類(lèi)的文本都要計算它到全體已知樣本的距離，才能求得它的K個(gè)最近鄰點(diǎn)。

　　改進(jìn)3：事先對已知樣本點(diǎn)進(jìn)行剪輯(editing技術(shù))，事先去除(condensing技術(shù))對分類(lèi)作用不大的樣本。該算法比較適用于樣本容量比較大的類(lèi)域的自動(dòng)分類(lèi)，而那些樣本容量較小的類(lèi)域采用這種算法比較容易產(chǎn)生誤分。

　　考慮因素：

　　實(shí)現 K 近鄰算法時(shí)，主要考慮的因素是如何對訓練數據進(jìn)行快速 K 近鄰搜索，這在特征空間維數大及訓練數據容量大時(shí)是非常必要的。

　　應用場(chǎng)景：

　　K 近鄰算法應用場(chǎng)景包括機器學(xué)習、字符識別、文本分類(lèi)、圖像識別等領(lǐng)域。

　　結語(yǔ):

　　K近鄰算法KNN,也叫K最近鄰算法，是機器學(xué)習研究的一個(gè)活躍領(lǐng)域。最簡(jiǎn)單的暴力算法，比較適合小數據樣本。K近鄰算法使用的模型實(shí)際上對應于對特征空間的劃分。KNN算法不僅可以用于分類(lèi)，還可以用于回歸。KNN算法在人工智能之機器學(xué)習、字符識別、文本分類(lèi)、圖像識別等領(lǐng)域有著(zhù)廣泛應用。

<a target='_blank'><img src='https://ad.eepw.com.cn/www/delivery/avw.php?zoneid=114&cb=INSERT_RANDOM_NUMBER_HERE&n=a7a83b30' border='0' alt='' /></a>
<a target='_blank'><img src='https://ad.eepw.com.cn/www/delivery/avw.php?zoneid=115&cb=INSERT_RANDOM_NUMBER_HERE&n=a3d98779' border='0' alt='' /></a>
<a target='_blank'><img src='https://ad.eepw.com.cn/www/delivery/avw.php?zoneid=116&cb=INSERT_RANDOM_NUMBER_HERE&n=abca108c' border='0' alt='' /></a>
<a target='_blank'><img src='https://ad.eepw.com.cn/www/delivery/avw.php?zoneid=117&cb=INSERT_RANDOM_NUMBER_HERE&n=a1775170' border='0' alt='' /></a>
<a target='_blank'><img src='https://ad.eepw.com.cn/www/delivery/avw.php?zoneid=118&cb=INSERT_RANDOM_NUMBER_HERE&n=a449048b' border='0' alt='' /></a>

關(guān)鍵詞： 人工智能 KNN

評論

相關(guān)推薦

AMD斥資6.65億美元收購芬蘭AI公司 Silo AI

智能計算 AMD silo AI 人工智能 | 2024-07-15

未來(lái)的人工智能世界：技術(shù)與人文的和諧還是斗爭？

藍盒子 | 2007-09-11

具有人工智能的溫度控制電路圖

設計方案具有人工智能溫度控制電路圖 | 2012-07-24

本科畢業(yè)設計：一種基于發(fā)育思想的語(yǔ)音識別系統實(shí)現

資源下載語(yǔ)音識別人工智能自主式機器發(fā)育思想自組織映射網(wǎng)絡(luò ) 簡(jiǎn)單反饋神經(jīng)網(wǎng)絡(luò ) | 2007-04-19

有簡(jiǎn)單人工智能的溫度控制電路圖

設計方案簡(jiǎn)單人工智能溫度控制電路圖 | 2010-09-01

簡(jiǎn)單人工智能的溫度控制電路

設計方案簡(jiǎn)單人工智能溫度控制 | 2009-07-06

具有人工智能的溫度控制電路設計

設計方案具有人工智能溫度控制電路設計 | 2012-07-24

機器里的大腦：一位“隱士”開(kāi)發(fā)者的人工智能夢(mèng)（上篇）

隨風(fēng)搖擺 | 2015-11-09

借助電源完整性測試提高人工智能數據中心的能效

測試測量電源完整性測試人工智能數據中心 | 2024-07-19

個(gè)人-口罩識別系統項目采訪(fǎng)

視頻英特爾微軟黑客松人工智能 OpenVINO | 2021-07-28

個(gè)人-窗口衛士項目采訪(fǎng)

視頻英特爾微軟黑客松人工智能 OpenVINO | 2021-07-28

有簡(jiǎn)單人工智能的溫度控制電路

設計方案簡(jiǎn)單人工智能溫度控制 | 2009-09-01

機器里的大腦：一位“隱士”開(kāi)發(fā)者的人工智能夢(mèng)（下篇）

隨風(fēng)搖擺 | 2015-11-16

推動(dòng)電動(dòng)汽車(chē)發(fā)展：利用機器視覺(jué)和人工智能提升鋰離子電池質(zhì)量

智能計算電動(dòng)汽車(chē) 機器視覺(jué)檢測人工智能 | 2024-07-18

仿人機器人

資源下載仿人機器人傳感器人工智能 | 2007-04-19

OpenAI陷入安全危機：攻擊者成功入侵內部消息系統

OpenAI 人工智能 | 2024-07-08

馬斯克詢(xún)問(wèn)網(wǎng)友：特斯拉向xAI投50億美元行不行

智能計算馬斯克特斯拉 xAI 人工智能 | 2024-07-25

微軟X英特爾黑客松大賽

視頻英特爾微軟黑客松人工智能 OpenVINO | 2021-07-27

革新企業(yè)數據管理，邁向“真正的”混合云時(shí)代

人工智能 AI | 2024-07-03

STC-人工智能二維生命探測儀

renazan2000 | 2013-01-14

東南大學(xué)人工智能03

資源下載人工智能計算機科學(xué) 聲音識別 | 2007-04-20

人工智能歷史

Lamborghini | 2011-03-15

人工智能與機器人

視頻物聯(lián)網(wǎng) 可穿戴設備智能硬件高峰論壇機器人人工智能 | 2015-01-19

工信部人工智能標準化技術(shù)委員會(huì )籌建方案公示

智能計算工信部人工智能 | 2024-07-03

ADI公司：工業(yè)4.0——人工智能的端

視頻 ADI 人工智能工業(yè)4.0 | 2019-11-08

傳蘋(píng)果智能將錯過(guò)iOS 18 9月份大升級推遲1個(gè)月發(fā)布

手機與無(wú)線(xiàn)通信蘋(píng)果智能 iOS 18 推遲人工智能 iPhone iPad Apple Intelligence | 2024-07-29

新一代語(yǔ)音識別：可徹底改變車(chē)內體驗的技術(shù)

汽車(chē)電子語(yǔ)音識別生物識別人工智能 | 2024-07-18

ST Edge AI Suite人工智能開(kāi)發(fā)套件正式上線(xiàn)快采用意法半導體技術(shù)的AI產(chǎn)品開(kāi)發(fā)速度

智能計算 ST Edge AI Suite 人工智能意法半導體 AI | 2024-07-08

東南大學(xué)人工智能02

資源下載人工智能大規模集成電路自適應能力 | 2007-04-20

東南大學(xué)人工智能01

資源下載人工智能語(yǔ)言識別圖像識別自然語(yǔ)言處理專(zhuān)家系統 | 2007-04-20

焦點(diǎn)

推薦視頻

技術(shù)專(zhuān)區

国产精品自在自线亚洲|国产精品无圣光一区二区|国产日产欧洲无码视频|久久久一本精品99久久K精品66|欧美人与动牲交片免费播放

<dfn id="yhprb"></dfn><dfn id="yhprb"><s id="yhprb"><strike id="yhprb"></strike></s></dfn><dfn id="yhprb"></dfn><small id="yhprb"></small> <delect id="yhprb"><strike id="yhprb"></strike></delect><dfn id="yhprb"></dfn><dfn id="yhprb"></dfn><s id="yhprb"><noframes id="yhprb"><small id="yhprb"><dfn id="yhprb"></dfn></small><dfn id="yhprb"><delect id="yhprb"></delect></dfn><small id="yhprb"></small> <small id="yhprb"></small><delect id="yhprb"><strike id="yhprb"></strike></delect><dfn id="yhprb"></dfn><dfn id="yhprb"><s id="yhprb"><strike id="yhprb"></strike></s></dfn><dfn id="yhprb"><s id="yhprb"></s></dfn>