反爬必修課之----(3)極驗滑動驗證碼識別

興華的mark 關注

0.9 2019.02.17 22:04* 字數 1462 閱讀 311評論 4喜歡 8

驗證碼識別成爲了對抗反爬蟲的必修課之一，看了崔慶才著的《python3網絡爬蟲開發實戰》後受益匪淺，本專題將着重學習記錄不同的驗證碼識別方式：圖像驗證碼、宮格驗證碼、極驗滑動驗證碼、點觸驗證碼。

[2019.3.6更新] 測試了下發現以下的版本識別率比較低，稍微改動了下代碼。
放到了GitHub上

極驗滑動驗證碼識別

先看看效果：

識別思路：

模擬點擊切換爲滑動驗證、並顯示驗證界面。
識別滑動缺口的位置，計算位移
模擬拖動滑塊
若認證失敗，重複調用

詳細過程及代碼如下：

初始化

from selenium.webdriver.support import expected_conditions as EC    
from selenium import webdriver
from selenium.webdriver.support.wait import WebDriverWait
from selenium.webdriver.common.by import By
from selenium.webdriver import ActionChains
from PIL import Image
from io import BytesIO
import time

BORDER = 6

class CrackGeetest():
    def __init__(self):
        self.url = 'https://www.geetest.com/type/'
        self.browser = webdriver.Chrome()
        self.wait = WebDriverWait(self.browser,10)

    def open(self):
        '''
        打開網頁
        :return None 
        '''
        self.browser.get(self.url)

    def close(self):
        '''
        關閉網頁
        :return None
        '''
        self.browser.close()
        self.browser.quit()

定義了一個 CrackGeetest 類，初始化selenium對象和一些參數配置，網址是極驗的驗證碼測試頁面。

模擬點擊

首先模擬點擊切換爲滑動驗證，然後模擬點擊彈出驗證圖片。

    def change_to_slide(self):
        '''
        切換爲滑動認證
        :return 滑動選項對象
        '''
        huadong = self.wait.until(
            EC.element_to_be_clickable((By.CSS_SELECTOR,'.products-content ul > li:nth-child(2)'))
        )
        return huadong

    def get_geetest_button(self):
        '''
        獲取初始認證按鈕
        :return 按鈕對象
        '''
        button = self.wait.until(
            EC.element_to_be_clickable((By.CSS_SELECTOR,'.geetest_radar_tip'))
        )
        return button

該步驟定義了兩個方法，均利用顯示等待的方法實現。並返回按鈕對象，後用click()方法模擬點擊。
效果如下：

獲取背景圖

首先等待驗證碼加載完成(wait_pic)，獲取網頁截圖(get_screenshot)，然後獲取驗證背景圖所在的位置及大小參數(get_position)和滑塊對象(get_slider)。

    def wait_pic(self):
        '''
        等待驗證圖片加載完成
        :return None
        '''
        self.wait.until(
            EC.presence_of_element_located((By.CSS_SELECTOR,'.geetest_popup_wrap'))
        ) 

    def get_screenshot(self):
        """
        獲取網頁截圖
        :return: 截圖對象
        """
        screenshot = self.browser.get_screenshot_as_png()
        screenshot = Image.open(BytesIO(screenshot))
        return screenshot

    def get_position(self):
        '''
        獲取驗證碼位置
        :return: 位置元組
        '''
        img = self.wait.until(EC.presence_of_element_located((By.CLASS_NAME,'geetest_canvas_img')))
        time.sleep(2)
        location = img.location
        size = img.size
        top, bottom = location['y'], location['y'] + size['height']
        left, right = location['x'], location['x'] + size['width'] 
        return (top, bottom, left, right) 

    def get_slider(self):
        '''
        獲取滑塊
        :return: 滑塊對象
        '''
        slider = self.wait.until(EC.element_to_be_clickable((By.CLASS_NAME,'geetest_slider_button')))
        return slider

再通過上述返回的背景圖位置和大小參數，對網頁截圖進行切片(get_geetest_image)，最後獲取背景圖。

    def get_geetest_image(self,name='captcha.png'):
        '''
        獲取驗證碼圖片
        :return: 圖片對象
        '''      
        top, bottom, left, right = self.get_position()
        print('驗證碼位置',top, bottom, left, right)
        screenshot = self.get_screenshot()
        captcha = screenshot.crop((left, top, right, bottom))
        captcha.save(name)
        return captcha

到這裏，已經獲取了帶缺口的背景圖，那怎麼樣纔可以獲取不帶缺口滑塊的原圖呢？

網上提供的方法中，我篩選出了兩種實測可行的方法，一種是通過改變CSS樣式獲得原圖，另一種是將源碼返回的亂序圖還原，這裏着重介紹第一種，另一種在日後的文章中將補充。

在《python3網絡爬蟲開發實戰》中，由於寫書的時間距今有一段時間，所以極驗的驗證碼也存在更新，截至到今天（2018-11-30）無法直接先獲取無缺口的原圖，在通過點擊獲得帶缺口背景圖了。觀察一下驗證碼頁面的源代碼，可以發現：

將該canvas標籤的style刪除之後，滑塊和陰影果然不見了，這樣我們只需要通過js操作css樣式屬性，便可以繼續分析了。這裏用到了execute_script()方法，基本上Selenium API沒有提供的功能都可以通過它執行JavaScript的方式來實現。不得不說這個功能還是挺好用的，可以類比Splash執行Lua腳本。
執行js腳本之後(delete_style)獲得了無缺口的原圖，再調用之前的截圖方法，就可以獲取同大小的背景圖了。

    def delete_style(self):
        '''
        執行js腳本，獲取無滑塊圖
        :return None
        '''
        js = 'document.querySelectorAll("canvas")[2].style=""'
        self.browser.execute_script(js)

不帶缺口的背景圖

帶缺口和陰影的背景圖

識別缺口

我們得到了兩張圖，接下來就要對比他們來獲取缺口位置。
遍歷圖片的每個座標點，獲取兩張圖片的RGB數據，若差距在一定範圍內，則認爲兩個像素相同，繼續往下比對。若超過一定範圍，則代表像素點不同，當且位置即爲缺口位置。 is_pixel_equal()中定義了一個閾值範圍threshold，爲60，原因是缺口圖中不僅有缺口部分的像素不同，其中還設置了一個干擾陰影塊，和缺口大小類似，所以我們需要將範圍適當提高。

    def is_pixel_equal(self, img1, img2, x, y):
        '''
        判斷兩個像素是否相同
        :param img1: 不帶缺口圖片
        :param img2: 帶缺口圖
        :param x: 位置x
        :param y: 位置y
        :return: 像素是否相同
        '''
        # 取兩個圖片的像素點
        pix1 = img1.load()[x, y]
        pix2 = img2.load()[x, y]
        threshold = 60
        if abs(pix1[0] - pix2[0]) < threshold \
        and abs(pix1[1] - pix2[1]) < threshold \
        and abs(pix1[2] - pix2[2]) < threshold:
            return True
        else:
            return False

get_gap()方法遍歷兩張圖片的每個像素，再利用is_pixel_equal()方法判斷兩張圖片同一位置的像素。get_gap()中，left爲起始橫座標，即是從滑塊的右邊開始尋找缺口位置。

    def get_gap(self, img1, img2):
        '''
        獲取缺口偏移量
        :param img1: 不帶缺口圖片
        :param img2: 帶缺口圖
        :return 缺口位置
        '''
        left = 60 
        for i in range(left, img1.size[0]):
            for j in range(img1.size[1]):
                if not self.is_pixel_equal(img1, img2, i, j):
                    left = i
                    return left
        return left

模擬拖動。

上面我們獲得了滑塊的位置，現在只需要計算距離並且模擬拖動即可。
不難想到，將滑塊勻速運動或者直接閃到缺口位置是肯定不行的，我們要儘量模擬人手拖動鼠標的情況。所以我在崔大給的方案的基礎上做了一點改進。

大致過程：
首先加速拖動滑塊，當快接近缺口時，開始減速拖動，超過缺口一點距離後再往回拖拽對齊，由於人手可能不能對得非常整齊，所以我設置了1到2個像素的誤差，並且再最後加入了3個像素距離的左右滑動來模擬釋放鼠標時的抖動情況。

效果如下：

利用中學時期的物理公式，即可構造軌跡移動算法。
x = v0*t + 1/2*a*t^2
v = v0 + a*t

    def get_track(self, distance):
        '''
        根據偏移量獲取移動軌跡
        :param distance: 偏移量
        :return: 移動軌跡
        '''
        #移動軌跡
        track = []
        #當前位移
        current = 0
        #減速閾值
        mid = distance * 3 / 5
        #計算間隔
        t = 0.2
        #初速度
        v = 0
        #滑超過過一段距離
        distance += 14
        while current < distance:
            if current < mid:
                #加速度爲正
                a = 2
            else:
                #加速度爲負
                a = -1.5
            #初速度 v0
            v0 = v
            #當前速度 v
            v = v0 + a * t
            #移動距離 move-->x
            move = v0 * t + 1 / 2 * a * t * t
            #當前位移
            current += move
            #加入軌跡
            track.append(round(move))
        return track

前3/5路程加速，後面減速，track返回的是一個列表，其中每個元素代表的是每次移動的距離。然後模擬釋放鼠標時的人手抖動(shake_mouse)。
最後根據之前所得到的運動軌跡拖動滑塊(move_to_gap)即可。

    def shake_mouse(self):
        '''
        模擬人手釋放鼠標時的抖動
        :return: None
        '''
        ActionChains(self.browser).move_by_offset(xoffset=-3, yoffset=0).perform()
        ActionChains(self.browser).move_by_offset(xoffset=2, yoffset=0).perform()

    def move_to_gap(self, slider, tracks):
        '''
        拖動滑塊到缺口處
        :param slider: 滑塊
        :param tracks: 軌跡
        :return
        '''
        back_tracks = [-1, -1, -2, -2, -3, -2, -2, -1, -1]
        ActionChains(self.browser).click_and_hold(slider).perform()
        #正向
        for x in tracks:
            ActionChains(self.browser).move_by_offset(xoffset=x, yoffset=0).perform()
        #逆向
        for x in back_tracks:
            ActionChains(self.browser).move_by_offset(xoffset=x, yoffset=0).perform()
        #模擬抖動
        self.shake_mouse()
        time.sleep(0.5)
        ActionChains(self.browser).release().perform()

其整個控制流程，如下：
執行主體流程，若驗證失敗，則再次調用crack()進行識別，直至成功。

    def crack(self):
        try:
            #打開網頁
            self.open()
            #轉換驗證方式，點擊認證按鈕
            s_button = self.change_to_slide()
            s_button.click()
            g_button = self.get_geetest_button()
            g_button.click()
            #確認圖片加載完成
            self.wait_pic()
            #獲取滑塊
            slider = self.get_slider()
            #獲取帶缺口的驗證碼圖片
            image1 = self.get_geetest_image('captcha1.png')
            self.delete_style()
            image2 = self.get_geetest_image('captcha2.png')
            gap = self.get_gap(image1,image2)
            print('缺口位置',gap)
            gap -= BORDER
            track = self.get_track(gap)
            self.move_to_gap(slider, track)
            success =  self.wait.until(
                EC.text_to_be_present_in_element((By.CLASS_NAME,'geetest_success_radar_tip_content'),'驗證成功')
            )
            print(success)
            time.sleep(5)
            self.close()
        except:
            print('Failed-Retry')
            self.crack()


    
if __name__ == '__main__':
    crack = CrackGeetest()
    crack.crack()

至此，極驗滑動驗證碼識別——網頁截圖對比方法已經記錄完畢。

關鍵字總結

webdriver():
support.expected_conditions as EC
support.wait.WebDriverWait
ActionChains
common.by.By
BytesIO
代碼風格
驗證碼分析思路

轉自：https://www.jianshu.com/p/c04f4831454d

驗證碼

反爬必修課之----(3)極驗滑動驗證碼識別

極驗滑動驗證碼識別

詳細過程及代碼如下：

【簡寫Mybatis-02】註冊機的實現以及SqlSession處理

手繪二維碼

.NET藉助虛擬網卡實現一個簡單異地組網工具

tensorflow中的一些函數 tf.reduce,tf.argmax,tf.equal

顯示數據庫信息

american house business

mysql json 常用處理函數

building Type

Mac下配置sublime實現LaTeX

https://yachay.unat.edu.pe/blog/index.php?comment_area=format_blog&comment_component=blog&comment_co

linux以太網驅動總結