Tensorflow例項2:將影象和標籤資料(*.csv)轉化成tfrecords檔案，以便後續直接讀取tfrecords檔案進行圖片驗證碼識別訓練

阿新 • • 發佈：2018-12-20

由於多張影象和標籤值不在一起，現在此方法是把captcha_dir = "../data/GenPics/"此路徑下的圖片與此路徑下的.csv檔案合併起來，通過writer = tf.python_io.TFRecordWriter(path="./data/captcha.tfrecords")將資料以tfrecords格式寫入到本地中，為了以後進行驗證碼圖片訓練做好準備。
具體操作步驟如下：

# -*- coding=utf-8 -*-
import tensorflow as tf
import os

os.environ["TF_CPP_MIN_LOG_LEVEL"] = '2'  # 只顯示 warning 和 Error   

FLAGS = tf.app.flags.FLAGS
tf.app.flags.DEFINE_string("tfrecords_dir", "./data/captcha.tfrecords", "驗證碼tfrecords檔案")
tf.app.flags.DEFINE_string("captcha_dir", "../data/Genpics/", "驗證碼圖片路徑")
tf.app.flags.DEFINE_string("letter", "ABCDEFGHIJKLMNOPQRSTUVWXYZ", "驗證碼字元的種類")


def get_captcha_image(captcha_dir):
    """
    獲取驗證碼圖片資料
    :param captcha_dir: 驗證碼圖片路徑
    :return: image
    """
    # 構造檔名
    filename = []

    for i in range(6000):
        string = str(i) + ".jpg"
        filename.append(string)

    # 構造路徑+檔案
    # file_list = [os.path.join(FLAGS.captcha_dir, file) for file in filename]
    file_list = [os.path.join(captcha_dir, file) for file in filename]

    # 構造檔案佇列
    file_queue = tf.train.string_input_producer(file_list, shuffle=False)

    # 構造閱讀器
    reader = tf.WholeFileReader()

    # 讀取圖片資料內容
    key, value = reader.read(file_queue)

    # 解碼圖片資料
    image = tf.image.decode_jpeg(value)
    image.set_shape([20, 80, 3])

    # 批量處理資料 [6000, 20, 80,3]
    image_batch = tf.train.batch([image], batch_size=6000, num_threads=1, capacity=6000)

    return image_batch


def get_captcha_label(captcha_dir):
    """
    讀取驗證碼圖片標籤資料
    :param captcha_dir: 驗證碼標籤路徑
    :return: label
    """
    # 構造標籤資料檔案路徑
    captcha_dir = captcha_dir + "labels.csv"

    # 構造檔案佇列
    file_queue = tf.train.string_input_producer([captcha_dir], shuffle=False)

    # 構造閱讀器
    reader = tf.TextLineReader()

    # 讀取excel的label資料內容
    key, value = reader.read(file_queue)

    # 解碼csv資料
    # records：指定矩陣格式以及資料型別
    # [1]中的1 用於指定資料型別，比如矩陣中如果有小數，則為float,[1]應該變為[1.0]。
    records = [[1], ["None"]]
    number, label = tf.decode_csv(value, record_defaults=records)

    # 批處理資料
    label_batch = tf.train.batch([label], batch_size=6000, num_threads=1, capacity=6000)

    return label_batch


def dealwuthlabel(label_str):
    """

    :param label_str:
    :return:
    """
    # 驗證碼字串的種類
    letter = "ABCDEFGHIJKLMNOPQRSTUVWXYZ"

    # 構建字元索引 {0:'A', 1:'B', ...}
    num_letter = dict(enumerate(list(letter)))

    # 鍵值對反轉{'A':0, 'B':1, ...}
    letter_num = dict(zip(num_letter.values(), num_letter.keys()))

    print(letter_num)

    # 構建標籤到列表
    array = []

    # 給標籤資料進行處理 [[b'NZPP'], ...]
    for string in label_str:
        letter_list = []  # [1, 2, 3, 4]

        # 修改編碼，b'NZPP'到字串，並且迴圈找到每張驗證碼的字元對應的數字標記
        for letter in string.decode("utf-8"):
            letter_list.append(letter_num[letter])

        array.append(letter_list)

    # [[13, 25, 15, 15], [22, 10, 7, 10], [22, 15, 18, 9], ...]
    # print(array)

    # 將array轉換成Tensor型別
    label = tf.constant(array)

    return label


def write_to_tfrecords(image_batch, label_batch):
    """
    將圖片內容和標籤寫入到tfrecords檔案當中
    :param image_batch: 特徵值
    :param label_batch: 標籤值
    :return: None
    """
    # 轉換型別
    label_batch = tf.cast(label_batch, tf.uint8)

    print(label_batch)

    # 建立TFRecords 儲存器
    # writer = tf.python_io.TFRecordWriter(path=FLAGS.tfrecords_dir)
    writer = tf.python_io.TFRecordWriter(path="./data/captcha.tfrecords")

    # 迴圈將每一個圖片資料構造example協議快，序列化後寫入
    for i in range(label_batch.shape[0]):
        # 取出第i個圖片資料，轉換為相應型別，圖片的特徵值要轉換為字串形式
        image_string = image_batch[i].eval().tostring()

        # 標籤值，轉換成整型
        label_string = label_batch[i].eval().tostring()

        # 構造協議塊
        example = tf.train.Example(features=tf.train.Features(feature={
            "image": tf.train.Feature(bytes_list=tf.train.BytesList(value=[image_string])),
            "label": tf.train.Feature(bytes_list=tf.train.BytesList(value=[label_string])),
        }))

        writer.write(example.SerializeToString())

    # 關閉檔案
    writer.close()

    return None


if __name__ == '__main__':
    # 資料路徑
    captcha_dir = "../data/GenPics/"

    # 獲取驗證碼檔案當中的圖片
    image_batch = get_captcha_image(captcha_dir)

    # 獲取驗證碼檔案當中的標籤資料
    label = get_captcha_label(captcha_dir)

    print(image_batch, label)

    with tf.Session() as sess:
        coord = tf.train.Coordinator()
        threads = tf.train.start_queue_runners(sess=sess, coord=coord)

        # [b'NZPP' b'WKHK' b'WPSJ' ... b'FVQJ' b'BQYA' b'BCHR']
        label_str = sess.run(label)
        print(label_str)

        # 處理字串標籤 轉變為數字張量
        label_batch = dealwuthlabel(label_str)

        # 將圖片資料和內容寫入到tfrecords檔案中
        write_to_tfrecords(image_batch, label_batch)

        coord.request_stop()
        coord.join(threads)

Tensorflow例項2:將影象和標籤資料(*.csv)轉化成tfrecords檔案，以便後續直接讀取tfrecords檔案進行圖片驗證碼識別訓練

由於多張影象和標籤值不在一起，現在此方法是把captcha_dir = "../data/GenPics/"此路徑下的圖片與此路徑下的.csv檔案合併起來，通過writer = tf.python_io.TFRecordWriter(path="./data/captcha.tfreco

將查詢出來的資料集轉化成JSON格式的類

using System; using System.Collections; using System.Collections.Generic; using System.Data; using System.Globalization; using System.Linq; using System.

Python影象處理之圖片驗證碼識別

在上一篇部落格Python影象處理之圖片文字識別（OCR）中我們介紹了在Python中如何利用Tesseract軟體來識別圖片中的英文與中文，本文將具體介紹如何在Python中利用Tesseract軟體來識別驗證碼（數字加字母）。我們在網上瀏覽網頁或

如何批量、快速從MySQL將節點和關係資料匯入neo4j

0 Neo4j簡介安裝好neo4j後，啟動服務，可以訪問地址http://127.0.0.1:7474/browser/看到以下介面，點選*號，就可以看到至多50個節點了。這是neo4j的主介面，通過查詢資料節點的相關屬性、標籤和關係，即時的把節點間存在的關係展示出來。 neo4

pathon筆記——第2章變數和簡單資料型別

1、修改字串大小寫 title（）方法：首字母大寫 upper（）方法：全部大寫 lower（）方法：全部小寫 2、拼接字串用+直接拼接 3、使用製表符或換行符製表符\t 換行符\n 4、刪除空白 rstrip()方法：刪除字串末尾空白 lstrip()方法：刪除字串開頭空白 str

2.CNN圖片多標籤分類（基於TensorFlow實現驗證碼識別OCR）

上一篇實現了圖片CNN單標籤分類（貓狗圖片分類任務）地址：juejin.im/post/5c0739… 預告：下一篇用LSTM+CTC實現不定長文字的OCR，本質上是一種不固定標籤個數的多標籤分類問題本文所用到的10w驗證碼資料集百度網盤下載地址（也可使用下文程式碼自行生成）： pan.baidu

《Python程式設計：從入門到實踐》第2章變數和簡單資料型別

第2章變數和簡單資料型別 2-3 個性化的訊息將使用者的姓名存到一個變數中，並向該使用者顯示一條訊息。顯示的訊息應非常簡單，如“Hello Eric, would you like to lear

ROS實時採集Android的影象和IMU資料

前言臨近畢業，整理一下之前做的東西。這篇部落格來自於博主在2016年3月份投的一篇會議論文（論文主要介紹了一個基於手機攝像頭和IMU的簡單VIO系統，用於AR的Tracking部分，本博文是其中的資料採集部分）。本文的目的是將pc和手機連於同一區域網下，然後手機實時把相機和imu

例項2：棧和佇列——用兩個棧實現佇列

問題描述：用兩個棧來實現一個佇列，完成佇列的Push和Pop操作。佇列中的元素為int型別。知識拓展：棧（Stack）和佇列（Queue）是兩種操作受限的線性表。線性表：線性表是一種線性結構，它是一個含有n≥0個結點的有限序列，同一個線性表中的資料元素資料型別相同並

使用Struts 2將客戶端JSON資料對映為伺服器端Java物件

上文()介紹瞭如何將Java物件序列化成JSON格式並傳到客戶端。這篇文章就說說如何將客戶端的JSON資料對映為伺服器端的Java物件。 pom.xml 需要引入struts2-json-plugin包。 <dependencies> <depen

利用sqoop將hive和MySQL資料互匯入

1. hadoop、hive、MySQL安裝（略）啟動hadoop 執行start-all.sh start-dfs.sh start-yarn.sh 2. 下載sqoop 3. 解壓 #tar -zxvfsqoop-1.4.6.bin__hadoop-

Atiitt 圖片影象驗證碼生成法原理目錄 1.1. 常見的最簡單圖片驗證碼是利用影象api把隨機數文字轉影象 1 1.2. 常見較為複雜圖片驗證碼的方法（鏤空文字打散干擾線文字扭曲

Atiitt 圖片影象驗證碼生成法原理目錄 1.1. 常見的最簡單圖片驗證碼是利用影象api把隨機數文字轉影象 1 1.2. 常見較為複雜圖片驗證碼的方法（鏤空文字打散干擾線文字扭曲粘連膨脹，填充） 1 1.3. 實現 2

如何將pyspark的rdd資料型別轉化為DataFrame

簡述　　在用pyspark進行開發的時候，經常會遇到如何將pyspark讀取的資料使用xgboost的模型進行訓練，當然，如果是使用scala，可以直接使用xgboost4j，這個庫裡面提供了可以讀取rdd的資料檔案的函式介面，通過scala可以很簡單的進行

端到端車牌/驗證碼識別（tensorflow版）——（2）

端到端車牌識別（2）二、CNN方法 4. 模型訓練先附上程式碼train.py： """ Created on Tue Sep 5 15:37:26 2017 @author: llc """ #%% import os import numpy as

將GridView和資料庫查詢結果繫結起來後，點選查詢出了結果。但是點選第二面或者其他的，就直接變空白了。(已經解決)

public partial class Location_BJ_Location : System.Web.UI.Page { protected void Page_Load(object sender, EventArgs e) { if(!Page.IsPostB

寫介面：將資料庫查詢的QuerySet集合轉化成json資料

希望在請求結果中包含這一個資源的詳細資訊的api。比如，我們請求商品列表資訊得到如下的結果： [ { “id”: 1, “name”: “襪子” }, { “id”: 2, “name”: “褲子” }, { “id”: 3, “name”: “鞋子” } ] 但是，我們通過ORM進行ob

mysql將一個表中資料插入另一張表，排重，刪除，匯入

將一個表中資料插入另一張表的語句： insert into 目標表（欄位1，欄位2，欄位3……） select 欄位1，欄位2，欄位3… from 來源表 where 條件1 and 條件2；排重很簡單，只要在需要排重的欄位前加distinct就可以嘞！eg~ 查詢記錄

mysql將一個表的資料插入到另外一個表，如果某個欄位已經存在將不插入的sql

insert into registerInfo_extend (userId,name) select userId,'遊客' from registerInfo where not exists (

影象驗證碼識別（四）——灰度化和二值化

一、灰度化灰度化應用很廣，而且也比較簡單。灰度圖就是將白與黑中間的顏色等分為若干等級，絕大多數位256階。在RGB模型種，黑色（R=G=B=0）與白色（R=G=B=255），那麼256階的灰度劃分就是R=G=B=i，其中i取0到255. 從前面可以知道，OpenCV

使用Tensorflow構建和訓練自己的CNN來做簡單的驗證碼識別

Tensorflow是目前最流行的深度學習框架，我們可以用它來搭建自己的卷積神經網路並訓練自己的分類器，本文介紹怎樣使用Tensorflow構建自己的CNN，怎樣訓練用於簡單的驗證碼識別的分類器。本文假設你已經安裝好了Tensorflow，瞭解過CNN的一些知

Tensorflow例項2:將影象和標籤資料(*.csv)轉化成tfrecords檔案，以便後續直接讀取tfrecords檔案進行圖片驗證碼識別訓練

相關推薦