ChatGPTはスクリーンショットの文字を読み取れる?
実際に試してみた
「スクリーンショットを
ChatGPTに送れば
中の文字まで
読んでもらえるのか」
「画像の文章を
自分で打ち直さずに
質問できないだろうか」
画像入力を初めて使う人は
こうした疑問を
持つことがあります。
結論からいうと
ChatGPTは
スクリーンショット内の
文字を読み取り
その内容について
質問に答えられます。
OpenAI公式でも
スクリーンショットや
画像、図表などを
分析できる機能が
案内されています。
ただし
すべての文字を
常に正確に読める
わけではありません。
文字が小さい場合や
画像が不鮮明な場合は
読み間違えることが
あります。
特に日本語を含む画像は
英字中心の画像より
性能が低下する場合が
あるとされています。
スクリーンショットの
文字を読める仕組み
ChatGPTには
「画像入力」という
機能があります。
画像入力とは
送信された画像を
視覚情報として解析し
写っている内容について
回答する機能です。
そのため
写真に写った物だけでなく
スクリーンショット内の
文章についても
質問できます。
たとえば
Webサイトの画面を送り
「この文章を要約して」
と質問したり
エラー画面を送り
「何と書いてありますか」
と尋ねたりできます。
文字を読み取ったうえで
意味を説明したり
内容を整理したり
することも可能です。
実際に試すなら
こう質問するとわかる
実際に文字認識を
確認したい場合は
文章が表示された
スクリーンショットを
1枚用意します。
たとえば
次のような文章が
表示された画面を
撮影したとします。
「受付時間は
午前9時から
午後5時までです」
この画像を添付して
「画像に書いてある
文章をそのまま
読み取ってください」
と質問します。
回答に
受付時間の文章が
正しく含まれていれば
画像内の文字を
認識できたと判断できます。
次に
「受付終了時刻だけ
教えてください」
と質問すると
文字を読むだけでなく
内容まで理解できているか
確認しやすくなります。
ここで重要なのは
認識結果を
元画像と比べることです。
一度正しく読めたからと
いって別の画像でも
同じ精度になるとは
限りません。
画像の状態によって
結果は変わります。
スクリーンショットを
読ませる手順
まずスマートフォンや
パソコンで
読み取らせたい画面の
スクリーンショットを
保存します。
ChatGPTを開いたら
入力欄にある
「+」を選びます。
続いて
「写真とファイルを追加」
から画像を選択します。
Web版では
画像を入力欄へ
ドラッグしたり
コピーした画像を
貼り付けたりする方法も
利用できます。
画像が添付されたら
「この画像の文字を
読み取ってください」
と入力して送信します。
文字だけ欲しい場合は
「説明は不要なので
画像内の文章だけ
書き出してください」
のように
目的まで指定すると
回答の形を
調整しやすくなります。
小さい文字では
読み間違いが起こりやすい
ChatGPTの画像認識には
いくつか制限があります。
OpenAI公式では
不鮮明な画像では
結果の精度が
下がる可能性があると
説明しています。
また文字が小さい場合は
拡大することも
推奨されています。
ただし拡大するときに
周囲の重要な情報まで
切り取らないことが
ポイントです。
たとえば
エラー番号だけを
大きく切り抜くと
前後の説明がなくなり
原因を判断しにくく
なることがあります。
まず画面全体を送り
読みにくい部分だけ
追加で拡大画像を送ると
状況を伝えやすくなります。
日本語の文字は
特に確認が必要
初心者が
勘違いしやすいのは
「画像の文字なら
原文どおりに読める」
という考え方です。
OpenAIは
日本語や韓国語など
ラテン文字以外を含む
画像について
性能が低下する場合が
あると説明しています。
そのため
日付や金額
電話番号や型番など
一文字の違いが
重要になる情報では
元画像との照合が必要です。
文章の概要を知る用途と
一字一句の正確さが
必要な用途では
求められる精度が違います。
重要な情報の場合は
ChatGPTの回答だけで
確定しないようにしましょう。
対応する画像形式と
サイズにも条件がある
OpenAI公式では
画像入力に対応する形式を
PNG、JPEG
非アニメーションGIFと
案内しています。
画像1枚あたりの
サイズ上限は
20MBです。
画像を送れない場合は
まずファイル形式と
容量を確認してください。
一度に追加できる
画像の枚数については
固定の上限枚数が
公式には示されていません。
画像サイズや
一緒に送る文章量などで
変わるとされています。
送信できないときは
枚数や画像サイズを
減らす方法が
案内されています。
個人情報が写った
画像には注意する
スクリーンショットには
名前やメールアドレス
住所、電話番号などが
写り込むことがあります。
質問に必要のない情報は
画像を送る前に
隠しておくほうが
扱いやすいでしょう。
また個人向けChatGPTでは
設定によって
会話や画像などの内容が
モデル改善に使われる
場合があります。
「すべての人のために
モデルを改善する」を
オフにすると
新しい会話を
モデル改善に使わない
設定にできます。
FAQ
手書き文字も
読み取れますか?
読み取れる場合はありますが
正確性は画像の状態や
文字の書き方によって
変わります。
重要な内容なら
読み取った結果と
原文を照合してください。
長い文章の画像も
読めますか?
画像として
認識できる範囲なら
質問できます。
ただし文字が
極端に小さくなる場合は
ページを分けたり
必要部分を拡大したり
すると確認しやすくなります。
読み取り結果だけを
コピーできますか?
ChatGPTへ
「画像内の文字だけ
書き出してください」
と依頼すれば
回答として文字を
出力できます。
その文章を
必要な場所へ
コピーして使えます。
ただし重要な内容では
誤認識がないか
確認してください。
表の文字も
読み取れますか?
表やグラフを含む画像も
分析対象にできます。
ただし細かい表や
色、線の種類によって
正確に理解できない場合が
あるとされています。
無料プランでも
利用できますか?
画像入力は
無料プランと
有料プランで
利用できます。
ただし
プランごとの利用上限や
アカウント設定が
適用されます。
まず短い文章の
スクショで試してみる
最初に
短い文章が表示された
スクリーンショットを
1枚用意してください。
ChatGPTへ画像を送り
「画像内の文章を
そのまま書き出して」
と質問します。
次に回答と元画像を比べ
正しく読めているか
確認してください。
うまく読めない場合は
文字を拡大した画像を
追加して試します。
この方法なら
自分の環境で
どの程度読み取れるかを
確認できます。
まとめ
ChatGPTは
スクリーンショット内の
文字を読み取り
内容について
質問できます。
画像を添付して
「文字を読み取って」
と伝えるだけでも
利用できます。
ただし
小さい文字や
不鮮明な画像
日本語を含む画像では
誤認識する場合があります。
特に数字や固有名詞など
間違えると困る情報は
元画像と照合してください。
まずは短い文章の
スクリーンショットを
1枚送って
読み取り結果を比べるのが
確認しやすい方法です。
参考情報・出典
出典元:
OpenAI Help Center
確認内容:
画像入力の利用方法
対応形式、サイズ上限
文字認識の制限について
URL:
ChatGPT 画像入力 FAQ
出典元:
OpenAI Help Center
確認内容:
スクリーンショットや
画像、図表を分析できる
機能について
URL:
ChatGPT Capabilities Overview
出典元:
OpenAI Help Center
確認内容:
画像を含むファイルの
容量制限について
URL:
File storage and Library in ChatGPT
出典元:
OpenAI Help Center
確認内容:
会話をモデル改善に
利用する設定の
変更方法について
この記事へのコメントはありません。