ESC

言語検出ツール

例を試す:
信頼度: 0%
その他の可能性のある言語:

サポートされている言語

  • English
  • Turkish (Türkçe)
  • Spanish (Español)
  • German (Deutsch)
  • French (Français)
  • Italian (Italiano)
  • Portuguese
  • Dutch
  • Polish
  • Swedish
  • Danish / Norwegian
  • Finnish
  • Japanese (日本語)
  • Chinese (中文)
  • Korean (한국어)
  • Arabic (العربية)
  • Russian (Русский)
  • Hebrew (עברית)
  • Hindi (हिन्दी)
  • Thai (ภาษาไทย)
  • Greek (Ελληνικά)
すべての検出はブラウザで行われます。テキストはどのサーバーにも送信されません。

機能

即時検出

300msのデバウンスで入力中に結果が表示されます — クリック不要

20以上の言語

ラテン文字以外の文字体系を含む、ヨーロッパ、アジア、中東の言語を検出

信頼スコア

検出の信頼度と上位の代替言語候補を表示

プライバシー優先

すべての処理はブラウザでローカルに実行 — テキストはデバイスから離れません

使い方

1

テキストを貼り付け

入力エリアに任意のテキストを入力または貼り付けてください。20文字以上で最高の精度が得られます。

2

結果を確認

検出された言語、信頼スコア、可能性のある代替言語が即座に表示されます。

3

コピーまたは続行

結果をクリップボードにコピーするか、クリアボタンで別のテキストを試してください。

よくある質問

このツールは2つの補完的な手法を使用します。非ラテン文字の場合、文字範囲分析が使用されます:日本語(ひらがな、カタカナ、漢字)、アラビア語、ヘブライ語、ロシア語/キリル文字、韓国語(ハングル)、中国語、ヒンディー語(デーヴァナーガリ)、タイ語、およびギリシャ語はすべて固有のUnicode範囲を持っており、即座に一義的な検出が可能です。ラテン文字言語(英語、スペイン語、フランス語、ドイツ語、イタリア語、ポルトガル語、オランダ語、ポーランド語、スウェーデン語、ノルウェー語、デンマーク語、フィンランド語)については、ストップワード頻度分析を使用します。各言語には非常に一般的な機能単語(de, the, le, die, etなど)のセットがあり、ストップワードリストの照合数が最も多い言語が選ばれます。信頼度は、勝った言語が他の選択肢をどれだけ明確に上回ったかに基づいています。

このツールは少なくとも20文字を必要とします。最良の結果を得るには、完全な文章またはそれ以上(50文字以上)を使用してください。短いテキストは曖昧です。例えば "Bonjour monde" のような2単語のフレーズはフランス語として検出可能ですが、「pasta」のような単一の単語はイタリア語、英語、あるいはあらゆる言語の固有名詞である可能性があります。ラテン文字言語の場合、より長いテキストでは、より多くのストップワードが現れる可能性があるため、精度が大幅に向上します。非ラテン文字(日本語、アラビア語、ロシア語など)は、文字セット自体が識別可能であるため、非常に短いサンプルからでも検出可能です。

混合言語の検出は、いかなる言語検出器にとっても本来難しいものです。テキストに一つの支配的な言語が含まれ、時折外国語が含まれる場合、検出器は通常、支配的な言語を正しく識別します。テキストが2つの言語間で約50/50の場合、結果は信頼できません。コードスイッチング(2つの言語で交互に文章を書くこと)は、通常、より多くの単語を持つ言語として識別されます。信頼度スコアは信号となります:低い信頼度(60%未満)は、テキストが多言語であるか、入力が信頼できる判断を下すには短すぎる可能性があることを示唆しています。

いいえ。この検出器は言語を識別するものであり、方言や地域の変種ではありません。イギリス英語、アメリカ英語、オーストラリア英語はすべて英語として識別されます。欧州ポルトガル語とブラジルポルトガル語はポルトガル語として識別されます。カスティリャのスペイン語と中南米のスペイン語はスペイン語として識別されます。方言検出には、方言データで訓練された専用のNLPモデルが必要です。このツールは言語レベルの識別を重視しており、実用的なユースケースの大部分をカバーしています。

英語、トルコ語、スペイン語、ドイツ語、フランス語、イタリア語、ポルトガル語、オランダ語、ポーランド語、スウェーデン語、ノルウェー語、デンマーク語、フィンランド語、日本語、中国語、韓国語、アラビア語、ロシア語、ヘブライ語、ヒンディー語、タイ語、およびギリシャ語の計21言語です。欧州のラテン文字言語は十分にカバーされており、すべての主要な非ラテン文字(アラビア語、CJK、キリル文字、デーヴァナーガリ、ヘブライ語、タイ語)がサポートされています。このリストにない言語(例:ベトナム語、スワヒリ語、マレー語、インドネシア語)は、Unknown(不明)または外見の似ている言語への誤検知を返すことがあります。

このツールは検出のアプローチを理解するのに有用ですが、Webアプリケーションでの本番用の言語検出には、サーバーサイドのライブラリ(franc (Node.js)、langdetect (Python)、または lingua (多言語対応))を使用してください。これらのライブラリはより正確で、より多くの言語をサポートしています。ここで示されているブラウザベースのアプローチは、近似的な検出で十分なユーザー向けツール(例:ユーザーが貼り付けたコンテンツに基づいてUIの言語を自動選択するなど)に適していますが、精度が極めて重要な自動コンテンツモデレーションやコンプライアンスフィルタリングには使用すべきではありません。

いいえ。検出アルゴリズム全体は、JavaScriptを使用してブラウザ内で実行されます。あなたのテキストは、内容に関わらず、決してデバイスから外へ出られることはありません。このツールはページが読み込まれた後は完全にオフラインで動作します。

信頼度スコアは、勝った言語が他の選択肢をどれだけ明確に上回ったかを反映しています。高い信頼度(85-100%)は、検出された言語がほぼ確実に正しいことを意味します。中程度の信頼度(60-85%)は、検出はおそらく正しいが、テキストに多少の曖昧さがあったことを意味します。低い信頼度(60%未満)は、テキストが短いか、混合言語であるか、あるいは検出を不安定にするような珍しい語彙を使用していることを意味します。結果は決定的な回答ではなく、あくまで「提案」として扱ってください。「その他の可能性のある言語」のリストには次点の候補が表示され、信頼度が低い場合に参考になることがあります。

言語検出ツールとは?

言語検出ツールは、テキストを分析してどの人間言語で書かれているかを識別するツールです。この無料オンライン言語検出ツールはブラウザで完全に動作します — アカウント、アップロード、サーバーは不要です。ラテン文字言語と、日本語、中国語、韓国語、アラビア語、ロシア語、ヘブライ語、ヒンディー語、タイ語、ギリシャ語などの非ラテン文字を含む21言語をサポートしています。

このツールを使う理由

このブラウザベースの言語検出ツールは、ユーザー入力を処理する開発者、多言語の投稿をレビューするコンテンツモデレーター、ソーステキストを特定する翻訳者、多言語学習者と作業する教育者、および不明な言語でテキストを受け取るすべての人に役立ちます。すべてがクライアントサイドのJavaScriptで実行されるため、機密文書をプライバシーリスクなしに分析できます。

セキュリティとプライバシー

あなたのデータの安全を最優先しています

ローカル処理

すべての処理がブラウザ内で完結します

データ送信なし

データはサーバーに送信されません

保存しません

データは保存も共有もされません

SSL暗号化

安全な通信でご利用いただけます

次のステップ

MoreOnlineToolsでもっと見る