ESC

Определитель языка

Попробовать пример:
Уверенность: 0%
Другие возможные языки:

Поддерживаемые языки

  • English
  • Turkish (Türkçe)
  • Spanish (Español)
  • German (Deutsch)
  • French (Français)
  • Italian (Italiano)
  • Portuguese
  • Dutch
  • Polish
  • Swedish
  • Danish / Norwegian
  • Finnish
  • Japanese (日本語)
  • Chinese (中文)
  • Korean (한국어)
  • Arabic (العربية)
  • Russian (Русский)
  • Hebrew (עברית)
  • Hindi (हिन्दी)
  • Thai (ภาษาไทย)
  • Greek (Ελληνικά)
Все вычисления выполняются в вашем браузере. Текст не отправляется на серверы.

Возможности

Мгновенное определение

Результат появляется по мере ввода с задержкой 300 мс — нажимать кнопку не нужно

20+ языков

Определяет европейские, азиатские и ближневосточные языки, включая нелатинские алфавиты

Уровень уверенности

Показывает уверенность определения и топ альтернативных языков-кандидатов

Конфиденциальность

Все вычисления выполняются локально в браузере — ваш текст никуда не отправляется

Как использовать?

1

Вставьте текст

Введите или вставьте любой текст в поле ввода. Не менее 20 символов обеспечивают наилучшую точность.

2

Смотрите результат

Определённый язык, уровень уверенности и альтернативные варианты отображаются мгновенно.

3

Копируйте или продолжайте

Скопируйте результат в буфер обмена или введите другой текст с помощью кнопки "Очистить".

Часто задаваемые вопросы

Инструмент использует два взаимодополняющих метода. Для нелатинских скриптов используется анализ диапазона символов: японские символы (Хирагана, Катакана, Кандзи), арабский, иврит, русский/кириллица, корейский (Хангуль), китайский, хинди (Деванагари), тайский и греческий имеют уникальные диапазоны Unicode, которые позволяют мгновенно и однозначно определить язык. Для языков с латинским письмом (английский, испанский, французский, немецкий, итальянский, португальский, голландский, польский, шведский, норвежский, датский, финский) инструмент использует анализ частоты стоп-слов — у каждого языка есть набор очень распространенных служебных слов (de, the, le, die, et), и выигрывает тот язык, чей список стоп-слов имеет больше совпадений. Уровень уверенности основан на том, насколько явно победитель превзошел альтернативы.

Инструменту требуется как минимум 20 символов. Для лучших результатов используйте полное предложение или более (50+ символов). Короткие тексты неоднозначны — фраза из двух слов типа "Bonjour monde" может быть распознана как французский, но одиночное слово типа "pasta" может быть итальянским, английским или именем собственным в любом языке. Для языков с латинским письмом точность значительно повышается с увеличением текста, так как появляется больше шансов для появления стоп-слов. Нелатинские скрипты (японский, арабский, русский и т.д.) можно определить даже по очень коротким образцам, так как сам набор символов является диагностическим.

Определение смешанного языка изначально сложно для любого детектора. Если ваш текст содержит один доминирующий язык с редкими иностранными словами, детектор обычно правильно идентифицирует доминирующий язык. Если текст примерно на 50/50 состоит из двух языков, результат будет ненадежным. Переключение кодов (чередование предложений на двух языках) обычно определит тот язык, в котором больше слов. Показатель уверенности дает вам сигнал: низкая уверенность (ниже 60%) предполагает, что текст может быть многоязычным или ввод слишком короток для надежного определения.

Нет. Детектор идентифицирует языки, а не диалекты или региональные разновидности. Британский английский, американский английский и австралийский английский будут идентифицированы как английский. Европейский португальский и бразильский португальский будут идентифицированы как португальский. Кастильский испанский и латиноамериканский испанский будут идентифицированы как испанский. Для определения диалектов потребовались бы специализированные NLP-модели, обученные на диалектных данных. Этот инструмент ориентирован на идентификацию на уровне языка, что охватывает подавляющее большинство практических сценариев использования.

Английский, турецкий, испанский, немецкий, французский, итальянский, португальский, голландский, польский, шведский, норвежский, датский, финский, японский, китайский, корейский, арабский, русский, иврит, хинди, тайский и греческий — всего 21 язык. Европейские языки с латинским письмом хорошо представлены, и все основные нелатинские скрипты (арабский, CJK, кириллица, деванагари, иврит, тайский) поддерживаются. Языки, не входящие в этот список (например, вьетнамский, суахили, малайский, индонезийский), вернут Unknown или ложноположительный результат для похожего по виду языка.

Этот инструмент полезен для понимания подхода к определению, но для промышленного определения языка в веб-приложениях используйте серверную библиотеку: franc (Node.js), langdetect (Python) или lingua (несколько языков). Эти библиотеки более точны и поддерживают больше языков. Подход на основе браузера, показанный здесь, подходит для инструментов взаимодействия с пользователем, где достаточно приблизительного определения (например, автовыбор языка интерфейса на основе вставленного пользователем контента), но его не следует использовать для автоматической модерации контента или фильтрации соответствия, где критична точность.

Нет. Весь алгоритм определения выполняется в вашем браузере с использованием JavaScript. Ваш текст, независимо от того, что он содержит, никогда не покидает ваше устройство. Инструмент работает полностью автономно после загрузки страницы.

Показатель уверенности отражает, насколько явно победивший язык превзошел альтернативы. Высокая уверенность (85-100%) означает, что определенный язык почти наверняка верен. Средняя уверенность (60-85%) означает, что определение, вероятно, верно, но в тексте была некоторая неоднозначность. Низкая уверенность (ниже 60%) означает, что текст короткий, многоязычный или использует необычную лексику, которая делает определение ненадежным — относитесь к результату как к предположению, а не как к окончательному ответу. Список "других возможных языков" показывает кандидатов-претендентов на второе место, что может быть информативно при низкой уверенности.

Что такое определитель языка?

Определитель языка — это инструмент, который анализирует текст и определяет, на каком языке он написан. Этот бесплатный онлайн-определитель работает полностью в браузере — без регистрации, загрузки файлов и серверов. Поддерживает 21 язык, включая латиницу (английский, испанский, французский, немецкий, итальянский, португальский, нидерландский, польский, шведский, норвежский, датский, финский) и другие алфавиты (японский, китайский, корейский, арабский, русский, иврит, хинди, тайский, греческий).

Зачем использовать этот инструмент?

Браузерный определитель языка полезен разработчикам, обрабатывающим пользовательский ввод, модераторам контента, переводчикам, педагогам и всем, кто получает текст на неизвестном языке. Поскольку всё выполняется на стороне клиента в JavaScript, конфиденциальные документы можно анализировать без какого-либо риска утечки данных.

Безопасность и конфиденциальность

Безопасность ваших данных — наш приоритет

Локальная обработка

Вся обработка происходит в вашем браузере

Без передачи данных

Ваши данные не отправляются на наши серверы

Без хранения данных

Данные не хранятся и не передаются

SSL-шифрование

SSL-шифрование для безопасного соединения

Next Step

Также на MoreOnlineTools