forum.opennet.ru

Составление сообщения

Исходное сообщение

"Релиз системы распознавания текста Tesseract 4.0"
Отправлено opennews, 01-Ноя-18 00:15

Опубликован (https://groups.google.com/forum/#!topic/tesseract-ocr/DgJDXg... релиз системы оптического распознавания текста Tesseract 4.0 (https://github.com/tesseract-ocr/tesseract/), поддерживающей распознавания документов на более чем 100 языках, включая русский, казахский, белорусский  и украинский. Результат может сохраняться как открытым текстом, так и в форматах HTML, PDF и TSV. Изначально система была создана в 1985-1995 годы в лаборатории компании Hewlett Packard, в 2005 году код был открыт под лицензией Apache и в дальнейшем развивался при участии работников компании Google. Исходные тексты  проекта распространяются (https://github.com/tesseract-ocr/tesseract) под лицензий Apache 2.0.

Основные улучшения (https://github.com/tesseract-ocr/tesseract/wiki/ReleaseNotes... в Tesseract 4.0:

-  Новый движок распознавания, базирующийся на применении системы машинного обучения на базе рекуррентной нейронной сети LSTM (https://ru.wikipedia.org/wiki/%D0%94%D0%... оптимизированной для распознавания целиком строк и позволяющей добиться существенного увеличения точности. Старый движок, распознающий текст на уровне шаблонов отдельных символов, продолжает поставляться в качестве опции. Альтернативный движок Cube удалён из кодовой базы;
-  Добавлены сопутствующие новому OCR-движку утилиты для тренировки модели машинного обучения. Готовые натренированные модели опубликованы для 123 языков (https://github.com/tesseract-ocr/tesseract/wiki/Data-Files#u...
-  Для нового движка распознавания подготовлены модули для оптимизации производительности при помощи OpenMP и SIMD-инструкций AVX2, AVX  или SSE4.1;
-  Осуществлён переход к нумерации версий в соответствии со спецификацией "Cемантическое версионирование (https://semver.org/)", подразумевающей использование нотации X.Y.Z (вместо ранее используемой W.X.Y.Z), в которой X меняется при внесении изменений, нарушающих обратную совместимость, Y меняется при расширении функциональности и Z при исправлении ошибок.
-  Обновлена сборочная система. Для сборки теперь требуется компилятор с поддержкой C++ 11. Добавлены unit-тесты.  Добавлен режим сборки без старого движка распознавания. Выполнена реогранизация дерева исходных текстов. Проведена чистка устаревшего кода;
-  Улучшена обработка многостраничных TIFF-изображений;
-  Улучшен экспорт в PDF.

URL: https://groups.google.com/forum/#!topic/tesseract-ocr/DgJDXg...
Новость: https://www.opennet.ru/opennews/art.shtml?num=49534

Исходное сообщение
"Релиз системы распознавания текста Tesseract 4.0" Отправлено opennews, 01-Ноя-18 00:15
Опубликован (https://groups.google.com/forum/#!topic/tesseract-ocr/DgJDXg... релиз системы оптического распознавания текста Tesseract 4.0 (https://github.com/tesseract-ocr/tesseract/), поддерживающей распознавания документов на более чем 100 языках, включая русский, казахский, белорусский и украинский. Результат может сохраняться как открытым текстом, так и в форматах HTML, PDF и TSV. Изначально система была создана в 1985-1995 годы в лаборатории компании Hewlett Packard, в 2005 году код был открыт под лицензией Apache и в дальнейшем развивался при участии работников компании Google. Исходные тексты проекта распространяются (https://github.com/tesseract-ocr/tesseract) под лицензий Apache 2.0. Основные улучшения (https://github.com/tesseract-ocr/tesseract/wiki/ReleaseNotes... в Tesseract 4.0: - Новый движок распознавания, базирующийся на применении системы машинного обучения на базе рекуррентной нейронной сети LSTM (https://ru.wikipedia.org/wiki/%D0%94%D0%... оптимизированной для распознавания целиком строк и позволяющей добиться существенного увеличения точности. Старый движок, распознающий текст на уровне шаблонов отдельных символов, продолжает поставляться в качестве опции. Альтернативный движок Cube удалён из кодовой базы; - Добавлены сопутствующие новому OCR-движку утилиты для тренировки модели машинного обучения. Готовые натренированные модели опубликованы для 123 языков (https://github.com/tesseract-ocr/tesseract/wiki/Data-Files#u... - Для нового движка распознавания подготовлены модули для оптимизации производительности при помощи OpenMP и SIMD-инструкций AVX2, AVX или SSE4.1; - Осуществлён переход к нумерации версий в соответствии со спецификацией "Cемантическое версионирование (https://semver.org/)", подразумевающей использование нотации X.Y.Z (вместо ранее используемой W.X.Y.Z), в которой X меняется при внесении изменений, нарушающих обратную совместимость, Y меняется при расширении функциональности и Z при исправлении ошибок. - Обновлена сборочная система. Для сборки теперь требуется компилятор с поддержкой C++ 11. Добавлены unit-тесты. Добавлен режим сборки без старого движка распознавания. Выполнена реогранизация дерева исходных текстов. Проведена чистка устаревшего кода; - Улучшена обработка многостраничных TIFF-изображений; - Улучшен экспорт в PDF. URL: https://groups.google.com/forum/#!topic/tesseract-ocr/DgJDXg... Новость: https://www.opennet.ru/opennews/art.shtml?num=49534

Ваше сообщение

Имя*:

EMail:

Для отправки ответов на email укажите знак ! перед адресом, например, !user@host.ru (!! - не показывать email).
Более тонкая настройка отправки ответов производится в профиле зарегистрированного участника форума.

Заголовок*:

Сообщение*:

> Опубликован (https://groups.google.com/forum/#!topic/tesseract-ocr/DgJDXg7ifDQ) 
> релиз системы оптического распознавания текста Tesseract 4.0 (https://github.com/tesseract-ocr/tesseract/), 
> поддерживающей распознавания документов на более чем 100 языках, включая русский, казахский, 
> белорусский  и украинский. Результат может сохраняться как открытым текстом, так 
> и в форматах HTML, PDF и TSV. Изначально система была создана 
> в 1985-1995 годы в лаборатории компании Hewlett Packard, в 2005 году 
> код был открыт под лицензией Apache и в дальнейшем развивался при 
> участии работников компании Google. Исходные тексты  проекта распространяются (https://github.com/tesseract-ocr/tesseract) 
> под лицензий Apache 2.0.

> Основные улучшения (https://github.com/tesseract-ocr/tesseract/wiki/ReleaseNotes#tesseract-release-notes-oct-29-2018---v400) 
> в Tesseract 4.0:

> -  Новый движок распознавания, базирующийся на применении системы машинного обучения на 
> базе рекуррентной нейронной сети LSTM (https://ru.wikipedia.org/wiki/%D0%94%D0%BE%D0%BB%D0%B3%D0%B0%D1%8F_%D0%BA%D1%80%D0%B0%D1%82%D0%BA%D0%BE%D1%81%D1%80%D0%BE%D1%87%D0%BD%D0%B0%D1%8F_%D0%BF%D0%B0%D0%BC%D1%8F%D1%82%D1%8C), 
> оптимизированной для распознавания целиком строк и позволяющей добиться существенного 
> увеличения точности. Старый движок, распознающий текст на уровне шаблонов отдельных символов, 
> продолжает поставляться в качестве опции. Альтернативный движок Cube удалён из кодовой 
> базы;

> -  Добавлены сопутствующие новому OCR-движку утилиты для тренировки модели машинного обучения. 
> Готовые натренированные модели опубликованы для 123 языков (https://github.com/tesseract-ocr/tesseract/wiki/Data-Files#updated-data-files-for-version-400-september-15-2017); 
 
> -  Для нового движка распознавания подготовлены модули для оптимизации производительности 
> при помощи OpenMP и SIMD-инструкций AVX2, AVX  или SSE4.1;

> -  Осуществлён переход к нумерации версий в соответствии со спецификацией "Cемантическое 
> версионирование (https://semver.org/)", подразумевающей использование нотации X.Y.Z 
> (вместо ранее используемой W.X.Y.Z), в которой X меняется при внесении изменений, 
> нарушающих обратную совместимость, Y меняется при расширении функциональности и Z при 
> исправлении ошибок.

> -  Обновлена сборочная система. Для сборки теперь требуется компилятор с поддержкой 
> C++ 11. Добавлены unit-тесты.  Добавлен режим сборки без старого движка 
> распознавания. Выполнена реогранизация дерева исходных текстов. Проведена чистка устаревшего 
> кода; 
> -  Улучшена обработка многостраничных TIFF-изображений; 
> -  Улучшен экспорт в PDF.

> URL: https://groups.google.com/forum/#!topic/tesseract-ocr/DgJDXg7ifDQ 
> Новость: https://www.opennet.ru/opennews/art.shtml?num=49534

При общении не допускается: неуважительное отношение к собеседнику, хамство, унизительное обращение, ненормативная лексика, переход на личности, агрессивное поведение, обесценивание собеседника, провоцирование флейма голословными и заведомо ложными заявлениями. Не отвечайте на сообщения, явно нарушающие правила - удаляются не только сами нарушения, но и все ответы на них. Лог модерирования.

Партнёры:

Хостинг:

Закладки на сайте
Проследить за страницей

Created 1996-2024 by Maxim Chirkov
Добавить, Поддержать, Вебмастеру