пере.рф

Кейсы / Веб-приложение · AI-платформа

Платформа AI-перевода на домене из двух букв.

пере.рф — платформа, которая переводит целые документы: DOCX, XLSX, PDF, в том числе сканы, сохраняя таблицы, стили и терминологию. Мы спроектировали и разработали её своей командой: движок перевода на базе AI-моделей внутри серьёзной инженерии, на одном из самых коротких доменов, что бывают.

пере.рф ↗

пере.рф
Главная страница платформы AI-перевода пере.рф: загрузка документа и выбор языков

Проблема

Переводить документы вручную — не масштабируется.

Договоры, справки, таблицы, сканы PDF: переводить их вручную — значит перенабирать таблицы, заново собирать вёрстку и страница за страницей следить за единством терминов. Обычные машинные переводчики, наоборот, ломают форматирование и не знают отраслевого словаря.

Нужна была система, которая переводит документ, а не только текст: которая возвращает тот же файл, в той же форме, на другом языке — с терминологией под контролем.

Наш ответ

Платформа, которая переводит документ, а не только текст.

Мы спроектировали и разработали пере.рф: загружаешь DOCX, XLSX или PDF — получаешь тот же документ в переводе, с таблицами, стилями и заголовками на своих местах. Движок перевода работает на AI-моделях; вокруг — архитектура из очередей и воркеров, которая держит большие файлы и долгие задачи. Это та же инженерия, которую мы вкладываем в веб-приложения на заказ для наших клиентов.

Мультиформат — DOCX, XLSX, PDF (в том числе сканы), TXT, HTML, до 100 МБ
OCR для сканированных PDF, структура документа восстанавливается на выходе
Автоглоссарий и память переводов для единства терминов
Автоматический контроль качества и прогресс в реальном времени на экране

Что мы построили

Функции — от загруженного файла до переведённого документа.

01Мультиформатная загрузка. DOCX, XLSX, PDF с текстом или сканы, TXT и HTML, до 100 МБ на файл, с извлечением текста и структуры.
02Автоматический конвейер. Каждый документ проходит статусы загрузка → анализ → готово, с определением тематики ещё до начала перевода.
03Движок AI-перевода. Модели GPT от OpenAI: одна модель анализирует тематику и стиль, другая переводит текст, разбитый на блоки.
04Автоглоссарий. Извлечение двуязычных терминов из документа, правка вручную, экспорт TMX для внешних CAT-инструментов.
05Память переводов. Одинаковые уже переведённые сегменты переиспользуются между проектами — ради единства и экономии.
06Контроль качества. Движок QA проверяет пропущенные сегменты, терминологию, числа и форматирование, с уровнями серьёзности.
07Мультиформатный экспорт. DOCX и XLSX, собранные заново с таблицами и стилями, двуязычная версия рядом и файл TMX.
08Realtime и аккаунты. Прогресс перевода по WebSocket, тарифы и оплата, панель администратора, свой AI-ключ (BYOK).

Как это работает

Путь документа — от загрузки до переведённого файла.

Каждый шаг пути — это задача в очереди: если шаг медленный — OCR PDF, перевод длинного файла — он не блокирует интерфейс и может продолжиться с контрольной точки, не начиная сначала.

01Анализ файла. Извлечение текста и структуры из DOCX, XLSX или PDF; для сканированных PDF подключается OCR.
02Анализ тематики. AI-модель определяет тему, уровень технической сложности и стиль документа.
03Глоссарий и инструкции. Извлечение двуязычных терминов и генерация инструкций перевода под конкретный текст.
04Перевод блоками. Текст делится на сегменты и переводится партиями, память переводов работает как кеш, ошибки повторяются автоматически.
05Проверка качества. Пропущенные сегменты, терминология, числа и форматирование проверяются перед выдачей.
06Сборка файла. Документ собирается заново со своей структурой, плюс двуязычная версия и экспорт TMX.

Как всё устроено внутри

Архитектура на очередях, рассчитанная на большие файлы.

Модульный бэкенд-API; тяжёлые операции — парсинг, OCR, перевод, QA, экспорт — проходят через очередь, которой занимаются выделенные воркеры, поэтому интерфейс остаётся отзывчивым, а каждая задача может продолжиться с контрольной точки. Конвертация и сборка документов живут в отдельном Python-микросервисе.

ФронтNext.js 15 и React 19, TypeScript, Tailwind, Framer Motion
БэкендNestJS на Fastify, Prisma ORM, модульный API
ДанныеPostgreSQL — документы, задачи, глоссарии, память переводов, логи использования
ОчередьBullMQ + Redis, выделенные воркеры с контрольными точками и retry
AIМодели GPT от OpenAI для анализа тематики, перевода и QA
ФайлыS3-совместимое хранилище (MinIO/S3), OCR на Tesseract и PaddleOCR
AuthJWT и Google OAuth, роли и тарифы, оплата через Stripe
ДеплойDocker Compose, Nginx, CI/CD на GitHub Actions

Этапы

Строили этапами, ничего не переделывая дважды.

Каждый этап даёт что-то работающее и готовит следующий. Тот же метод, которым мы выводим в онлайн проекты клиентов: сначала фундамент, потом поток, приносящий ценность, потом остальное.

01Фундамент. Структура проекта, аутентификация, роли и тарифы, первая версия базы данных.
02Загрузка и конвейер документов. Мультиформатная загрузка, парсинг, OCR, определение тематики.
03Движок AI-перевода. Перевод блоками, автоглоссарий, память переводов.
04Качество и экспорт. Движок QA, сборка DOCX и XLSX, двуязычная версия, TMX.
05Realtime, оплата и админка. Прогресс по WebSocket, тарифы и оплата, панель администратора.

Результат

Полноценная платформа — на домене из двух букв.

От загрузки файла до выдачи переведённого документа всё проходит через одну платформу: AI-движок, глоссарий, память, контроль качества и экспорт в одном потоке. И работает это на пере.рф — адресе, который диктуется по телефону за секунду.

16

поддерживаемых языков, среди них итальянский, английский и русский

5

форматов файлов: DOCX, XLSX, PDF, TXT, HTML

100 МБ

максимальный размер одного документа

ПРОЕКТ ГРУППЫ REMARKA — РАБОТАЕТ НА пере.рф

Заинтересовал этот проект?

Нужно разработать похожее приложение или сайт? Обращайтесь.

Проектируем и разрабатываем сайты и веб-приложения на заказ для компаний и специалистов. Расскажите о своей идее: смета за 24 часа, фиксированная цена.