Към съдържанието
Безплатен инструмент, без регистрация

DOCX и ODT, структурата остава

Документът се разархивира в браузъра, чете се като XML и излиза в избрания формат, без да напуска машината ти.

Отвори инструмента Всички инструменти In English

Защо и двата формата се четат без допълнителна библиотека

DOCX и ODT са ZIP архиви с XML вътре. DOCX държи текста в word/document.xml, ODT в content.xml. Тоест файлът се разархивира и се чете като структура, а не се разчита като двоичен формат. Затова и двата се обработват с един и същ подход.

Старият .doc не е от същото семейство

Форматът .doc е двоичен и е построен съвсем иначе, не като ZIP архив, затова иска изцяло различен код. Инструментът го отказва вместо да опита и да върне нещо непредвидимо. Практическото решение е файлът първо да се запише като DOCX или ODT.

Какво оцелява и какво не

Документът е структура плюс оформление. Тук се пази структурата и се казва направо кое се изпуска. Редовете и клетките на таблица стават истинска таблица в Markdown, с разделител за заглавния ред, или таблица в HTML. Списъкът остава списък. Заглавието остава заглавие, ако е било истинско заглавие.

Заглавието, което е само удебелено

Ред, направен да изглежда като заглавие само чрез по-едър и удебелен шрифт, излиза като обикновен абзац. Програмите разпознават заглавие по приложен стил, не по вида му. Това е и добър повод за подреждане: документ със стилове се преобразува правилно навсякъде, не само тук.

Защо няма обратна посока от PDF

Защото PDF не съдържа документ, а указания за рисуване: постави тази буква на тази точка с този шрифт. В него няма абзаци, заглавия и таблици като структура, тоест няма какво да се извади обратно. Възстановяването им е отделна задача с познаване на образци, а не преобразуване.

PDF изходът не е снимка на оригинала

И не се стреми да бъде. Word и LibreOffice подреждат текста със стотици свои настройки за шрифт, разредка и стил, а възпроизвеждането им е отделен проект. Изходът тук е чист документ със същата структура, четим и предвидим, а не опит да прилича до пиксел.

Кой изход за какво служи

Markdown е за текст, който ще живее в хранилище или в система за документация, където важи съдържанието, а не оформлението. HTML е за публикуване. Чистият текст е за по-нататъшна обработка, търсене или сравнение, където всяко форматиране само пречи. PDF е за изпращане на човек, който просто трябва да го прочете. Четирите изхода не са четири качества на едно и също, а четири различни предназначения. Затова и изборът се прави според това къде отива файлът, а не според това кой формат изглежда най-универсален: универсалният формат обикновено е този, който не върши работа никъде докрай.

Какво питат хората

Защо инструментът чете и DOCX, и ODT?

Защото и двата са ZIP архиви с XML вътре: DOCX държи текста в word/document.xml, ODT в content.xml. Четат се по един и същ начин.

Мога ли да подам стар .doc файл?

Не. Старият .doc е двоичен формат, построен съвсем иначе, и иска различен код. Запиши файла като DOCX или ODT и го подай наново.

Запазват ли се таблиците и списъците?

Да. Редовете и клетките стават истинска таблица в Markdown или в HTML, а списъкът остава списък.

Защо няма преобразуване от PDF към DOCX?

Защото PDF съдържа указания за рисуване, не документ със структура. В него няма абзаци и таблици, които да се извадят обратно.

PDF изходът ще изглежда ли като оригинала?

Не, и не е замислен така. Пази се структурата, а не оформлението: точното възпроизвеждане на подредбата на Word е отделна задача.

Какво става със заглавие, което е само удебелено?

Излиза като обикновен абзац, защото програмите разпознават заглавие по приложен стил, а не по вида му.

Запазва ли се номерацията на списъка?

Да, списъкът излиза като списък и в Markdown, и в HTML, със своята подредба. Това, което не се пренася, е визуалното оформление около него: разстояния, шрифт и отстъпи, зададени в самия документ.

Кой изходен формат да избера?

Markdown за хранилище или документация, HTML за публикуване, чист текст за обработка и търсене, PDF за изпращане на човек, който просто ще го прочете.

Качва ли се файлът някъде?

Не. Разархивирането и четенето стават в браузъра, файлът не напуска машината ти.