Документът се разархивира в браузъра, чете се като XML и излиза в избрания формат, без да напуска машината ти.
DOCX и ODT са ZIP архиви с XML вътре. DOCX държи текста в word/document.xml, ODT в content.xml. Тоест файлът се разархивира и се чете като структура, а не се разчита като двоичен формат. Затова и двата се обработват с един и същ подход.
Форматът .doc е двоичен и е построен съвсем иначе, не като ZIP архив, затова иска изцяло различен код. Инструментът го отказва вместо да опита и да върне нещо непредвидимо. Практическото решение е файлът първо да се запише като DOCX или ODT.
Документът е структура плюс оформление. Тук се пази структурата и се казва направо кое се изпуска. Редовете и клетките на таблица стават истинска таблица в Markdown, с разделител за заглавния ред, или таблица в HTML. Списъкът остава списък. Заглавието остава заглавие, ако е било истинско заглавие.
Ред, направен да изглежда като заглавие само чрез по-едър и удебелен шрифт, излиза като обикновен абзац. Програмите разпознават заглавие по приложен стил, не по вида му. Това е и добър повод за подреждане: документ със стилове се преобразува правилно навсякъде, не само тук.
Защото PDF не съдържа документ, а указания за рисуване: постави тази буква на тази точка с този шрифт. В него няма абзаци, заглавия и таблици като структура, тоест няма какво да се извади обратно. Възстановяването им е отделна задача с познаване на образци, а не преобразуване.
И не се стреми да бъде. Word и LibreOffice подреждат текста със стотици свои настройки за шрифт, разредка и стил, а възпроизвеждането им е отделен проект. Изходът тук е чист документ със същата структура, четим и предвидим, а не опит да прилича до пиксел.
Markdown е за текст, който ще живее в хранилище или в система за документация, където важи съдържанието, а не оформлението. HTML е за публикуване. Чистият текст е за по-нататъшна обработка, търсене или сравнение, където всяко форматиране само пречи. PDF е за изпращане на човек, който просто трябва да го прочете. Четирите изхода не са четири качества на едно и също, а четири различни предназначения. Затова и изборът се прави според това къде отива файлът, а не според това кой формат изглежда най-универсален: универсалният формат обикновено е този, който не върши работа никъде докрай.
Защото и двата са ZIP архиви с XML вътре: DOCX държи текста в word/document.xml, ODT в content.xml. Четат се по един и същ начин.
Не. Старият .doc е двоичен формат, построен съвсем иначе, и иска различен код. Запиши файла като DOCX или ODT и го подай наново.
Да. Редовете и клетките стават истинска таблица в Markdown или в HTML, а списъкът остава списък.
Защото PDF съдържа указания за рисуване, не документ със структура. В него няма абзаци и таблици, които да се извадят обратно.
Не, и не е замислен така. Пази се структурата, а не оформлението: точното възпроизвеждане на подредбата на Word е отделна задача.
Излиза като обикновен абзац, защото програмите разпознават заглавие по приложен стил, а не по вида му.
Да, списъкът излиза като списък и в Markdown, и в HTML, със своята подредба. Това, което не се пренася, е визуалното оформление около него: разстояния, шрифт и отстъпи, зададени в самия документ.
Markdown за хранилище или документация, HTML за публикуване, чист текст за обработка и търсене, PDF за изпращане на човек, който просто ще го прочете.
Не. Разархивирането и четенето стават в браузъра, файлът не напуска машината ти.