Konwerter Word do Markdown

Przekształć nowoczesny dokument Word .docx w czysty, edytowalny Markdown bez wysyłania pliku. Przeglądarka odczytuje strukturę dokumentu i zachowuje obsługiwane nagłówki, akapity, pogrubienie, kursywę, linki, listy, cytaty, style kodu oraz proste tabele. Sprawdź bezpieczny podgląd, skopiuj wynik lub pobierz plik .md. Obrazy są zastępowane wyraźnym znacznikiem pominięcia, a układ strony i funkcje właściwe dla Worda są uczciwie wskazywane jako ograniczenia.

Jak przekonwertować dokument Word do Markdown

  1. 1

    Wybierz DOCX

    Otwórz niezaszyfrowany plik `.docx`. Konwerter lokalnie sprawdza strukturę ZIP i Office Open XML.

  2. 2

    Wybierz znaczniki Markdown

    Wybierz nagłówki z kratkami lub podkreśleniem oraz myślnik albo gwiazdkę dla list punktowanych.

  3. 3

    Sprawdź strukturę

    Przejrzyj bezpieczny podgląd i komunikaty o pominiętych obrazach lub funkcjach Worda, których nie da się wiernie zapisać w Markdown.

  4. 4

    Skopiuj lub pobierz

    Skopiuj Markdown albo zapisz go jako plik `.md` UTF-8 o nazwie utworzonej na podstawie pliku DOCX.

Od WordprocessingML do Markdown

DOCX jest pakietem Office Open XML, a nie pojedynczym strumieniem sformatowanego tekstu. Microsoft opisuje podstawowy pakiet edytora tekstu jako zbiór części, w tym główną część dokumentu zawierającą jego treść. Konwerter najpierw sprawdza oczekiwaną strukturę pakietu, a następnie za pomocą Mammoth.js tworzy pośredni semantyczny HTML. Mammoth zaleca zachowanie struktury semantycznej zamiast dokładnego odtwarzania wyglądu Worda, co dobrze odpowiada możliwościom Markdown.

Pośredni HTML jest analizowany w pamięci i przekształcany w bloki oraz elementy liniowe CommonMark. Proste tabele korzystają z rozszerzenia tabel GitHub Flavored Markdown. Surowy HTML nigdy nie jest osadzany. Podgląd powstaje z Markdown i przed wyświetleniem jest oczyszczany.

Struktura Worda Wynik Markdown Granica konwersji
Style nagłówków Nagłówki z # lub nagłówki Setext poziomu 1 i 2 Sam wizualny rozmiar czcionki nie definiuje nagłówka
Akapity, pogrubienie, kursywa, przekreślenie Akapity i znaczniki liniowe Czcionki, kolory i dokładne odstępy są pomijane
Listy uporządkowane i punktowane Numerowane i wcięte elementy list Złożona numeracja niestandardowa może wymagać poprawek
Hiperłącza [etykieta](URL) Zachowywane są tylko bezpieczne linki internetowe, e-mail i odsyłacze
Proste tabele Tabela GFM z pionowymi kreskami Scalane komórki i złożone układy są spłaszczane
Obrazy i obiekty osadzone Widoczny znacznik pominięcia Media binarne nie są eksportowane do Markdown

Przykład

Załóżmy, że DOCX zawiera nagłówek poziomu 1 Stan projektu, dwa akapity, numerowany plan z trzema krokami oraz tabelę 2 × 3 z osobą odpowiedzialną i terminem. Przy nagłówkach z kratkami wynik zaczyna się od # Stan projektu, po czym następują zwykłe akapity, znaczniki 1. i tabela GFM, której pierwszy wiersz staje się nagłówkiem. Jeśli dokument zawiera też pływający wykres, nie zostanie on przekonwertowany. Narzędzie wyświetli informację o ograniczeniu, aby brak obiektu nie został uznany za poprawny eksport.

Czego Markdown nie zachowa

Markdown opisuje strukturę treści, a nie paginację Worda. Strony, kolumny, marginesy, nagłówki i stopki, czcionki, kolory, pozycje pływające, pola tekstowe, wykresy, SmartArt, równania, makra, obiekty OLE, formularze, komentarze i historia zmian nie należą do zakresu wyniku. Złożone tabele ze scalonymi komórkami mogą utracić oczekiwaną siatkę. Dokumenty techniczne i objęte regulacjami należy dokładnie sprawdzić, zachowując oryginalny DOCX jako źródło nadrzędne.

Limity plików i prywatność

Konwerter przyjmuje .docx, ale nie starsze .doc, .docm, ODT ani PDF. Odrzuca pakiety bez oczekiwanych części Office Open XML, zaszyfrowane wpisy ZIP, ponad 2000 wpisów, pliki większe niż 25 MiB po kompresji lub 80 MiB po rozpakowaniu. Limity ograniczają ryzyko dla pamięci, lecz nie naprawiają uszkodzonych plików.

Bajty DOCX, nazwa pliku, wyodrębniona struktura, ustawienia, podgląd i Markdown pozostają w tej przeglądarce. W trybie wieloetapowym losowy token w sessionStorage tej karty wskazuje przez maksymalnie dwie godziny na wygasający rekord IndexedDB. Treść nigdy nie trafia do adresu URL ani przez Livewire. Rozpoczęcie od nowa usuwa token i zapisany rekord.

Najczęściej zadawane pytania

Użyj nowoczesnego, niezaszyfrowanego pliku .docx. Starsze .doc, pliki .docm z makrami, ODT, PDF, zaszyfrowane pakiety, uszkodzone pliki i pliki przekraczające limity są odrzucane. Starszy dokument Word zapisz najpierw jako DOCX.

Konwerter obsługuje semantyczne nagłówki, akapity, pogrubienie, kursywę, przekreślenie, bezpieczne linki, podziały wiersza, listy uporządkowane i punktowane, cytaty, style kodu udostępnione przez Word oraz proste tabele GFM. Wyłącznie wizualne formatowanie bez struktury semantycznej może nie zostać poprawnie odwzorowane.

Obrazy otrzymują widoczny znacznik pominięcia i ostrzeżenie. Układ strony, kolumny, nagłówki, stopki, czcionki, kolory, elementy pływające, scalone tabele, wykresy, SmartArt, równania, makra, obiekty osadzone, formularze, komentarze i historia zmian nie są odtwarzane dokładnie.

Word jest systemem układu stron, a Markdown opisuje lekką strukturę dokumentu. Konwerter zachowuje obsługiwane znaczenie, nie pozycje pikseli, podziały stron, czcionki ani dokładne odstępy. Przed publikacją sprawdź i popraw wynik.

Nie. Bajty, nazwa, zawartość, ustawienia, podgląd i Markdown pozostają w przeglądarce, nie są wysyłane przez Livewire ani umieszczane w adresie URL. Odtwarzanie procesu używa tymczasowego rekordu tylko w tej karcie, a rozpoczęcie od nowa go usuwa.

Powiązane narzędzia