קפטן קאט · Captain Cut · התוסף לפרמייר

חלוקת שורות בכתוביות בעברית: למה השורה נשברת באמצע מילה

עורך שמייבא כתוביות בעברית לפרמייר פרו נתקל בשלוש תקלות חוזרות: שורה שנחתכת באמצע מילה, פיסוק שיושב בצד ההפוך, וטקסט שהופך לג'יבריש. כל אחת מהן מוצגת כאן לצד הגרסה התקינה.

7 ימי ניסיון חינם · ביטול בכל רגע

אם ערכת פעם כתוביות בעברית בפרמייר פרו, כנראה נתקלת בלפחות אחת משלוש התקלות האלה: שורה שנחתכת באמצע מילה, סימן פיסוק שיושב בצד ההפוך, וטקסט עברי שהופך לרצף סימנים חסר משמעות. שלושתן נובעות מאותו מקור — הדרך שבה כלי כתוביות מתייחסים, או לא מתייחסים, לכיווניות ימין-לשמאל של עברית.

רוב המדריכים ברשת מסתפקים במשפט אחד — "עברית היא RTL ולכן יש בעיות" — ולא מראים איך התקלה נראית בפועל. הבעיה עם זה פשוטה: אי אפשר לדעת אם התיקון עבד בלי לראות קודם את התקלה עצמה, אות אחר אות. לכן בעמוד הזה כל תקלה מוצגת לצד הגרסה התקינה שלה, כדי שאפשר יהיה להשוות ישירות.

קפטן קאט הוא תוסף CEP שרץ בתוך פרמייר פרו עצמו, ותומך ב-RTL אמיתי: כיוון הטקסט, מיקום הפיסוק, שורות מעורבות של עברית ואנגלית, ומספרים. זה חלק מהתמלול האוטומטי שלו ביותר מ-40 שפות עם חותמות זמן ברמת מילה. לפני שמסבירים איך זה עובד, שווה להבין בדיוק מה נשבר.

Auto-captions & translation · 40+ languages

Translated naturally.
In every language.

Native phrasing, not word-for-word. Word-level timestamps, burned-in or exported as SRT — in seconds.

🇬🇧EN00:02:14,120
“Translation and transcription, in every language.”
Auto-cycling · click any flag to pin
40+
שפות תמלול, כולל עברית וערבית
7
ימי ניסיון חינם בכל התוכניות
100
דקות עיבוד AI בתוכנית הבסיסית

חלוקת שורות: איפה זה נשבר, ולמה זה לא מקרי

כשמנוע כתוביות בונה שורה, הוא צריך להחליט איפה לשבור אותה כדי שתתאים לרוחב המסך. באנגלית זו החלטה פשוטה: סופרים תווים משמאל לימין ושוברים ברווח הקרוב לגבול. בעברית, כשמנוע השבירה נבנה מלכתחילה לאנגלית, הוא סופר תווים עד למגבלת האורך ושובר בדיוק שם — בלי לבדוק אם הוא נמצא באמצע מילה.

כך זה נראה כשהשבירה מתעלמת מגבולות מילים: `` אני חושב שהיינו צריכים לד בר על זה קודם `` המילה "לדבר" נחתכה באמצע: "לד" בשורה הראשונה, "בר" בשנייה.

אותו משפט, שבור נכון: `` אני חושב שהיינו צריכים לדבר על זה קודם `` השבירה כאן נופלת בגבול מילה טבעי, בדיוק במקום שבו העין הייתה עוצרת ממילא. ההבדל בין שתי הדוגמאות אינו אסתטי בלבד: כתובית שנשברת באמצע מילה מאלצת את הצופה לקרוא אותה פעמיים, וברילס או בשורטס, שבהם הכתובית מוצגת פחות משנייה, קריאה שנייה פירושה צופה שכבר גלל הלאה.

הפתרון אינו לתקן ידנית כל שורה, אלא להשתמש בכלי שנבנה סביב עברית מלכתחילה ולא בלוגיקת שבירה שנכתבה לאנגלית ומוזרקים אליה תווים עבריים. תיקון ידני צריך להיעשות מחדש בכל תמלול, ולכן הוא לא פתרון לפרויקטים שוטפים.

פיסוק הפוך: כשסימן השאלה יושב בצד הלא נכון

בעברית, כמו באנגלית, סימני הפיסוק נצמדים לסוף המשפט — אבל "סוף" בעברית הוא הצד השמאלי של השורה, כי הכיוון הוא מימין לשמאל. כשמנוע טקסט לא מיישם BiDi (כיווניות דו-כיוונית) כראוי, הוא ממקם את סימן הפיסוק לפי סדר ההקלדה במחרוזת ולא לפי הכיוון הוויזואלי של המשפט, והסימן קופץ לצד ההפוך.

כך זה נראה כשזה נשבר: `` ?מתי אתה מגיע `` סימן השאלה יושב בתחילת השורה, מימין, כאילו הוא פותח את המשפט.

אותו משפט, נכון: `` מתי אתה מגיע? `` כאן סימן השאלה סוגר את המשפט בצד שמאל, בדיוק כפי שקורא עברית מצפה לראות.

אותה בעיה מופיעה גם עם מספרים בתוך משפט. מספרים נקראים תמיד משמאל לימין, גם בתוך טקסט עברי, וכשהם לא מטופלים כמקטע כיווני נפרד הם עלולים להידבק למילה הסמוכה או להתהפך בסדר הספרות: `` ראיתי אותו לפני 3 ימים ו5 שעות הגרסה התקינה שומרת על גבול הכיוון בין המספר לטקסט העברי שסביבו: ראיתי אותו לפני 3 ימים ו-5 שעות `` זו הסיבה שכתוביות בעברית שיוצאות מכלים שלא נבנו ל-RTL אמיתי נראות "כמעט טוב": המילים עצמן נכונות, אבל מיקום הפיסוק והמספרים מסגיר שהמנוע רק מציג תווים עבריים בתוך תבנית שנבנתה לאנגלית. קפטן קאט מטפל בשני המקרים האלה — מיקום פיסוק ושורות מעורבות של עברית, אנגלית ומספרים — כחלק מתמיכת ה-RTL שלו.

ג'יבריש וקידוד שגוי: מאיפה זה מגיע ואיך מזהים

ג'יבריש בכתוביות בעברית הוא כמעט תמיד תוצאה של אי-התאמת קידוד: קובץ שנשמר בקידוד אחד ונפתח בהנחה של קידוד אחר. כשקובץ SRT או VTT שנכתב ב-UTF-8 נפתח בתוכנה שמניחה קידוד ברירת מחדל אחר, כמו Windows-1255 או ISO-8859-1, כל בית שאמור לייצג אות עברית אחת מתפרש כשני תווים לא קשורים.

כך נראה "שלום עולם" אחרי ש-UTF-8 נקרא בטעות כ-Latin-1: `` ×©×œ×•× ×¢×•×œ×? `` זה הדפוס שרוב העורכים מזהים מיד: רצף של ×, סימני שאלה במקומות מוזרים ותווים שאין להם שום קשר לעברית.

אותו טקסט בקידוד תקין: `` שלום עולם `` התקלה הזאת מופיעה בעיקר בשלוש נקודות: ייבוא קובץ SRT חיצוני לפרמייר בלי לוודא שהוא נקרא כ-UTF-8, ייצוא מכלי תמלול שמניח שהפלט באנגלית, ופתיחת קובץ ישן בעורך טקסט שמזהה קידוד לפי ניחוש. מספיקה נקודה אחת בשרשרת שמניחה קידוד אחר כדי שכל הטקסט שאחריה ייהרס.

בקפטן קאט התמלול, בניית מסלול הכתוביות והייצוא ל-SRT מתבצעים כולם בתוך אותו תוסף CEP שרץ בפרמייר פרו, כך שאין שלב ביניים של ייצוא וייבוא בין כלים חיצוניים. הפלט הוא מסלולי כתוביות סטנדרטיים של פרמייר, עם עיצוב דרך Essential Graphics וייצוא SRT רגיל.

מה קפטן קאט עושה, לעומת קובץ SRT שמיובא מבחוץ

יכולתקפטן קאטקובץ SRT שמיובא מכלי חיצוני
תמיכת RTL אמיתית: כיוון, פיסוק, שורות מעורבות ומספריםכןתלוי בכלי שייצר את הקובץ
תמלול בתוך פרמייר פרו, בלי ייצוא וייבוא בינייםכן — תוסף CEP שרץ בפרמיירלא, נדרש ייבוא ידני
תמלול בעברית ובעוד יותר מ-40 שפות, עם חותמות זמן ברמת מילהכןתלוי בכלי
פלט למסלולי כתוביות סטנדרטיים של פרמיירכן, כולל עיצוב Essential Graphics וייצוא SRTתלוי בתבנית הקובץ
נקודת מעבר בין כלים שבה הקידוד עלול להישבראין — הכול קורה בתוך התוסףיש, בכל ייבוא

אם כתוביות שכבר יובאו לפרמייר נראות שבורות, בדוק קודם את הקידוד של קובץ המקור וודא שהוא נשמר ב-UTF-8, לפני שמתחילים לתקן ידנית שורה אחר שורה. במקרים רבים זו נקודת התקלה היחידה.

שאלות נפוצות

כי מנוע שבירת השורות שיצר את הקובץ ספר את התווים לפי הכיוון האנגלי, משמאל לימין, ולא בדק גבולות מילים בעברית. כשהוא מגיע למגבלת אורך השורה הוא שובר בדיוק שם, גם אם זה באמצע מילה. תיקון ידני פותר את הסרטון הנוכחי בלבד, כי הוא צריך להיעשות מחדש בכל תמלול.

הסימן הברור ביותר הוא רצף תווים כמו × או סימני שאלה במקום אותיות עבריות — זו טביעת האצבע האופיינית של UTF-8 שנקרא כ-Latin-1 או כ-Windows-1255. אם הטקסט נראה כמו תערובת אקראית של סמלים שאינם עבריים, כמעט תמיד מדובר בקידוד ולא בפונט. פונט חסר מציג בדרך כלל ריבועים ריקים, לא ג'יבריש.

זו עבודה חוזרת שצריך לבצע מחדש בכל סרטון, ולכן היא לא פתרון לפרויקטים שוטפים. עדיף להתחיל מכלי שנבנה סביב עברית מלכתחילה, כך שהטקסט יוצא נכון כבר בתמלול. תיקון ידני שווה רק לתיקוני נקודה בודדים.

כי מנוע הטקסט ממקם את סימן הפיסוק לפי סדר ההקלדה במחרוזת ולא לפי הכיוון הוויזואלי של המשפט. באנגלית זה לא מורגש, כי הכיוון הלוגי והוויזואלי זהים, אבל בעברית הם הפוכים — וכש-BiDi לא מיושם כראוי, הסימן נשאר בצד שבו הוקלד במקום לעבור לצד הנכון.

מספרים נקראים משמאל לימין גם בתוך משפט עברי. אם מנוע הטקסט לא מטפל בהם כמקטע כיווני נפרד, הם עלולים להידבק למילה הסמוכה בלי רווח תקין או להתהפך בסדר הספרות. טיפול נכון שומר על גבול הכיוון בין המספר לטקסט העברי שסביבו. קפטן קאט מטפל בשורות מעורבות ובמספרים כחלק מתמיכת ה-RTL שלו.

כן. ערבית היא גם שפת RTL ומתמודדת עם אותם אתגרי כיווניות: מיקום פיסוק, שורות מעורבות ומספרים, וסיכון לג'יבריש כשהטקסט עובר בין כלים. קפטן קאט תומך ב-RTL אמיתי גם בעברית וגם בערבית.

קפטן קאט הוא תוסף CEP שרץ בתוך פרמייר פרו עצמו, ולכן התמלול, בניית מסלול הכתוביות והייצוא ל-SRT קורים באותו מקום, בלי שלב ביניים של ייצוא וייבוא בין כלים. התמלול תומך ביותר מ-40 שפות עם חותמות זמן ברמת מילה ובתמיכת RTL אמיתית — כיוון, מיקום פיסוק, שורות מעורבות ומספרים — והפלט הוא מסלולי כתוביות סטנדרטיים של פרמייר, עם עיצוב Essential Graphics וייצוא SRT.

בדוק את זה על הפרויקט שלך, לא רק על הדוגמאות כאן

7 ימי ניסיון חינם בכל התוכניות, החל מ-14.99 דולר לחודש עם 100 דקות עיבוד AI. אפשר לבטל בכל שלב.

התחל בחינם

Keep reading