Yadeep Blog Yadeep Blog
หน้าแรก
หมวดหมู่
AI Models Generative AI Machine Learning Robotics AI Ethics Industry
เกี่ยวกับ ติดต่อ
เข้าสู่ระบบ สมัครสมาชิก
AI Models

HOMIE — กรอบสร้างวิดีโอดิจิทัลฮิวแมนจาก HKUST รวม 4 งานในกรอบเดียว OCR แม่นกว่า 38.7%

HKUST เปิดซอร์ส HOMIE กรอบสร้างวิดีโอดิจิทัลฮิวแมนบน Wan2.1-T2V-14B + Qwen3-VL-2B รวม 4 ฟังก์ชัน: ดิจิทัลฮิวแมน+สินค้า+โลโก้+ข้อความ OCR แม่นยำกว่าโอเพนซอร์สที่เก่งที่สุด 38.7% ฝึกแค่ 5.5K ขั้น (~1 หมื่น A100 ชม.) รองรับ 480P-720P แนวตั้ง ฟรี Apache 2.0

HOMIE — กรอบสร้างวิดีโอดิจิทัลฮิวแมนจาก HKUST รวม 4 งานในกรอบเดียว OCR แม่นกว่า 38.7%

ทำวิดีโอขายของแนวตั้งสำหรับ TikTok หรือ Shopee Live — ถ้าจะให้ดีต้องมีคนถือสินค้า โลโก้แบรนด์ต้องชัด และข้อความบนบรรจุภัณฑ์ต้องอ่านได้ ปกติต้องทำทีละอย่างด้วยเครื่องมือคนละตัว แต่ HOMIE จาก มหาวิทยาลัยวิทยาศาสตร์และเทคโนโลยีฮ่องกง (HKUST) รวมทั้งหมดไว้ในกรอบเดียว

ภาพ: สถิติเด่น HOMIE — OCR แม่นยำกว่า 38.7% ฝึกแค่ 5.5K ขั้น Apache 2.0

ภาพ: สถิติเด่น HOMIE — OCR แม่นยำกว่า 38.7% ฝึกแค่ 5.5K ขั้น Apache 2.0

ปัญหาที่ HOMIE แก้

สร้างวิดีโอ AI ที่มีทั้งคนและสินค้าพร้อมกัน มีปัญหาใหญ่ 4 ข้อที่โมเดลทั่วไปทำไม่ได้ดี:

  • คนกับสินค้า: ให้คนหิ้ว ถือ โชว์สินค้า โดยที่ตัวคนและตัวสินค้าไม่เพี้ยน
  • โลโก้แบรนด์: วางโลโก้ให้ติดกับสินค้าที่เกี่ยวข้องโดยอัตโนมัติ ไม่ต้องบอกตำแหน่งใน prompt
  • ข้อความ OCR: ตัวอักษรบนฉลาก บรรจุภัณฑ์ ต้องอ่านได้ ไม่เละ
  • มุมมองหลายมุม: สินค้าหมุน ขยับ แล้วยังเหมือนเดิม
ภาพ: สตรีมขายของสด — ดิจิทัลฮิวแมนถือสินค้าแนะนำหน้ากล้อง แนวตั้ง 1280x720

ภาพ: สตรีมขายของสด — ดิจิทัลฮิวแมนถือสินค้าแนะนำหน้ากล้อง แนวตั้ง 1280x720

สถาปัตยกรรม — ไม่ทำลายของเดิม

HOMIE ใช้ Wan2.1-T2V-14B เป็นกระดูกหลัง แล้วเสียบ Qwen3-VL-2B-Thinking เข้าไปเป็นตา — สิ่งที่เจ๋งคือ ไม่ทำลาย text encoder ของเดิม เพราะวิธีอื่นมักแทนที่ text encoder ทำให้ควบคุมวิดีโอไม่ได้

ส่วนที่ทำให้มันเชื่อมกันได้คือ GMG (Global Multimodal Guidance) ที่ให้ทุก token ในวิดีโอมองเห็นภาพอ้างอิง และ MRE (Modality-Reference Embedding) ที่แยก token ของ MLLM กับ VAE ไม่ให้สับสน

ภาพ: เปรียบเทียบ HOMIE vs SkyReels-V3 — OCR ความสม่ำเสมอมุมมอง และใบหน้า

ภาพ: เปรียบเทียบ HOMIE vs SkyReels-V3 — OCR ความสม่ำเสมอมุมมอง และใบหน้า

เทียบกับ SkyReels-V3 ตัวท็อป

HOMIE ชนะทุกตัวชี้วัด: OCR แม่นกว่า (0.452 vs 0.326) ความสม่ำเสมอมุมมองดีกว่า (0.685 vs 0.654) และใบหน้าสม่ำเสมอกว่า (0.786 vs 0.751) — แถมฝึกแค่ 5.5K ขั้น เทียบกับคนอื่นที่ใช้ 3-4 หมื่นขั้น ในงานวิจัยมีผู้ใช้ 40 คนโหวต 64.7% เลือก HOMIE เป็นอันดับ 1

ภาพ: โชว์สินค้า 360 องศา — ใส่ภาพหลายมุมแล้วหมุนได้ รักษารายละเอียดตลอดวิดีโอ

ภาพ: โชว์สินค้า 360 องศา — ใส่ภาพหลายมุมแล้วหมุนได้ รักษารายละเอียดตลอดวิดีโอ

กรณีใช้งานจริง

ค้าขายสด: ใส่ภาพดิจิทัลฮิวแมน + ภาพสินค้า + โลโก้ + ข้อความ OCR — ได้วิดีโอแนะนำสินค้าแนวตั้ง 1280x720 ลง TikTok/Shopee ได้เลย

โฆษณาแบรนด์: ไม่ต้องบอกว่าจะวางโลโก้ตรงไหน — MLLM เข้าใจความหมายแล้วติดให้เองว่าโลโก้นี้ควรอยู่บนสินค้าชิ้นไหน

โชว์สินค้า 360 องศา: ใส่ภาพสินค้าหลายมุม แล้วสั่งให้หมุน — HOMIE รักษารายละเอียดได้ตลอดทั้งวิดีโอ

รันเองได้

  • การ์ดจอเดียว: 832x480
  • หลายการ์ด (FSDP): 720P
  • ดาวน์โหลดจาก HuggingFace
  • โค้ดที่ GitHub
  • งานวิจัยฉบับเต็มที่ arXiv
  • หน้าโปรเจกต์: HOMIE Project Page

สรุป

ภาพ: สรุปประเด็นสำคัญ HOMIE

ภาพ: สรุปประเด็นสำคัญ HOMIE

HOMIE ไม่ได้เก่งแค่อย่างเดียว — มัน รวม 4 งานยากที่ปกติต้องใช้โมเดลคนละตัว มาไว้ในกรอบเดียว ฝึกน้อย แม่นกว่า และเปิดซอร์สฟรี Apache 2.0 สำหรับคนทำอีคอมเมิร์ซวิดีโอ นี่คือเครื่องมือที่ลดต้นทุนได้จริง

แชร์บทความนี้:

ความคิดเห็น 0

ยังไม่มีความคิดเห็น — เป็นคนแรกที่แสดงความคิดเห็น!

แสดงความคิดเห็น