Yadeep Blog Yadeep Blog
หน้าแรก
หมวดหมู่
AI Models Generative AI Machine Learning Robotics AI Ethics Industry
เกี่ยวกับ ติดต่อ
เข้าสู่ระบบ สมัครสมาชิก
Generative AI

AI อ่านหนังสือด้วย 'เสียงคุณ' ได้แล้ว! dots.tts โคลนเสียงจากคลิป 3 วินาที (ฟรี, Open Source)

โมเดล AI อย่าง dots.tts สร้างเสียงพูดคุณภาพ 48kHz แบบต่อเนื่องลื่นไหล โคลนเสียงคนได้จากคลิปแค่ 3-10 วินาที รองรับ 24 ภาษา ฟรี Open Source — เสียงที่สร้างออกมาแทบแยกไม่ออกจากคนจริง

AI อ่านหนังสือด้วย 'เสียงคุณ' ได้แล้ว! dots.tts โคลนเสียงจากคลิป 3 วินาที (ฟรี, Open Source)

เคยคิดมั้ยว่า ถ้าให้ AI ฟังเสียงเราสัก 3 วินาที แล้วมันจะพูดเลียนแบบเราได้ทั้งวัน? ฟังดูเหมือนนิยายวิทยาศาสตร์ แต่ตอนนี้มันเกิดขึ้นจริงแล้ว! 🎙️

dots.tts คือโมเดล AI สร้างเสียงพูด (TTS) ใหม่ล่าสุดจากทีม dots (Xiaohongshu) ร่วมกับ Shanghai Jiao Tong University — เป็น Open Source ฟรี ใครก็เอาไปใช้ได้ (Apache-2.0) พร้อมโค้ดฝึกโมเดลให้ครบ แถมยังโคลนเสียงคนได้ด้วยคลิปอ้างอิงแค่ 3–10 วินาที เท่านั้น!

dots.tts คืออะไร? เอาง่ายๆ เลย

ปกติโมเดลสร้างเสียงรุ่นเก่า มักจะหั่นเสียงเป็นก้อนๆ (discrete token) ก่อนสร้างใหม่ เหมือนต่อเลโก้ทีละก้อน — เสียงอาจดูแข็งๆ หรือขาดตอนตรงรอยต่อ

แต่ dots.tts เลือกเส้นทางต่าง: สร้างเสียงแบบ ต่อเนื่องลื่นไหล (fully continuous autoregressive) เหมือนวาดเส้นเดียวจบ ไม่มีรอยต่อ — ผลลัพธ์คือเสียงละเอียด ฟังธรรมชาติถึง 48 kHz แทบแยกไม่ออกจากคนจริง แถมเก็บรายละเอียดเล็กๆ อย่างลมหายใจและ texture ของเสียงได้ครบ

หัวใจของโมเดลมี 3 ชิ้นทำงานร่วมกัน:

  • Semantic encoder — ย่อยเสียงให้เป็นข้อมูลสั้นๆ ที่โมเดลเข้าใจ
  • LLM backbone — สมองหลัก อ่านข้อความ + ฟังเสียงตัวอย่าง (ต่อยอดจาก Qwen2.5-1.5B)
  • Flow-matching head — ตัวสร้างเสียงทีละส่วนให้ต่อเนื่องเนียนๆ

เสียงมันดีแค่ไหน? ดูตัวเลข

ทีมวิจัยทดสอบบนชุด Seed-TTS-Eval (มาตรฐานวัด TTS) ด้านความคล้ายเสียงกับเจ้าของเสียงจริง (SIM) dots.tts ทำได้สูงมาก:

ภาพ: คะแนนความคล้ายเสียง (SIM) ของ dots.tts บน Seed-TTS-Eval

ภาพ: คะแนนความคล้ายเสียง (SIM) ของ dots.tts บน Seed-TTS-Eval

ตัวเลข 79.2 นี่แหละ คือ "เสียงที่สร้างออกมา ยังฟังเหมือนเจ้าของเสียงจริงๆ" — วัดแล้วชนะหลายโมเดล Open Source ในตลาด

จุดเด่นที่ทำให้ dots.tts โดดเด่น

1. โคลนเสียงได้ด้วยคลิป 3–10 วินาที

แค่ให้ไฟล์เสียงสั้นๆ + ข้อความที่พูดในไฟล์ โมเดลก็เลียนแบบน้ำเสียงได้ทันที เรียกว่า zero-shot voice cloning — ไม่ต้องเทรน ไม่ต้องรอ ยังโคลนข้ามภาษาได้อีกด้วย!

ภาพ: Zero-shot voice cloning — โคลนเสียงจากคลิปอ้างอิง 3–10 วินาที

ภาพ: Zero-shot voice cloning — โคลนเสียงจากคลิปอ้างอิง 3–10 วินาที

2. พูดตอบโต้ได้แบบเรียลไทม์

ด้วยดีไซน์แบบ causal ทำให้สร้างเสียงสตรีมมิงได้ตามธรรมชาติ ยิ่งโหมด 1T1A (ข้อความสลับเสียงทีละ step) เสียงแรกออกมาภายใน 54.4 มิลลิวินาที — ไวพอให้แชตบอต/voice agent คุยตอบโต้กับเราได้แบบไม่สะดุด เหมาะกับผู้ช่วยเสียง เกม หรือบทสนทนาสองทาง

ภาพ: Real-time streaming TTS — first-packet latency ต่ำถึง 54.4 ms

ภาพ: Real-time streaming TTS — first-packet latency ต่ำถึง 54.4 ms

3. สั่ง "แก้เสียงพูด" ได้เหมือนตัดต่อ

dots.tts.edit — ลูกเล่นเด็ด! สั่งแก้ไขเสียงพูดด้วยคำสั่ง XML ง่ายๆ เช่น เปลี่ยนคำศัพท์ ปรับอารมณ์ ระดับเสียง ความเร็ว หรือแทรก/ลบการเว้นวรรค ได้ในคำสั่งเดียว ส่วนที่ไม่ได้สั่งแก้ จะคงเดิม 100% เหมาะกับงานพากย์/ตัดต่อที่ต้องการแม่นยำ

ภาพ: dots.tts.edit — แก้ไขเสียงพูดด้วยคำสั่ง XML ที่แม่นยำ

ภาพ: dots.tts.edit — แก้ไขเสียงพูดด้วยคำสั่ง XML ที่แม่นยำ

4. รองรับ 24 ภาษา

บนชุดทดสอบ MiniMax 24 ภาษา โมเดลทำคะแนนความคล้ายเสียงเฉลี่ย 83.9 และได้ที่ 1 ใน 19 ภาษา — ครอบคลุมทั้งไทย อังกฤษ จีน และอีกเพียบ

เทียบกับคู่แข่ง: dots.tts vs CosyVoice 3

ด้านdots.ttsCosyVoice 3
เทคนิคสร้างเสียงต่อเนื่องลื่นไหล (ไม่มีสะเก็ด)ผสม discrete + continuous
พารามิเตอร์2B1.5B
Seed-TTS-Eval WER/CER เฉลี่ย (อ่านผิดน้อยกว่า = ดีกว่า)2.95%3.06%
Seed-TTS-Eval SIM เฉลี่ย (เสียงเหมือนกว่า = ดีกว่า)79.275.3
มัลติลิงกวล24 ภาษา (SIM 83.9)เน้นจีน-อังกฤษ
First-packet latency54.4 msไม่ระบุ

เห็นชัดว่า dots.tts ชนะทั้งด้านอ่านผิดน้อยกว่า และเสียงเหมือนกว่า — โดยเฉพาะเรื่องความคล้ายเสียง:

ภาพ: เปรียบเทียบความคล้ายเสียง dots.tts vs CosyVoice 3

ภาพ: เปรียบเทียบความคล้ายเสียง dots.tts vs CosyVoice 3

เอาไปลองใช้ยังไง?

ง่ายมาก ติดตั้งผ่าน pip:

pip install dots.tts

จากนั้นโคลนเสียงตัวเองได้เลย:

dots.tts \
  --model-name-or-path dots-studio/dots.tts-soar \
  --text "สวัสดีครับ นี่คือเสียงที่ถูกสร้างจากคลิปอ้างอิงสั้นๆ" \
  --prompt-audio /path/to/reference.wav \
  --prompt-text "ข้อความที่พูดในไฟล์อ้างอิง" \
  --output clone.wav

หรือใช้ผ่าน Python API ก็ได้:

from dots_tts.runtime import DotsTtsRuntime
import soundfile as sf

runtime = DotsTtsRuntime.from_pretrained("dots-studio/dots.tts-soar")
result = runtime.generate(
    text="Hello, this is a quick speech synthesis test.",
    prompt_audio_path="reference.wav",
)
sf.write("output.wav", result["audio"], result["sample_rate"])

ยังมี checkpoint ให้เลือก 7 แบบ ตั้งแต่ base (พื้นฐาน) ไปจนถึง soar (คุณภาพสูงสุด) และ mf-1step (เร็วสุด 1 ขั้นตอน)

สรุป: 3 อย่างที่ควรจำ

1. dots.tts สร้างเสียงคุณภาพ 48 kHz แบบต่อเนื่องลื่นไหล — ฟังแล้วแทบแยกไม่ออกจากคนจริง

2. โคลนเสียงได้ด้วยคลิป 3–10 วินาที + สั่งแก้เสียงพูดได้แม่นยำ + รองรับ 24 ภาษา

3. ฟรี Open Source (Apache-2.0) — ใครก็โหลดไปลองได้เลย

ถ้าอยากลอง เริ่มจาก pip install dots.tts แล้วลองโคลนเสียงตัวเองดู — หรือถ้าสนใจด้านแก้ไขเสียง ลอง dots.tts.edit ที่สั่งได้ทั้งเปลี่ยนคำ ปรับอารมณ์ ระดับเสียง และจังหวะพูด

ลิงก์อ้างอิง

แชร์บทความนี้:

ความคิดเห็น 0

ยังไม่มีความคิดเห็น — เป็นคนแรกที่แสดงความคิดเห็น!

แสดงความคิดเห็น