ห้องสมุด AI ฟรี

เสียงเอไอ คำแนะนำฟรีตลอดไป

117 คู่มือภาษาอังกฤษธรรมดา เส้นทางการเรียนรู้ที่มีโครงสร้าง และห้องสมุดเปิด — สร้างโดยองค์กรอิสระ 501(c)(3) เพื่อให้ทุกคนสามารถเข้าใจ AI สมัยใหม่ได้

117คำแนะนำฟรี
1แทร็กหัวข้อ
~2 minต่อไกด์
~4hเวลาการอ่าน

เริ่มที่นี่

ห้า หลักสูตรที่เน้นผลลัพธ์

แต่ละหลักสูตรประกอบด้วยผลลัพธ์ที่ชัดเจน สมรรถนะที่วางแผนไว้ กิจกรรมฝึกปฏิบัติ และสรุปผลประยุกต์

01

มูลนิธิเอไอ

เข้าใจว่า AI คืออะไร ระบบเรียนรู้อย่างไร จุดที่ล้มเหลว และวิธีตัดสินข้อกล่าวหาโดยไม่โฆษณาเกินจริง

  1. 1เอไอคืออะไร?
  2. 2AI เรียนรู้อย่างไร
  3. 3อธิบายโมเดล AI
  4. 4เกณฑ์มาตรฐาน AI
~4h เพื่อเติมเต็มดูหลักสูตร
02

ผู้ใช้ AI ที่มีความรับผิดชอบ

ใช้ AI อย่างมีประสิทธิภาพในขณะที่ปกป้องความเป็นส่วนตัว ตรวจสอบผลลัพธ์ และรักษาความรับผิดชอบของมนุษย์

  1. 1Prompt Engineering
  2. 2AI ภาพหลอน
  3. 3AI และความเป็นส่วนตัว
  4. 4AI ในชีวิตประจำวัน
~5h เพื่อเติมเต็มดูหลักสูตร
03

AI ในงาน

ประเมินกรณีการใช้งานในที่ทำงาน ดำเนินการนำร่องอย่างปลอดภัย วัดคุณค่า และสื่อสารการเปลี่ยนแปลงอย่างมีความรับผิดชอบ

  1. 1AI เวิร์กโฟลว์อัตโนมัติ
  2. 2เกณฑ์มาตรฐาน AI
  3. 3AI และงาน
  4. 4ธรรมาภิบาลของ AI
~6h เพื่อเติมเต็มดูหลักสูตร
04

นโยบาย AI และสังคม

วิเคราะห์ระบบ AI ผ่านผลลัพธ์ด้านสิทธิ ความเท่าเทียม การกำกับดูแล ความปลอดภัย และผลประโยชน์สาธารณะ

  1. 1จริยธรรม AI
  2. 2AI และความเป็นส่วนตัว
  3. 3ระเบียบเอไอ
  4. 4ตำนานเกี่ยวกับ AI
~6h เพื่อเติมเต็มดูหลักสูตร
05

การสร้างด้วยระบบ AI

ทำความเข้าใจโมเดลภาษา การดึงข้อมูล ตัวแทน การประเมิน ต้นทุน และการป้องกันการใช้งานผ่านการออกแบบระบบที่ใช้งานได้จริง

  1. 1ChatGPT และ LLM
  2. 2คุณภาพการดึงข้อมูล
  3. 3ตัวแทนเอไอ
  4. 4เกณฑ์มาตรฐาน AI
~8h เพื่อเติมเต็มดูหลักสูตร

แทร็กหัวข้อ

เรียกดูตามแทร็ก

กระโดดเข้าไปในพื้นที่ที่คุณสนใจ ทุกแทร็กมีไกด์ภาษาอังกฤษธรรมดาหลายเล่ม

ความรู้พื้นฐานแนวคิดหลัก: AI ทำงานอย่างไรในระดับสูง84 คำแนะนำ ภาษาเอไอLLM, NLP, ChatGPT, การกระตุ้นเตือน และการทำความเข้าใจข้อความ155 คำแนะนำ วิชวลเอไอการสร้างภาพ คอมพิวเตอร์วิทัศน์ วีดิทัศน์ และการออกแบบ133 คำแนะนำ เสียงเอไอเสียง เพลง พ็อดแคสต์ และ AI ที่เน้นเสียงเป็นอันดับแรก117 คำแนะนำ บริษัทโปรไฟล์ของ OpenAI, Anthropic, Google, Meta และอื่นๆ121 คำแนะนำ การใช้งานAI ปรากฏในการเขียนโค้ด การค้นหา เจ้าหน้าที่ และชีวิตประจำวันอย่างไร111 คำแนะนำ อุตสาหกรรมAI ในด้านการดูแลสุขภาพ การเงิน การศึกษา พลังงาน และอื่นๆ91 คำแนะนำ เทคนิคชิป, การปรับแต่งแบบละเอียด, RAG, เวกเตอร์ และโครงสร้างพื้นฐาน AI177 คำแนะนำ สังคมอคติ ความเป็นส่วนตัว ลิขสิทธิ์ ความปลอดภัย และอนาคตของ AI30 คำแนะนำ

ห้องสมุดเต็มรูปแบบ

คำแนะนำทั้งหมด

117 ของ 1019 คำแนะนำที่แสดง กรองตามเพลงหรือค้นหาด้านบน

เสียงเอไอ

Mimi สตรีมมิ่งตัวแปลงสัญญาณเสียง

Mimi เป็นตัวแปลงสัญญาณเสียงแบบนิวรัลที่บีบอัดคำพูดเป็นสตรีมโทเค็นแยกส่วนเล็กๆ ในแบบเรียลไทม์ ดังนั้นโมเดล AI จึงสามารถฟังและพูดด้วยความถี่ที่ต่ำมาก...

2 นาทีอ่านอ่าน
เสียงเอไอ

ฟังเข้าร่วมและสะกด

Listen, Attend and Spell (LAS) คือโครงข่ายประสาทเทียมที่สำคัญในปี 2015 ที่ถอดเสียงคำพูดเป็นอักขระโดยตรง โดยไม่ต้องออกเสียงด้วยมือ...

2 นาทีอ่านอ่าน
เสียงเอไอ

SpecAugment สำหรับการรู้จำเสียง

SpecAugment เป็นวิธีการเพิ่มข้อมูลที่เรียบง่ายแต่ทรงพลัง ซึ่งปิดบังและบิดเบือนสเปกตรัมของเสียงพูด เพื่อทำให้โมเดลการรู้จำมีประสิทธิภาพมากขึ้น

2 นาทีอ่านอ่าน
เสียงเอไอ

การติดแท็กอัตโนมัติของเพลง

การแท็กอัตโนมัติของเพลงใช้การเรียนรู้ของเครื่องเพื่อฟังเพลงและแนบป้ายกำกับที่อธิบาย เช่น แนวเพลง อารมณ์ เครื่องดนตรี และจังหวะโดยอัตโนมัติ

2 นาทีอ่านอ่าน
เสียงเอไอ

การถ่ายโอนดนตรี Timbre

การถ่ายโอน Timbre จะปรับ 'โทนสี' ของเสียงใหม่ เพื่อให้เครื่องดนตรีชิ้นหนึ่งมีเสียงเหมือนอีกชิ้นหนึ่ง โดยเปลี่ยนทำนองฮัมเพลงให้เป็นไวโอลินหรือแนวทรัมเป็ต...

2 นาทีอ่านอ่าน
เสียงเอไอ

การจำแนกฉากอะคูสติก

การจำแนกฉากอะคูสติก (ASC) ฝึกเครื่องให้จดจำสภาพแวดล้อมในการบันทึก ถนนที่พลุกพล่าน สวนสาธารณะที่เงียบสงบ รถไฟ ร้านกาแฟ...

2 นาทีอ่านอ่าน
เสียงเอไอ

NVIDIA Riva และ NeMo คำพูด

NVIDIA Riva เป็น SDK ที่เร่งด้วย GPU สำหรับการผลิตคำพูด AI (ASR, TTS และการแปล) ในขณะที่ NeMo เป็นชุดเครื่องมือโอเพ่นซอร์สสำหรับการฝึกอบรมและการปรับแต่ง...

2 นาทีอ่านอ่าน
เสียงเอไอ

สถาปัตยกรรม DeepSpeech

DeepSpeech คือโมเดลการรู้จำคำพูดแบบ end-to-end ที่เปิดตัวโดย Baidu ในปี 2014 ซึ่งจับคู่คุณสมบัติเสียงดิบกับข้อความโดยตรงโดยใช้ระบบประสาทที่เกิดซ้ำ

2 นาทีอ่านอ่าน
เสียงเอไอ

การฝังลำโพง X-Vector

เวกเตอร์ X คือลายนิ้วมือตัวเลขที่มีความยาวคงที่ของเสียงของผู้พูดที่ผลิตโดยโครงข่ายประสาทเทียม ซึ่งใช้เพื่อบอกว่าใครกำลังพูดไม่ว่าพวกเขาจะพูดอะไรก็ตาม

2 นาทีอ่านอ่าน
เสียงเอไอ

การจัดตำแหน่ง Monotonic เรืองแสง-TTS

Glow-TTS คือโมเดลการอ่านออกเสียงข้อความที่เรียนรู้ที่จะจัดข้อความเป็นคำพูดด้วยตัวเองโดยใช้เคล็ดลับการค้นหาที่ชาญฉลาด โดยไม่จำเป็นต้องใช้เครื่องมือจัดตำแหน่งแยกต่างหาก

2 นาทีอ่านอ่าน
เสียงเอไอ

ตัวเข้ารหัส WaveGAN แบบขนาน

Parallel WaveGAN เป็นตัวแปลงเสียงแบบนิวรอลที่รวดเร็ว ซึ่งเปลี่ยนเมลสเปกโตรแกรมให้กลายเป็นรูปคลื่นเสียงดิบโดยใช้ GAN ขนาดเล็ก เพื่อสร้างตัวอย่างทั้งหมดในคราวเดียว

2 นาทีอ่านอ่าน
เสียงเอไอ

Vocoder ที่ใช้ WaveGlow Flow

WaveGlow คือเครื่องแปลงเสียงแบบนิวรัลแบบโฟลว์จาก NVIDIA ที่สังเคราะห์รูปคลื่นคำพูดจากเมลสเปกโตรแกรมในการส่งผ่านครั้งเดียวโดยไม่มีการถดถอยอัตโนมัติ

2 นาทีอ่านอ่าน

อ่านจบหรือยัง?พิสูจน์สิ

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.