Sơ đồ kiến trúc Vision Transformer: ảnh vào được chia thành các patch, thêm token CLS rồi đi qua các khối encoder Transformer và lớp phân loại

Vision Transformer là gì: cách AI nhìn ảnh qua cơ chế tự chú ý

Vision Transformer (ViT) là kiến trúc mô hình AI xử lý ảnh bằng chính cơ chế tự chú ý (self-attention) của Transformer, thay cho tích chân tích. Thay vì quét…

Xem thêm

KV cache là gì: bộ nhớ chi phối tốc độ sinh văn bản của LLM

KV cache là gì? là bộ nhớ tạm trong quá trình suy luận mô hình ngôn ngữ lớn, dùng để lưu lại kết quả trung gian của lớp attention mỗi…

Xem thêm

Mạng nơ-ron tích chập (CNN) là gì: cách AI nhìn và đọc ảnh

Mạng nơ-ron tích chập (Convolutional Neural Network, viết tắt CNN) là kiến trúc mạng nơ-ron được thiết kế riêng cho dữ liệu có cấu trúc không gian như ảnh, video…

Xem thêm
Biểu đồ biến thiên phương sai nhiễu theo từng bước trong bộ lập lịch nhiễu tuyến tính, trục hoành là số bước từ 0 tới 1000

Mô hình khuếch tán là gì? Cách AI tạo ảnh chất lượng cao từ nhiễu

Mô hình khuếch tán là gì? Cách AI tạo ảnh chất lượng cao từ nhiễu Mô hình khuếch tán (diffusion model) là một lớp mô hình sinh tạo dữ liệu…

Xem thêm

Knowledge distillation là gì? Nén mô hình AI nhỏ gọn hơn

Knowledge distillation (KD) là một kỹ thuật nén mô hình trí tuệ nhân tạo cho phép chuyển giao kiến thức từ một mô hình lớn, phức tạp (gọi là teacher…

Xem thêm
Sơ đồ Medusa: nhiều decoding head gắn trên hidden state cuối của LLM để dự đoán song song nhiều token

Speculative decoding: kỹ thuật tăng tốc sinh văn bản LLM

Speculative decoding (giải mã suy đoán) là kỹ thuật tăng tốc sinh văn bản cho Large Language Model (LLM) mà không làm thay đổi phân phối đầu ra. Ý tưởng…

Xem thêm
Sơ đồ kiến trúc StyleGAN-1 và StyleGAN-2 cho thấy vector phong cách w đi qua lớp affine để điều biến trọng số và độ lệch theo từng kênh, kèm nhiễu Gauss

GAN là gì? Mạng đối kháng tạo ảnh và cách huấn luyện thực tế

GAN là mô hình học máy độc đáo: hai mạng neural được huấn luyện cùng lúc, một bên tạo ra ảnh giả, bên kia cố gắng phân biệt ảnh thật…

Xem thêm
Sơ đồ kiến trúc LoRA: trọng số tiền huấn luyện W0 cộng ma trận hạng thấp B nhân A

LoRA là gì? Kỹ thuật tinh chỉnh mô hình AI tiết kiệm bộ nhớ

LoRA là viết tắt của Low-Rank Adaptation, một kỹ thuật cho phép tinh chỉnh mô hình ngôn ngữ lớn bằng cách chỉ huấn luyện một phần rất nhỏ tham số…

Xem thêm

Object detection là gì? Cách AI nhận diện vật thể trong ảnh

Object detection là gì? Cách AI nhận diện vật thể trong ảnh Object detection (phát hiện đối tượng) là bài toán thị giác máy tính, trong đó mô hình AI…

Xem thêm

Kiến trúc Transformer là gì? Nền tảng mô hình ngôn ngữ hiện đại

Kiến trúc Transformer là gì? Nền tảng của mô hình ngôn ngữ hiện đại Transformer là kiến trúc mạng nơ-ron deep learning được giới thiệu trong bài báo “Attention Is…

Xem thêm