RAG: Kết hợp LLM với cơ sở dữ liệu vector

RAG là gì? Retrieval-Augmented Generation (RAG) là kiến trúc AI kết hợp hai bước: (1) truy xuất thông tin liên quan từ cơ sở dữ liệu vector, rồi (2) sinh…

Xem thêm
auto_blog_image

AI Agent Memory: Cách AI nhớ và học từ ngữ cảnh dài hạn

Vấn đề memory trong AI agent hiện đại AI agent ngày nay đối mặt với một hạn chế cố hữu: context window hữu hạn. Mô hình ngôn ngữ lớn chỉ…

Xem thêm

Knowledge Distillation: Nén mô hình lớn thành mô hình nhỏ

Knowledge Distillation là gì? Knowledge Distillation (KD) là kỹ thuật huấn luyện mô hình nhỏ (student) để bắt chước hành vi của mô hình lớn (teacher) đã được pre-trained. Được…

Xem thêm

Vibe Coding: Phong cách lập trình dùng AI coding assistant cho toàn bộ codebase

Vibe Coding là gì? Vibe Coding là phong cách lập trình mới do Andrej Karpathy đề xuất năm 2025, trong đó developer dùng AI coding assistant (Claude Code, Cursor, GitHub…

Xem thêm

Vibe Coding: Phong cách lập trình dùng AI coding assistant cho toàn bộ codebase

Vibe Coding là gì? Vibe Coding là phong cách lập trình mới do Andrej Karpathy đề xuất năm 2025, trong đó developer dùng AI coding assistant (Claude Code, Cursor, GitHub…

Xem thêm

Vibe Coding: Phong cách lập trình dùng AI coding assistant cho toàn bộ codebase

Vibe Coding là gì? Vibe Coding là phong cách lập trình mới do Andrej Karpathy đề xuất năm 2025, trong đó developer dùng AI coding assistant (Claude Code, Cursor, GitHub…

Xem thêm

Vibe Coding: Phong cách lập trình dùng AI coding assistant cho toàn bộ codebase

Vibe Coding là gì? Vibe Coding là phong cách lập trình mới do Andrej Karpathy đề xuất năm 2025, trong đó developer dùng AI coding assistant (Claude Code, Cursor, GitHub…

Xem thêm

Small Language Models (SLM): Phi-3, Gemma 2, Llama 3.2 – Khi nào chọn mô hình nhỏ hơn?

Small Language Models (SLM) đang thay đổi cách chúng ta triển khai AI – thay vì chạy mô hình khổng lồ trên cloud, giờ đây có thể chạy mô hình…

Xem thêm

lm-evaluation-harness: Chạy MMLU GSM8K HumanEval Benchmark LLM

Đánh giá mô hình ngôn ngữ lớn (LLM) là bước quan trọng khi bạn cần so sánh hiệu năng giữa các model như Llama, Mistral, GPT hay Gemini. Thay vì…

Xem thêm

KV Cache Quantization cho LLM: Tối ưu memory inference lên đến 50%

Vấn đề bộ nhớ khi chạy LLM lớn Khi triển khai inference cho mô hình ngôn ngữ lớn như Llama 2 7B hay Mistral 7B, hạn chế lớn nhất không…

Xem thêm