LangGraph: Xây dựng Agentic AI workflows có trạng thái

LangGraph là gì? LangGraph là framework mã nguồn mở của LangChain giúp xây dựng agentic AI workflows có trạng thái, quản lý vòng đời phức tạp và cấu trúc phân…

Xem thêm

Mixture of Experts: Kiến trúc LLM hiệu quả với router thông minh

Mixture of Experts (MoE) là kiến trúc mô hình ngôn ngữ lớn chỉ kích hoạt một tập hợp con tham số mỗi token, giúp tăng hiệu năng suất tính toán…

Xem thêm

Phi-3 Mini và SmolLM: LLM siêu nhỏ chạy trên điện thoại mà không cần server

LLM chạy trực tiếp trên điện thoại đã ngừng là mơ và bắt đầu có mặt trong thực tế nhờ những mô hình siêu nhỏ như Phi-3 Mini (Microsoft) và…

Xem thêm

GGUF Quantization cho LLM: Tối ưu bộ nhớ, tốc độ và chất lượng

GGUF Quantization cho LLM: Tối ưu bộ nhớ, tốc độ và chất lượng Khi triển khai Large Language Models trên máy tính cá nhân, giới hạn lớn nhất không phải…

Xem thêm

LoRA & QLoRA: Fine-tune LLM trên GPU consumer mà không cần server đắt

LoRA & QLoRA: Fine-tune LLM hiệu quả trên GPU consumer mà không cần server đắt tiền Trong thời đại AI sinh tạo ngày nay, việc fine-tune mô hình ngôn ngữ…

Xem thêm
Transformer model architecture diagram showing encoder-decoder with attention mechanism

Speculative Decoding: Tăng tốc inference LLM 2-3x với draft model

Speculative decoding là kỹ thuật tăng tốc độ inference của Large Language Models (LLM) lên 2-3x mà không làm giảm chất lượng đầu ra. Ý tưởng cốt lõi: sử dụng…

Xem thêm
GPT-4o multimodal interface demo

Multimodal AI: GPT-4o và Gemini Pro tích hợp văn bản, hình ảnh, âm thanh

Multimodal AI: GPT-4o và Gemini Pro tích hợp văn bản, hình ảnh, âm thanh GPT-4o multimodal interface demo: hiển thị đầu vào văn bản, hình ảnh và âm thanh Trí…

Xem thêm

Đánh giá RAG: Precision, Recall, Faithfulness trong Retrieval-Augmented Generation

Đánh giá RAG: Precision, Recall, Faithfulness trong Retrieval-Augmented Generation Khi xây dựng hệ thống RAG (Retrieval-Augmented Generation), việc đo lường chất lượng retrieval và generation là cực kỳ quan trọng….

Xem thêm

Đánh giá RAG: Precision, Recall, Faithfulness trong Retrieval-Augmented Generation

Đánh giá RAG: Precision, Recall, Faithfulness trong Retrieval-Augmented Generation Khi xây dựng hệ thống RAG (Retrieval-Augmented Generation), việc đo lường chất lượng retrieval và generation là cực kỳ quan trọng….

Xem thêm

Vector Database so sánh: Pinecone, Weaviate, Qdrant, Chroma

Vector Database so sánh: Pinecone, Weaviate, Qdrant, Chroma Trong kiến trúc Retrieval-Augmented Generation (RAG), Vector Database đóng vai trò lưu trữ và tìm kiếm các embedding của dữ liệu. Không…

Xem thêm