Hướng dẫn chạy Deepseek OCR trên Windows 10
- 페이지 수
- 7
- 형식
- 크기
- 718 KB
- 언어
- VI · Tiếng Việt
- 조회수
- 0
- 댓글
- 0
- Lượt tải
- 0
미리보기 생성 중...
Hướng dẫn cài đặt và sử dụng DeepSeek OCR trên Windows 10, bao gồm giới thiệu mô hình, yêu cầu CUDA, các bước cài đặt backend và frontend.
- 문서명
- Hướng dẫn chạy Deepseek OCR trên Windows 10
- 내용
- Tài liệu hướng dẫn cài đặt và sử dụng Deepseek OCR trên Windows 10, giới thiệu về mô hình, kiến trúc, ứng dụng đi kèm và các bước thiết lập môi trường cần thiết.
- 목차
- Hướng dẫn chạy Deepseek OCR trên Windows 10
- Tiền đề bài viết
- Bài viết này sẽ hướng dẫn các bạn trải nghiệm Deepseek OCR nhanh chóng và dễ dàng nhất.
- Lưu ý: bạn cần có GPU NVIDIA hỗ trợ CUDA để chạy.
- Giới thiệu về Deepseek OCR
- DeepSeek-OCR sử dụng một kiến trúc hai thành phần chính:
- DeepEncoder: bộ mã hoá hình ảnh
- DeepSeek3B-MoE (Mixture-of-Experts) decoder: thành phần giải mã
- Một yếu tố rất khác ở DeepSeek-OCR là optical context compression (nén bối cảnh thông qua bản đồ 2D hình ảnh)
- VD: việc chuyển một trang văn bản sang hình ảnh rồi từ hình ảnh đó trích văn bản lại cho phép giảm tỷ lệ token tới 7-20 lần so với việc dùng token chỉ từ văn bản.
- Ngoài ra, mô hình hỗ trợ chế độ đa độ phân giải (“multi-resolution design”)
- Cuối cùng, DeepSeek-OCR được phổ biến rộng rãi dưới dạng open-source để bạn chạy trên máy tính của mình.
- Giới thiệu về deepseek_ocr_app
- Repository này có tên DeepSeek OCR – React + FastAPI, được phát triển bởi rdumasia303.
- Ứng dụng kết hợp Frontend: React 18 + Vite 5 + Tailwind CSS + Framer Motion và Backend: FastAPI + PyTorch + Transformers.
- Với giao diện đẹp, chạy mượt mà ổn định thì đây là 1 repository rất tốt để các bạn trải nghiệm.
- Chức năng của chương trình:
- Chuyển hóa hình ảnh scan, ảnh chụp, file chứa văn bản (hóa đơn, báo cáo, sách…) thành văn bản
- Bạn có thể tìm một từ/ngữ trong hình ảnh, và ứng dụng sẽ đánh dấu vị trí với hộp bounding box.
- Tạo mô tả thông minh cho hình ảnh: bản ứng dụng hỗ trợ chế độ “Describe” – cho phép mô hình mô tả nội dung hình ảnh
- Bạn có thể nhập prompt của riêng bạn để làm nhiệm vụ chuyên biệt
- Hướng dẫn cài đặt
- Hướng dẫn cài đặt backend
- Cài đặt CUDA và cuDNN
- Cài đặt CUDA 11.8 (hoặc mới hơn)
- Cài đặt cuDNN 8.6.0 cho CUDA 11.x, lưu ý bạn cần đăng ký NVIDIA deveploper
- Cài đặt xong restart PC
- Cài đặt Python 3.10 x64
- Cài đặt xong restart PC
- Cài đặt virtual environment (tùy chọn)
- Vào folder backend tạo virtual environment
- Active virtual environment
- Cài đặt Python package
- Cài đặt PyTorch CUDA
- Cài đặt frontend
- Cài đặt NodeJS 18.20
- Cài đặt JS packages
- Vào folder frontend cài đặt JS packages bằng lệnh:
- Lệnh này sẽ cài packages vào folder node_modules, dung lượng sau khi cài khoảng 100MB
- Chạy web server
- Chạy
- 페이지 수
- 7 페이지
- 업로더
- Uni24h
설명
Trích nội dung tài liệu
Hướng dẫn chạy Deepseek OCR trên Windows 10 Tiền đề bài viết DeepSeek-OCR là một mô hình nhận diện ký tự quang học (OCR: Optical Character Recognition) được phát triển bởi DeepSeek AI – một công ty AI tại Trung Quốc. DeepSeek-OCR mới vừa ra đời không lâu nhưng đã thu hút sự chú ý bởi khả năng nhận diện ký tự rất chính xác và quan trọng là chạy offline. Vì vậy, đây là 1 công nghệ giàu tiềm năng ứng dụng trong tương lai. Bài viết này sẽ hướng dẫn các bạn trải nghiệm Deepseek OCR nhanh chóng và dễ dàng nhất. Lưu ý: bạn cần có GPU NVIDIA hỗ trợ CUDA để chạy. Giới thiệu về Deepseek OCR DeepSeek-OCR sử dụng một kiến trúc hai thành phần chính: 1| hubdocu.com DeepEncoder: bộ mã hoá hình ảnh – nó nhận vào hình ảnh (chẳng hạn một trang scan) rồi chuyển đổi thành các “vision tokens” (tức là các đại diện số học cho vùng hình ảnh) thông qua một kiến trúc kết hợp giữa perception local (ví dụ như SAM-type attention) và global understanding (ví dụ như CLIP-type). DeepSeek3B-MoE (Mixture-of-Experts) decoder: thành phần giải mã – nó nhận các vision tokens đã được nén rồi tái cấu trúc thành văn bản bằng cách sử dụng mô hình ngôn ngữ dạng Mixture-of-Experts. Một yếu tố rất khác ở DeepSeek-OCR là optical context compression (nén bối cảnh thông qua bản đồ 2D hình ảnh) — tức là mô hình không chỉ xem hình ảnh để lấy ký tự mà sử dụng việc “render hình ảnh từ văn bản/hoặc từ hình ảnh tài liệu” như một bước trung gian để giảm số lượng token cần xử lý khi so với việc chỉ xử lý văn bản thuần túy. VD: việc chuyển một trang văn bản sang hình ảnh rồi từ hình ảnh đó trích văn bản lại cho phép giảm tỷ lệ token tới 7-20 lần so với việc dùng token chỉ từ văn bản. 2| hubdocu.com Ngoài ra, mô hình hỗ trợ chế độ đa độ phân giải (“multi-resolution design”) để xử lý các tài liệu có kết cấu phức tạp (bảng biểu, nhiều cột, ảnh chụp màn hình, v.v) hiệu quả hơn. Cuối cùng, DeepSeek-OCR được phổ biến rộng rãi dưới dạng open-source để bạn chạy trên máy tính của mình. Giới thiệu về deepseek_ocr_a
자주 묻는 질문
이 문서는 무료인가요?
네. “Hướng dẫn chạy Deepseek OCR trên Windows 10” 문서는 무료입니다. 로그인 후 '다운로드'를 클릭하여 원본 파일을 받으세요.
이 문서는 몇 페이지로 되어 있나요?
이 문서는 7페이지입니다. 다운로드하기 전에 온라인으로 미리 볼 수 있습니다.
다운로드하기 전에 미리 볼 수 있나요?
네. 이 페이지의 온라인 리더를 통해 문서를 미리 본 후 다운로드 여부를 결정할 수 있습니다.
Hướng dẫn chạy Deepseek OCR trên Windows 10
미리보기 생성 중...
Trích nội dung tài liệu
Hướng dẫn chạy Deepseek OCR trên Windows 10 Tiền đề bài viết DeepSeek-OCR là một mô hình nhận diện ký tự quang học (OCR: Optical Character Recognition) được phát triển bởi DeepSeek AI – một công ty AI tại Trung Quốc. DeepSeek-OCR mới vừa ra đời không lâu nhưng đã thu hút sự chú ý bởi khả năng nhận diện ký tự rất chính xác và quan trọng là chạy offline. Vì vậy, đây là 1 công nghệ giàu tiềm năng ứng dụng trong tương lai. Bài viết này sẽ hướng dẫn các bạn trải nghiệm Deepseek OCR nhanh chóng và dễ dàng nhất. Lưu ý: bạn cần có GPU NVIDIA hỗ trợ CUDA để chạy. Giới thiệu về Deepseek OCR DeepSeek-OCR sử dụng một kiến trúc hai thành phần chính: 1| hubdocu.com DeepEncoder: bộ mã hoá hình ảnh – nó nhận vào hình ảnh (chẳng hạn một trang scan) rồi chuyển đổi thành các “vision tokens” (tức là các đại diện số học cho vùng hình ảnh) thông qua một kiến trúc kết hợp giữa perception local (ví dụ như SAM-type attention) và global understanding (ví dụ như CLIP-type). DeepSeek3B-MoE (Mixture-of-Experts) decoder: thành phần giải mã – nó nhận các vision tokens đã được nén rồi tái cấu trúc thành văn bản bằng cách sử dụng mô hình ngôn ngữ dạng Mixture-of-Experts. Một yếu tố rất khác ở DeepSeek-OCR là optical context compression (nén bối cảnh thông qua bản đồ 2D hình ảnh) — tức là mô hình không chỉ xem hình ảnh để lấy ký tự mà sử dụng việc “render hình ảnh từ văn bản/hoặc từ hình ảnh tài liệu” như một bước trung gian để giảm số lượng token cần xử lý khi so với việc chỉ xử lý văn bản thuần túy. VD: việc chuyển một trang văn bản sang hình ảnh rồi từ hình ảnh đó trích văn bản lại cho phép giảm tỷ lệ token tới 7-20 lần so với việc dùng token chỉ từ văn bản. 2| hubdocu.com Ngoài ra, mô hình hỗ trợ chế độ đa độ phân giải (“multi-resolution design”) để xử lý các tài liệu có kết cấu phức tạp (bảng biểu, nhiều cột, ảnh chụp màn hình, v.v) hiệu quả hơn. Cuối cùng, DeepSeek-OCR được phổ biến rộng rãi dưới dạng open-source để bạn chạy trên máy tính của mình. Giới thiệu về deepseek_ocr_a
- 문서명
- Hướng dẫn chạy Deepseek OCR trên Windows 10
- 내용
- Tài liệu hướng dẫn cài đặt và sử dụng Deepseek OCR trên Windows 10, giới thiệu về mô hình, kiến trúc, ứng dụng đi kèm và các bước thiết lập môi trường cần thiết.
- 목차
- Hướng dẫn chạy Deepseek OCR trên Windows 10
- Tiền đề bài viết
- Bài viết này sẽ hướng dẫn các bạn trải nghiệm Deepseek OCR nhanh chóng và dễ dàng nhất.
- Lưu ý: bạn cần có GPU NVIDIA hỗ trợ CUDA để chạy.
- Giới thiệu về Deepseek OCR
- DeepSeek-OCR sử dụng một kiến trúc hai thành phần chính:
- DeepEncoder: bộ mã hoá hình ảnh
- DeepSeek3B-MoE (Mixture-of-Experts) decoder: thành phần giải mã
- Một yếu tố rất khác ở DeepSeek-OCR là optical context compression (nén bối cảnh thông qua bản đồ 2D hình ảnh)
- VD: việc chuyển một trang văn bản sang hình ảnh rồi từ hình ảnh đó trích văn bản lại cho phép giảm tỷ lệ token tới 7-20 lần so với việc dùng token chỉ từ văn bản.
- Ngoài ra, mô hình hỗ trợ chế độ đa độ phân giải (“multi-resolution design”)
- Cuối cùng, DeepSeek-OCR được phổ biến rộng rãi dưới dạng open-source để bạn chạy trên máy tính của mình.
- Giới thiệu về deepseek_ocr_app
- Repository này có tên DeepSeek OCR – React + FastAPI, được phát triển bởi rdumasia303.
- Ứng dụng kết hợp Frontend: React 18 + Vite 5 + Tailwind CSS + Framer Motion và Backend: FastAPI + PyTorch + Transformers.
- Với giao diện đẹp, chạy mượt mà ổn định thì đây là 1 repository rất tốt để các bạn trải nghiệm.
- Chức năng của chương trình:
- Chuyển hóa hình ảnh scan, ảnh chụp, file chứa văn bản (hóa đơn, báo cáo, sách…) thành văn bản
- Bạn có thể tìm một từ/ngữ trong hình ảnh, và ứng dụng sẽ đánh dấu vị trí với hộp bounding box.
- Tạo mô tả thông minh cho hình ảnh: bản ứng dụng hỗ trợ chế độ “Describe” – cho phép mô hình mô tả nội dung hình ảnh
- Bạn có thể nhập prompt của riêng bạn để làm nhiệm vụ chuyên biệt
- Hướng dẫn cài đặt
- Hướng dẫn cài đặt backend
- Cài đặt CUDA và cuDNN
- Cài đặt CUDA 11.8 (hoặc mới hơn)
- Cài đặt cuDNN 8.6.0 cho CUDA 11.x, lưu ý bạn cần đăng ký NVIDIA deveploper
- Cài đặt xong restart PC
- Cài đặt Python 3.10 x64
- Cài đặt xong restart PC
- Cài đặt virtual environment (tùy chọn)
- Vào folder backend tạo virtual environment
- Active virtual environment
- Cài đặt Python package
- Cài đặt PyTorch CUDA
- Cài đặt frontend
- Cài đặt NodeJS 18.20
- Cài đặt JS packages
- Vào folder frontend cài đặt JS packages bằng lệnh:
- Lệnh này sẽ cài packages vào folder node_modules, dung lượng sau khi cài khoảng 100MB
- Chạy web server
- Chạy
- 페이지 수
- 7 페이지
- 업로더
- Uni24h
댓글 (0)
댓글이 없습니다. 첫 댓글을 남겨보세요!
Ngân hàng đề thi môn: Hệ thống thông tin quản lý
Đề thi môn Cơ sở dữ liệu (kèm Đáp án) - Đại học Sư phạm kỹ thuật
Đề thi và đáp án môn Hệ thống thông tin kế toán
Đề thi và đáp án môn Cấu trúc dữ liệu giải thuật
Đáp án đề thi môn Mạng máy tính - ĐH Công nghệ thông tin (CNTT)
Tổng hợp Đề Toán 5 - Luyện thi vào Lớp 6 - CLB EMath
Bài giảng vật lý đại cương (Chương 3) - Đỗ Ngọc Uấn
Chương 8.Nguyên tử - Vật lý đại cương 3 - TS.Nguyễn Thị Trang
Chương 7.Cơ học lượng tử - Vật lý đại cương 3 - TS.Nguyễn Thị Trang
Chương 6.Quang học lượng tử - Vật lý đại cương 3 - TS.Nguyễn Thị Trang

댓글 (0)
댓글이 없습니다. 첫 댓글을 남겨보세요!