#họcsau — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #họcsau, aggregated by home.social.
-
DeepSeek ra mắt mHC – đột phá cải tiến kết nối_residual, thứ mà cả làng AI từng nghĩ chẳng cần thay đổi. Với mHC, mạng học sâu có thể điều chỉnh linh hoạt giữa thông tin cũ và mới, nhờ cơ chế "trung bình có trọng số" ổn định. Hiệu suất tăng, độ ổn định cao (tăng cường độ từ 3000x xuống chỉ còn 1.6), chi phí chỉ +6% thời gian train. Quan trọng: họ mở mã, vì tiến bộ chung. #DeepSeek #mHC #AI #MachineLearning #TríTuệNhânTạo #HọcSâu #OpenSource
-
Huấn luyện mô hình 8B để điều phối GPT-5 đòi hỏi 16 GPU H100 vì sử dụng GRPO thay PPO, giảm bộ nhớ nhưng cần batch lớn hơn. Băng thông NVLink thành điểm nghẽn do đồng bộ gradient trong FSDP. Đóng gói chuỗi (sequence packing) giúp tiết kiệm 90% tài nguyên khi xử lý hành trình agent từ 500 đến 12K token. #AI #LLM #DeepLearning #GRPO #H100 #NVIDIA #TríTuệNhânTạo #HọcSâu #MạngNeural
https://www.reddit.com/r/LocalLLaMA/comments/1pzqcuh/why_training_an_8b_orchestrator_needs_16_h100s/
-
Một người dùng đang cân nhắc nâng cấp từ RTX 4080 lên 2x RTX 3090 cũ (khoảng $800) để chạy các mô hình ngôn ngữ lớn (LLM) 70B cục bộ. Các mô hình 14B hiện tại không đủ mạnh, đặc biệt với tiếng Hàn. Người này lo ngại liệu cấu hình 2x 3090 có bền vững lâu dài khi công nghệ đang chuyển dịch sang bộ nhớ hợp nhất.
#LLM #AI #Hardware #RTX3090 #RTX4080 #DeepLearning #TríTuệNhânTạo #PhầnCứng #HọcSâuhttps://www.reddit.com/r/LocalLLaMA/comments/1pvacv8/thoughts_on_picking_up_dual_rtx_3090s_at_this/
-
SRL (Học tăng cường có giám sát) là gì mà đáng chú ý? Nó giúp các mô hình nhỏ học được nhiệm vụ phức tạp mà RL truyền thống và SFT gặp khó khăn. Thay vì chỉ thưởng kết quả cuối cùng, SRL thưởng cho từng bước suy luận trung gian, giúp mô hình học dần dần và vượt qua vấn đề "khởi đầu lạnh". Công nghệ này mở ra tiềm năng lớn cho AI quy mô nhỏ!
#SRL #SupervisedReinforcementLearning #AI #MachineLearning #LLM #DeepLearning
#HọcTangCườngCóGiámSát #TríTuệNhânTạo #HọcMáy #MôHìnhNgônNgữLớn #HọcSâuhttps
-
Một kho GitHub tuyệt vời dành cho kỹ sư ML/DL! Chứa đầy tài nguyên, sách PDF miễn phí và hướng dẫn thân thiện cho người mới bắt đầu. Rất hữu ích cho ai đang học hoặc củng cố kiến thức nền tảng.
#ML #DL #GitHub #MachineLearning #DeepLearning #HọcMáy #HọcSâu #TàiNguyên #LậpTrình
https://www.reddit.com/r/programming/comments/1pku6zr/a_git_repo_for_mldl_engineers/
-
Mô hình AI nhỏ Hito 1.7B, được tinh chỉnh chỉ với ~300 ví dụ, nay có thể đếm chính xác chữ 'r' trong từ 'strawberry' (3 chữ), vượt trội nhiều AI lớn hơn. Đây là bằng chứng cho thấy các mô thức tư duy phức tạp có thể được chuyển giao sang các mô hình nhỏ hơn. Hito sử dụng các 'thẻ tư duy' nội bộ để suy luận và tự sửa lỗi. Một bước tiến thú vị trong AI!
#AI #Hito #LLM #FineTuning #SmallModels #Reasoning
#TríTuệNhânTạo #HọcSâu #MôHìnhNgônNgữ #TinhChỉnhAI -
Một công cụ tương tác mới giúp giải thích kiến trúc Transformer, tích hợp trợ lý AI để giải đáp thắc mắc. Rất hữu ích cho những ai muốn tìm hiểu về AI và machine learning!
#Transformer #AI #MachineLearning #InteractiveTool #DeepLearning
#KiếnTrúcTransformer #TríTuệNhânTạo #HọcMáy #CôngCụTươngTác #HọcSâuhttps://www.reddit.com/r/SideProject/comments/1pb8hl8/interactive_transformer/
-
🔬 Hướng dẫn VGG19 Transfer Learning dành cho người mới bắt đầu. Bài viết hướng dẫn chi tiết cách sử dụng VGG19 cho phân loại ảnh máy bay, điều chỉnh lớp cuối cùng và quy trình huấn luyện đầy đủ. #MachineLearning #DeepLearning #ComputerVision #HọcMáy #HọcSâu #XửLýẢnh #VGG19
-
Phương pháp "Trajectory Distillation" giúp giảm chi phí huấn luyện các mô hình lớn (Foundation Models) mà vẫn giữ được khả năng suy luận sâu. Qwen3-8B đạt 74.4% trên AIME'24 với chi phí thấp hơn 10 lần so với RL. #AI #MachineLearning #DeepLearning #TríTuệNhânTạo #HọcMáy #HọcSâu
https://www.reddit.com/r/LocalLLaMA/comments/1ooytlg/trajectory_distillation_for_foundation_models/
-
Nghiên cứu mới giới thiệu một bộ tiêu chuẩn có thể tái tạo để dự báo năng lượng, so sánh hiệu suất của các mô hình tiên tiến như PatchTST, Autoformer, Informer với các phương pháp truyền thống. Mục tiêu là cung cấp nền tảng đáng tin cậy cho việc phát triển và đánh giá thuật toán dự báo.
#DựBáoNăngLượng #TiêuChuẩn #HọcSâu #KhoaHọcDữLiệu #EnergyForecasting #Benchmark #DeepLearning #DataScience
-
"GPU Poor LLM Arena" đã trở lại! Nền tảng thử nghiệm LLM dành cho GPU yếu nay có thêm các mẫu mới: Granite 4.0 (Small, Tiny, Micro), Qwen 3 (4B, 30B), OpenAI gpt-oss. Lưu ý một số mẫu lớn có thể yêu cầu cấu hình cao hơn. Các mẫu sử dụng định dạng Unsloth GGUFs tối ưu.
#LLM #GPU #AI #LocalLLaMA #NLP #Arena #DeepLearning #TríTuệNhânTạo #HọcSâu #MôHìnhNgônNgữLớn
https://www.reddit.com/r/LocalLLaMA/comments/1o4mwet/gpu_poor_llm_arena_is_back/
-
Nghiên cứu mới giới thiệu LLM-JEPA, kết hợp LLM với kiến trúc dự đoán nhúng chung (JEPA) từ thị giác máy tính. Phương pháp này cải thiện đáng kể quá trình huấn luyện LLM, giúp chúng hoạt động hiệu quả hơn và chống overfitting. LLM-JEPA áp dụng cho cả pretraining và finetuning, mở ra tiềm năng lớn cho phát triển AI.
#LLM #AI #DeepLearning #Research #MachineLearning
#MôHìnhNgônNgữLớn #TríTuệNhânTạo #HọcSâu #NghiênCứuhttps://www.reddit.com/r/LocalLLaMA/comments/1o4av71/llmjepa_large_language_mode
-
Quy tắc chung: mô hình AI lớn lượng tử hóa thường tốt hơn mô hình nhỏ ít lượng tử hóa. Nhưng liệu quy tắc này có đúng khi lượng tử hóa sâu hơn (dưới 4-bit)? Người dùng GLM 4.5 nhận thấy bản 2-bit vẫn rất hiệu quả. Bạn có kinh nghiệm/quy tắc nào khi chọn mô hình lớn/nhỏ với các mức lượng tử hóa khác nhau?
#AI #LLM #Quantization #DeepLearning #MôHìnhNgônNgữ #LượngTửHóa #HọcSâu
-
Open-source LLMs liệu có thể vượt mặt các công ty closed-source như Claude, Grok, ChatGPT? Dù các "ông lớn" được đầu tư hàng tỷ đô, DeepSeek đã chứng minh khả năng tạo đột phá. Liệu open-source có thể làm nên chuyện? 🤔
#AI #OpenSource #LLM #DeepLearning #TríTuệNhânTạo #MãNguồnMở #HọcSâu