home.social

#họcsau — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #họcsau, aggregated by home.social.

fetched live
  1. DeepSeek ra mắt mHC – đột phá cải tiến kết nối_residual, thứ mà cả làng AI từng nghĩ chẳng cần thay đổi. Với mHC, mạng học sâu có thể điều chỉnh linh hoạt giữa thông tin cũ và mới, nhờ cơ chế "trung bình có trọng số" ổn định. Hiệu suất tăng, độ ổn định cao (tăng cường độ từ 3000x xuống chỉ còn 1.6), chi phí chỉ +6% thời gian train. Quan trọng: họ mở mã, vì tiến bộ chung. #DeepSeek #mHC #AI #MachineLearning #TríTuệNhânTạo #HọcSâu #OpenSource

    reddit.com/r/singularity/comme

  2. Huấn luyện mô hình 8B để điều phối GPT-5 đòi hỏi 16 GPU H100 vì sử dụng GRPO thay PPO, giảm bộ nhớ nhưng cần batch lớn hơn. Băng thông NVLink thành điểm nghẽn do đồng bộ gradient trong FSDP. Đóng gói chuỗi (sequence packing) giúp tiết kiệm 90% tài nguyên khi xử lý hành trình agent từ 500 đến 12K token. #AI #LLM #DeepLearning #GRPO #H100 #NVIDIA #TríTuệNhânTạo #HọcSâu #MạngNeural

    reddit.com/r/LocalLLaMA/commen

  3. Một người dùng đang cân nhắc nâng cấp từ RTX 4080 lên 2x RTX 3090 cũ (khoảng $800) để chạy các mô hình ngôn ngữ lớn (LLM) 70B cục bộ. Các mô hình 14B hiện tại không đủ mạnh, đặc biệt với tiếng Hàn. Người này lo ngại liệu cấu hình 2x 3090 có bền vững lâu dài khi công nghệ đang chuyển dịch sang bộ nhớ hợp nhất.
    #LLM #AI #Hardware #RTX3090 #RTX4080 #DeepLearning #TríTuệNhânTạo #PhầnCứng #HọcSâu

    reddit.com/r/LocalLLaMA/commen

  4. SRL (Học tăng cường có giám sát) là gì mà đáng chú ý? Nó giúp các mô hình nhỏ học được nhiệm vụ phức tạp mà RL truyền thống và SFT gặp khó khăn. Thay vì chỉ thưởng kết quả cuối cùng, SRL thưởng cho từng bước suy luận trung gian, giúp mô hình học dần dần và vượt qua vấn đề "khởi đầu lạnh". Công nghệ này mở ra tiềm năng lớn cho AI quy mô nhỏ!

    #SRL #SupervisedReinforcementLearning #AI #MachineLearning #LLM #DeepLearning
    #HọcTangCườngCóGiámSát #TríTuệNhânTạo #HọcMáy #MôHìnhNgônNgữLớn #HọcSâu

    https

  5. Một kho GitHub tuyệt vời dành cho kỹ sư ML/DL! Chứa đầy tài nguyên, sách PDF miễn phí và hướng dẫn thân thiện cho người mới bắt đầu. Rất hữu ích cho ai đang học hoặc củng cố kiến thức nền tảng.

    #ML #DL #GitHub #MachineLearning #DeepLearning #HọcMáy #HọcSâu #TàiNguyên #LậpTrình

    reddit.com/r/programming/comme

  6. Mô hình AI nhỏ Hito 1.7B, được tinh chỉnh chỉ với ~300 ví dụ, nay có thể đếm chính xác chữ 'r' trong từ 'strawberry' (3 chữ), vượt trội nhiều AI lớn hơn. Đây là bằng chứng cho thấy các mô thức tư duy phức tạp có thể được chuyển giao sang các mô hình nhỏ hơn. Hito sử dụng các 'thẻ tư duy' nội bộ để suy luận và tự sửa lỗi. Một bước tiến thú vị trong AI!

    #AI #Hito #LLM #FineTuning #SmallModels #Reasoning
    #TríTuệNhânTạo #HọcSâu #MôHìnhNgônNgữ #TinhChỉnhAI

    reddit.com/r/LocalLLaMA/commen

  7. 🔬 Hướng dẫn VGG19 Transfer Learning dành cho người mới bắt đầu. Bài viết hướng dẫn chi tiết cách sử dụng VGG19 cho phân loại ảnh máy bay, điều chỉnh lớp cuối cùng và quy trình huấn luyện đầy đủ. #MachineLearning #DeepLearning #ComputerVision #HọcMáy #HọcSâu #XửLýẢnh #VGG19

    reddit.com/r/SideProject/comme

  8. Phương pháp "Trajectory Distillation" giúp giảm chi phí huấn luyện các mô hình lớn (Foundation Models) mà vẫn giữ được khả năng suy luận sâu. Qwen3-8B đạt 74.4% trên AIME'24 với chi phí thấp hơn 10 lần so với RL. #AI #MachineLearning #DeepLearning #TríTuệNhânTạo #HọcMáy #HọcSâu

    reddit.com/r/LocalLLaMA/commen

  9. Nghiên cứu mới giới thiệu một bộ tiêu chuẩn có thể tái tạo để dự báo năng lượng, so sánh hiệu suất của các mô hình tiên tiến như PatchTST, Autoformer, Informer với các phương pháp truyền thống. Mục tiêu là cung cấp nền tảng đáng tin cậy cho việc phát triển và đánh giá thuật toán dự báo.

    #DựBáoNăngLượng #TiêuChuẩn #HọcSâu #KhoaHọcDữLiệu #EnergyForecasting #Benchmark #DeepLearning #DataScience

    reddit.com/r/LocalLLaMA/commen

  10. "GPU Poor LLM Arena" đã trở lại! Nền tảng thử nghiệm LLM dành cho GPU yếu nay có thêm các mẫu mới: Granite 4.0 (Small, Tiny, Micro), Qwen 3 (4B, 30B), OpenAI gpt-oss. Lưu ý một số mẫu lớn có thể yêu cầu cấu hình cao hơn. Các mẫu sử dụng định dạng Unsloth GGUFs tối ưu.

    #LLM #GPU #AI #LocalLLaMA #NLP #Arena #DeepLearning #TríTuệNhânTạo #HọcSâu #MôHìnhNgônNgữLớn

    reddit.com/r/LocalLLaMA/commen

  11. Nghiên cứu mới giới thiệu LLM-JEPA, kết hợp LLM với kiến trúc dự đoán nhúng chung (JEPA) từ thị giác máy tính. Phương pháp này cải thiện đáng kể quá trình huấn luyện LLM, giúp chúng hoạt động hiệu quả hơn và chống overfitting. LLM-JEPA áp dụng cho cả pretraining và finetuning, mở ra tiềm năng lớn cho phát triển AI.
    #LLM #AI #DeepLearning #Research #MachineLearning
    #MôHìnhNgônNgữLớn #TríTuệNhânTạo #HọcSâu #NghiênCứu

    reddit.com/r/LocalLLaMA/commen

  12. Quy tắc chung: mô hình AI lớn lượng tử hóa thường tốt hơn mô hình nhỏ ít lượng tử hóa. Nhưng liệu quy tắc này có đúng khi lượng tử hóa sâu hơn (dưới 4-bit)? Người dùng GLM 4.5 nhận thấy bản 2-bit vẫn rất hiệu quả. Bạn có kinh nghiệm/quy tắc nào khi chọn mô hình lớn/nhỏ với các mức lượng tử hóa khác nhau?

    #AI #LLM #Quantization #DeepLearning #MôHìnhNgônNgữ #LượngTửHóa #HọcSâu

    reddit.com/r/LocalLLaMA/commen

  13. Open-source LLMs liệu có thể vượt mặt các công ty closed-source như Claude, Grok, ChatGPT? Dù các "ông lớn" được đầu tư hàng tỷ đô, DeepSeek đã chứng minh khả năng tạo đột phá. Liệu open-source có thể làm nên chuyện? 🤔

    #AI #OpenSource #LLM #DeepLearning #TríTuệNhânTạo #MãNguồnMở #HọcSâu

    i.redd.it/a1fnssvaj3uf1.png