Update bcachefs sources to 90a9c61e2b bcachefs: Switch bch2_btree_delete_range()...

[bcachefs-tools-debian] / libbcachefs / fs-io.c
diff --git a/libbcachefs/fs-io.c b/libbcachefs/fs-io.c

index 3b9b96e5a0a2f605ca15bcd7ab830c86440f5712..0a7f172f11c64c15e07beb16d591baf65286fa13 100644 (file)
--- a/libbcachefs/fs-io.c
+++ b/libbcachefs/fs-io.c
@@ -35,6 +35,15 @@
  #include <trace/events/bcachefs.h>
  #include <trace/events/writeback.h>
  
+static inline bool bio_full(struct bio *bio, unsigned len)
+{
+       if (bio->bi_vcnt >= bio->bi_max_vecs)
+               return true;
+       if (bio->bi_iter.bi_size > UINT_MAX - len)
+               return true;
+       return false;
+}
+
  static inline struct address_space *faults_disabled_mapping(void)
  {
         return (void *) (((unsigned long) current->faults_disabled_mapping) & ~1UL);
@@ -223,7 +232,10 @@ static void i_sectors_acct(struct bch_fs *c, struct bch_inode_info *inode,
                 return;
  
         mutex_lock(&inode->ei_quota_lock);
-       BUG_ON((s64) inode->v.i_blocks + sectors < 0);
+       bch2_fs_inconsistent_on((s64) inode->v.i_blocks + sectors < 0, c,
+                               "inode %lu i_blocks underflow: %llu + %lli < 0 (ondisk %lli)",
+                               inode->v.i_ino, (u64) inode->v.i_blocks, sectors,
+                               inode->ei_inode.bi_sectors);
         inode->v.i_blocks += sectors;
  
  #ifdef CONFIG_BCACHEFS_QUOTA
@@ -397,7 +409,7 @@ retry:
         offset = iter.pos.offset;
         bch2_trans_iter_exit(&trans, &iter);
  err:
-       if (ret == -EINTR)
+       if (bch2_err_matches(ret, BCH_ERR_transaction_restart))
                 goto retry;
         bch2_trans_exit(&trans);
  
@@ -830,22 +842,21 @@ out:
         return ret;
  }
  
-void bch2_invalidatepage(struct page *page, unsigned int offset,
-                        unsigned int length)
+void bch2_invalidate_folio(struct folio *folio, size_t offset, size_t length)
  {
-       if (offset || length < PAGE_SIZE)
+       if (offset || length < folio_size(folio))
                 return;
  
-       bch2_clear_page_bits(page);
+       bch2_clear_page_bits(&folio->page);
  }
  
-int bch2_releasepage(struct page *page, gfp_t gfp_mask)
+bool bch2_release_folio(struct folio *folio, gfp_t gfp_mask)
  {
-       if (PageDirty(page))
-               return 0;
+       if (folio_test_dirty(folio) || folio_test_writeback(folio))
+               return false;
  
-       bch2_clear_page_bits(page);
-       return 1;
+       bch2_clear_page_bits(&folio->page);
+       return true;
  }
  
  #ifdef CONFIG_MIGRATION
@@ -1034,10 +1045,9 @@ retry:
                  * read_extent -> io_time_reset may cause a transaction restart
                  * without returning an error, we need to check for that here:
                  */
-               if (!bch2_trans_relock(trans)) {
-                       ret = -EINTR;
+               ret = bch2_trans_relock(trans);
+               if (ret)
                         break;
-               }
  
                 bch2_btree_iter_set_pos(&iter,
                                 POS(inum.inum, rbio->bio.bi_iter.bi_sector));
@@ -1062,8 +1072,6 @@ retry:
  
                 sectors = min(sectors, k.k->size - offset_into_extent);
  
-               bch2_trans_unlock(trans);
-
                 if (readpages_iter)
                         readpage_bio_extend(readpages_iter, &rbio->bio, sectors,
                                             extent_partial_reads_expensive(k));
@@ -1092,7 +1100,7 @@ retry:
  err:
         bch2_trans_iter_exit(trans, &iter);
  
-       if (ret == -EINTR)
+       if (bch2_err_matches(ret, BCH_ERR_transaction_restart))
                 goto retry;
  
         if (ret) {
@@ -1129,12 +1137,12 @@ void bch2_readahead(struct readahead_control *ractl)
                                    readpages_iter.idx,
                                    BIO_MAX_VECS);
                 struct bch_read_bio *rbio =
-                       rbio_init(bio_alloc_bioset(GFP_NOFS, n, &c->bio_read),
+                       rbio_init(bio_alloc_bioset(NULL, n, REQ_OP_READ,
+                                                  GFP_NOFS, &c->bio_read),
                                   opts);
  
                 readpages_iter.idx++;
  
-               bio_set_op_attrs(&rbio->bio, REQ_OP_READ, 0);
                 rbio->bio.bi_iter.bi_sector = (sector_t) index << PAGE_SECTORS_SHIFT;
                 rbio->bio.bi_end_io = bch2_readpages_end_io;
                 BUG_ON(!bio_add_page(&rbio->bio, page, PAGE_SIZE, 0));
@@ -1166,20 +1174,6 @@ static void __bchfs_readpage(struct bch_fs *c, struct bch_read_bio *rbio,
         bch2_trans_exit(&trans);
  }
  
-int bch2_readpage(struct file *file, struct page *page)
-{
-       struct bch_inode_info *inode = to_bch_ei(page->mapping->host);
-       struct bch_fs *c = inode->v.i_sb->s_fs_info;
-       struct bch_io_opts opts = io_opts(c, &inode->ei_inode);
-       struct bch_read_bio *rbio;
-
-       rbio = rbio_init(bio_alloc_bioset(GFP_NOFS, 1, &c->bio_read), opts);
-       rbio->bio.bi_end_io = bch2_readpages_end_io;
-
-       __bchfs_readpage(c, rbio, inode_inum(inode), page);
-       return 0;
-}
-
  static void bch2_read_single_page_end_io(struct bio *bio)
  {
         complete(bio->bi_private);
@@ -1194,7 +1188,7 @@ static int bch2_read_single_page(struct page *page,
         int ret;
         DECLARE_COMPLETION_ONSTACK(done);
  
-       rbio = rbio_init(bio_alloc_bioset(GFP_NOFS, 1, &c->bio_read),
+       rbio = rbio_init(bio_alloc_bioset(NULL, 1, REQ_OP_READ, GFP_NOFS, &c->bio_read),
                          io_opts(c, &inode->ei_inode));
         rbio->bio.bi_private = &done;
         rbio->bio.bi_end_io = bch2_read_single_page_end_io;
@@ -1212,6 +1206,16 @@ static int bch2_read_single_page(struct page *page,
         return 0;
  }
  
+int bch2_read_folio(struct file *file, struct folio *folio)
+{
+       struct page *page = &folio->page;
+       int ret;
+
+       ret = bch2_read_single_page(page, page->mapping);
+       folio_unlock(folio);
+       return ret;
+}
+
  /* writepages: */
  
  struct bch_writepage_state {
@@ -1280,7 +1284,7 @@ static void bch2_writepage_io_done(struct closure *cl)
          * racing with fallocate can cause us to add fewer sectors than
          * expected - but we shouldn't add more sectors than expected:
          */
-       WARN_ON(io->op.i_sectors_delta > 0);
+       WARN_ON_ONCE(io->op.i_sectors_delta > 0);
  
         /*
          * (error (due to going RO) halfway through a page can screw that up
@@ -1329,7 +1333,9 @@ static void bch2_writepage_io_alloc(struct bch_fs *c,
  {
         struct bch_write_op *op;
  
-       w->io = container_of(bio_alloc_bioset(GFP_NOFS, BIO_MAX_VECS,
+       w->io = container_of(bio_alloc_bioset(NULL, BIO_MAX_VECS,
+                                             REQ_OP_WRITE,
+                                             GFP_NOFS,
                                               &c->writepage_bioset),
                              struct bch_writepage_io, op.wbio.bio);
  
@@ -1466,8 +1472,8 @@ do_io:
                                      sectors << 9, offset << 9));
  
                 /* Check for writing past i_size: */
-               WARN_ON((bio_end_sector(&w->io->op.wbio.bio) << 9) >
-                       round_up(i_size, block_bytes(c)));
+               WARN_ON_ONCE((bio_end_sector(&w->io->op.wbio.bio) << 9) >
+                            round_up(i_size, block_bytes(c)));
  
                 w->io->op.res.sectors += reserved_sectors;
                 w->io->op.i_sectors_delta -= dirty_sectors;
@@ -1498,24 +1504,10 @@ int bch2_writepages(struct address_space *mapping, struct writeback_control *wbc
         return ret;
  }
  
-int bch2_writepage(struct page *page, struct writeback_control *wbc)
-{
-       struct bch_fs *c = page->mapping->host->i_sb->s_fs_info;
-       struct bch_writepage_state w =
-               bch_writepage_state_init(c, to_bch_ei(page->mapping->host));
-       int ret;
-
-       ret = __bch2_writepage(page, wbc, &w);
-       if (w.io)
-               bch2_writepage_do_io(&w);
-
-       return ret;
-}
-
  /* buffered writes: */
  
  int bch2_write_begin(struct file *file, struct address_space *mapping,
-                    loff_t pos, unsigned len, unsigned flags,
+                    loff_t pos, unsigned len,
                      struct page **pagep, void **fsdata)
  {
         struct bch_inode_info *inode = to_bch_ei(mapping->host);
@@ -1535,7 +1527,7 @@ int bch2_write_begin(struct file *file, struct address_space *mapping,
  
         bch2_pagecache_add_get(&inode->ei_pagecache_lock);
  
-       page = grab_cache_page_write_begin(mapping, index, flags);
+       page = grab_cache_page_write_begin(mapping, index);
         if (!page)
                 goto err_unlock;
  
@@ -1666,7 +1658,7 @@ static int __bch2_buffered_write(struct bch_inode_info *inode,
         bch2_page_reservation_init(c, inode, &res);
  
         for (i = 0; i < nr_pages; i++) {
-               pages[i] = grab_cache_page_write_begin(mapping, index + i, 0);
+               pages[i] = grab_cache_page_write_begin(mapping, index + i);
                 if (!pages[i]) {
                         nr_pages = i;
                         if (!i) {
@@ -1810,11 +1802,11 @@ again:
                  * to check that the address is actually valid, when atomic
                  * usercopies are used, below.
                  */
-               if (unlikely(iov_iter_fault_in_readable(iter, bytes))) {
+               if (unlikely(fault_in_iov_iter_readable(iter, bytes))) {
                         bytes = min_t(unsigned long, iov_iter_count(iter),
                                       PAGE_SIZE - offset);
  
-                       if (unlikely(iov_iter_fault_in_readable(iter, bytes))) {
+                       if (unlikely(fault_in_iov_iter_readable(iter, bytes))) {
                                 ret = -EFAULT;
                                 break;
                         }
@@ -1872,7 +1864,7 @@ static void bch2_dio_read_complete(struct closure *cl)
  {
         struct dio_read *dio = container_of(cl, struct dio_read, cl);
  
-       dio->req->ki_complete(dio->req, dio->ret, 0);
+       dio->req->ki_complete(dio->req, dio->ret);
         bio_check_or_release(&dio->rbio.bio, dio->should_dirty);
  }
  
@@ -1920,8 +1912,10 @@ static int bch2_direct_IO_read(struct kiocb *req, struct iov_iter *iter)
         shorten = iov_iter_count(iter) - round_up(ret, block_bytes(c));
         iter->count -= shorten;
  
-       bio = bio_alloc_bioset(GFP_KERNEL,
-                              iov_iter_npages(iter, BIO_MAX_VECS),
+       bio = bio_alloc_bioset(NULL,
+                              bio_iov_vecs_to_alloc(iter, BIO_MAX_VECS),
+                              REQ_OP_READ,
+                              GFP_KERNEL,
                                &c->dio_read_bioset);
  
         bio->bi_end_io = bch2_direct_IO_read_endio;
@@ -1955,8 +1949,10 @@ static int bch2_direct_IO_read(struct kiocb *req, struct iov_iter *iter)
  
         goto start;
         while (iter->count) {
-               bio = bio_alloc_bioset(GFP_KERNEL,
-                                      iov_iter_npages(iter, BIO_MAX_VECS),
+               bio = bio_alloc_bioset(NULL,
+                                      bio_iov_vecs_to_alloc(iter, BIO_MAX_VECS),
+                                      REQ_OP_READ,
+                                      GFP_KERNEL,
                                        &c->bio_read);
                 bio->bi_end_io          = bch2_direct_IO_read_split_endio;
  start:
@@ -2072,7 +2068,7 @@ retry:
         offset = iter.pos.offset;
         bch2_trans_iter_exit(&trans, &iter);
  err:
-       if (err == -EINTR)
+       if (bch2_err_matches(err, BCH_ERR_transaction_restart))
                 goto retry;
         bch2_trans_exit(&trans);
  
@@ -2103,7 +2099,7 @@ static long bch2_dio_write_loop(struct dio_write *dio)
         while (1) {
                 iter_count = dio->iter.count;
  
-               if (kthread)
+               if (kthread && dio->mm)
                         kthread_use_mm(dio->mm);
                 BUG_ON(current->faults_disabled_mapping);
                 current->faults_disabled_mapping = mapping;
@@ -2113,7 +2109,7 @@ static long bch2_dio_write_loop(struct dio_write *dio)
                 dropped_locks = fdm_dropped_locks();
  
                 current->faults_disabled_mapping = NULL;
-               if (kthread)
+               if (kthread && dio->mm)
                         kthread_unuse_mm(dio->mm);
  
                 /*
@@ -2224,7 +2220,7 @@ loop:
                 if (!dio->iter.count)
                         break;
  
-               bio_reset(bio);
+               bio_reset(bio, NULL, REQ_OP_WRITE);
                 reinit_completion(&dio->done);
         }
  
@@ -2246,7 +2242,7 @@ err:
         inode_dio_end(&inode->v);
  
         if (!sync) {
-               req->ki_complete(req, ret, 0);
+               req->ki_complete(req, ret);
                 ret = -EIOCBQUEUED;
         }
         return ret;
@@ -2305,10 +2301,10 @@ ssize_t bch2_direct_write(struct kiocb *req, struct iov_iter *iter)
                 locked = false;
         }
  
-       bio = bio_alloc_bioset(GFP_KERNEL,
-                              iov_iter_is_bvec(iter)
-                              ? 0
-                              : iov_iter_npages(iter, BIO_MAX_VECS),
+       bio = bio_alloc_bioset(NULL,
+                              bio_iov_vecs_to_alloc(iter, BIO_MAX_VECS),
+                              REQ_OP_WRITE,
+                              GFP_KERNEL,
                                &c->dio_write_bioset);
         dio = container_of(bio, struct dio_write, op.wbio.bio);
         init_completion(&dio->done);
@@ -2448,7 +2444,7 @@ retry:
         start = iter.pos;
         bch2_trans_iter_exit(&trans, &iter);
  err:
-       if (ret == -EINTR)
+       if (bch2_err_matches(ret, BCH_ERR_transaction_restart))
                 goto retry;
  
         bch2_trans_exit(&trans);
@@ -2705,9 +2701,11 @@ int bch2_truncate(struct user_namespace *mnt_userns,
                         U64_MAX, &i_sectors_delta);
         i_sectors_acct(c, inode, NULL, i_sectors_delta);
  
-       WARN_ON(!inode->v.i_size && inode->v.i_blocks &&
-               !bch2_journal_error(&c->journal));
-
+       bch2_fs_inconsistent_on(!inode->v.i_size && inode->v.i_blocks &&
+                               !bch2_journal_error(&c->journal), c,
+                               "inode %lu truncated to 0 but i_blocks %llu (ondisk %lli)",
+                               inode->v.i_ino, (u64) inode->v.i_blocks,
+                               inode->ei_inode.bi_sectors);
         if (unlikely(ret))
                 goto err;
  
@@ -2836,7 +2834,8 @@ static long bchfs_fcollapse_finsert(struct bch_inode_info *inode,
         bch2_trans_copy_iter(&dst, &src);
         bch2_trans_copy_iter(&del, &src);
  
-       while (ret == 0 || ret == -EINTR) {
+       while (ret == 0 ||
+              bch2_err_matches(ret, BCH_ERR_transaction_restart)) {
                 struct disk_reservation disk_res =
                         bch2_disk_reservation_init(c, 0);
                 struct bkey_i delete;
@@ -2904,13 +2903,7 @@ reassemble:
  
                 next_pos = insert ? bkey_start_pos(&delete.k) : delete.k.p;
  
-               if (copy.k->k.size == k.k->size) {
-                       /*
-                        * If we're moving the entire extent, we can skip
-                        * running triggers:
-                        */
-                       trigger_flags |= BTREE_TRIGGER_NORUN;
-               } else {
+               if (copy.k->k.size != k.k->size) {
                         /* We might end up splitting compressed extents: */
                         unsigned nr_ptrs =
                                 bch2_bkey_nr_ptrs_allocated(bkey_i_to_s_c(copy.k));
@@ -3044,7 +3037,7 @@ static int __bchfs_fallocate(struct bch_inode_info *inode, int mode,
  bkey_err:
                 bch2_quota_reservation_put(c, inode, &quota_res);
                 bch2_disk_reservation_put(c, &disk_res);
-               if (ret == -EINTR)
+               if (bch2_err_matches(ret, BCH_ERR_transaction_restart))
                         ret = 0;
         }
  
@@ -3130,7 +3123,7 @@ long bch2_fallocate_dispatch(struct file *file, int mode,
         struct bch_fs *c = inode->v.i_sb->s_fs_info;
         long ret;
  
-       if (!percpu_ref_tryget(&c->writes))
+       if (!percpu_ref_tryget_live(&c->writes))
                 return -EROFS;
  
         inode_lock(&inode->v);
@@ -3324,7 +3317,7 @@ retry:
         }
         bch2_trans_iter_exit(&trans, &iter);
  err:
-       if (ret == -EINTR)
+       if (bch2_err_matches(ret, BCH_ERR_transaction_restart))
                 goto retry;
  
         bch2_trans_exit(&trans);
@@ -3439,7 +3432,7 @@ retry:
         }
         bch2_trans_iter_exit(&trans, &iter);
  err:
-       if (ret == -EINTR)
+       if (bch2_err_matches(ret, BCH_ERR_transaction_restart))
                 goto retry;
  
         bch2_trans_exit(&trans);